1 前言
在数字音频领域,PCM 和 DSD 经常被放在一起比较。CD、WAV、FLAC、流媒体和绝大多数影视音频使用 PCM 体系;SACD、DSF、DFF 以及一些发烧音乐下载则使用 DSD。围绕两者的讨论中,还经常出现“DSD 更接近模拟”“PCM 更方便但不够自然”“DSD 的采样率高达 MHz,所以音质更好”等说法。
这些说法有的抓住了一部分技术特征,有的则把采样率、文件格式、DAC 架构、母带版本和主观听感混在了一起。PCM 和 DSD 的确采用了不同的数字表达方式,但它们面对的是同一个任务:如何把连续变化的模拟声音记录下来,再尽可能准确地还原成模拟信号。
本文从声音、电压和采样开始,依次介绍 PCM 的多位量化、DSD 的高速 1-bit 调制、过采样、反馈与噪声整形,然后讨论两者在录音、编辑、存储和播放中的实际差异。尤其会详细回答两个容易被模糊处理的问题:DSD 的每一个 0 和 1 究竟是怎样产生的,以及所谓“模拟味”到底可能来自哪里。
如果先用一句话概括全文:PCM 用较低的采样率和较多的位数直接保存幅度,DSD 用极高的时钟率和 1-bit 数据流保存局部平均趋势,并通过噪声整形把量化噪声移出主要听觉频带。
2 从声音到电压
2.1 声音是连续变化的压力
声音在空气中表现为压力随时间的变化。麦克风把这种压力变化转化为电压变化,经过前置放大后送入模数转换器 ADC。声音越强,通常对应电压摆幅越大;音调越高,对应电压变化越快。
模拟电压在时间和幅度上都是连续的。数字系统却只能保存有限个数字,因此需要完成两个离散化过程:
- 时间离散化:每隔固定时间观察一次输入,这叫采样;
- 幅度离散化:把观察到的电压归入有限个数值等级,这叫量化。
2.2 采样率与可表达带宽
采样率 $f_s$ 表示每秒采样多少次。44.1 kHz 就是每秒、每声道取得 44100 个采样值。对于最高频率为 $B$ 的理想带限信号,为避免不同频率在采样后混叠,采样率需要满足:
\[f_s > 2B\]这就是奈奎斯特采样条件。人耳通常讨论的听觉频带上限约为 20 kHz,因此 CD 选择 44.1 kHz 采样率,在 20 kHz 音频带宽之外留出一段滤波过渡带。实际 ADC 在采样前还要使用抗混叠低通滤波器,避免高于目标频带的信号折叠进音频范围。
采样并不等于把离散点用直线连接。只要原始信号受到带宽限制并满足采样条件,理论上可以通过 sinc 插值完整重建。现代 DAC 中的数字插值滤波器和模拟重建滤波器共同完成这一过程。
2.3 量化与量化误差
位深决定每个 PCM 采样值可以使用多少个二进制位。$N$ 位量化器具有:
\[2^N\]个可能的码值。16-bit 有 65536 个码值,24-bit 有 16777216 个码值。模拟输入通常不会恰好落在某个量化等级上,真实值与量化值之差就是量化误差。
对满幅正弦波和理想均匀量化器,量化信噪比常用下面的近似式估算:
\[\mathrm{SNR}\approx 6.02N+1.76\ \mathrm{dB}\]16-bit 对应约 98 dB,24-bit 理论上约 146 dB。但这不意味着一台 24-bit ADC 真能得到 146 dB 的有效动态范围。麦克风本底噪声、前置放大器、热噪声、电源、时钟和模拟电路都会先成为限制。
3 PCM 的幅度编码
3.1 一个时刻对应一个数值
PCM 是 Pulse Code Modulation,即脉冲编码调制。其核心思路十分直接:每隔固定时间测量一次输入电压,然后用一个多位二进制数保存测量结果。
假设 ADC 的归一化输入范围为 $-1$ 到 $+1$,几个连续采样可能是:
| 采样时刻 | 输入幅度 | 量化后的 PCM 数值 |
|---|---|---|
| $t_0$ | 0.00 | 0 |
| $t_1$ | 0.32 | 10485 |
| $t_2$ | 0.75 | 24575 |
| $t_3$ | 0.41 | 13434 |
| $t_4$ | -0.20 | -6554 |
表中的数字只是一个简化示例,但说明了 PCM 最关键的关系:一个采样时刻对应一个幅度数值。 采样率决定多久记录一次,位深决定每次记录可以有多细。
3.2 PCM 的优点
PCM 的优势不仅在播放,更在处理。两个采样值可以直接相加完成混音,乘以系数可以改变音量,卷积可以实现滤波,傅里叶变换可以分析频谱。均衡、压缩、混响、声像、限幅和采样率转换等数字信号处理算法,几乎都以多位 PCM 或浮点数作为自然的运算对象。
因此,从录音工作站、影视制作、广播、游戏音频到流媒体,PCM 都是最普遍的工作格式。专业软件内部还经常使用 32-bit 或 64-bit 浮点数,以获得很大的运算余量,减少中间处理中的溢出和舍入问题。
3.3 PCM 与文件格式
PCM 是声音的数字表示方法,而 WAV、AIFF、FLAC 并不是与 PCM 并列的采样技术。
| 名称 | 类型 | 说明 |
|---|---|---|
| PCM | 数字音频表示方法 | 用多位采样值表示幅度 |
| WAV、AIFF | 容器格式 | 通常封装未压缩 PCM,也能容纳其他编码 |
| FLAC、ALAC | 无损压缩格式 | 解码后恢复出完全相同的 PCM 数据 |
| MP3、AAC、Opus | 有损压缩格式 | 利用听觉模型舍弃部分信息以降低码率 |
所以,FLAC 与 WAV 在解码得到相同 PCM 数据、播放链路正常的条件下,并不存在“压缩过所以波形不完整”的问题。
4 DSD 的脉冲密度编码
4.1 单个比特不能表示精确幅度
DSD 是 Direct Stream Digital。经典 DSD 每个采样时刻只有 1 bit,因此只能保存 0 或 1。放到电路中,也可以理解为输出只能在两个固定电平之间切换,例如 $-V_{\mathrm{ref}}$ 和 $+V_{\mathrm{ref}}$。
这马上带来一个问题:如果只能输出最高和最低两个电平,中间的电压如何表示?答案不是让某一个比特携带精确幅度,而是观察一小段时间内正负脉冲的比例。正脉冲多,局部平均值为正;负脉冲多,局部平均值为负;两者接近各半,局部平均值接近零。
4.2 DSD 与脉冲密度调制
DSD 最接近 PDM,也就是脉冲密度调制。它不是无线电中的调幅 AM 或调频 FM,也不是改变脉冲宽度的 PWM。
| 调制方式 | 发生变化的量 |
|---|---|
| AM | 高频载波的幅度 |
| FM | 高频载波的瞬时频率 |
| PWM | 每个脉冲的宽度或占空比 |
| PDM | 固定时钟下,一段时间内正负脉冲的密度 |
| DSD | 经过高阶噪声整形的高速 1-bit PDM 数据流 |
DSD 的脉冲幅度固定,每一个 bit 的时间长度也固定。它并没有一条连续正弦载波供音频去改变幅度或频率。变化的是一串 0 和 1 的排列方式,以及局部时间窗口中 1 所占的比例。
用一个最简化的双极性模型可以建立直觉。假设 1 对应 $+1$,0 对应 $-1$,在某个时间窗口中 1 的比例为 $p$,那么这一段脉冲的平均值为:
\[x=p\times(+1)+(1-p)\times(-1)=2p-1\]反过来:
\[p=\frac{x+1}{2}\]| 归一化目标幅度 | 1 的比例 | 简化后的局部序列 |
|---|---|---|
| +1.0 | 100% | 1111111111111111 |
| +0.5 | 75% | 1110111011101110 |
| 0 | 50% | 1010101010101010 |
| -0.5 | 25% | 1000100010001000 |
| -1.0 | 0% | 0000000000000000 |
这张表只是帮助理解密度与平均值的关系。真实 DSD 不是把每 16 个比特机械地排成固定比例。比特的具体位置由 Σ-Δ 调制器的当前输入、过去误差、环路滤波器状态和稳定性设计共同决定。
4.3 DSD 的真实采样过程
常见的说法是“DSD 用 1-bit ADC 以 2.8224 MHz 采样”。这句话没有错,但容易让人误以为 DSD 每隔约 354 ns 把模拟电压粗暴地判断为高或低。真实过程更接近一个不断纠错的闭环系统。
一个简化的 Σ-Δ 调制器包含求差、环路滤波、1-bit 量化器和反馈 DAC,基本过程如下:
- 模拟输入与反馈 DAC 的输出相减,得到当前误差;
- 积分器或更高阶环路滤波器累积并处理误差;
- 1-bit 量化器根据环路状态输出 0 或 1;
- 这个比特一方面成为 DSD 输出,另一方面送入 1-bit DAC;
- 反馈 DAC 产生正或负参考电平,回到输入端参与下一次求差;
- 如果此前输出偏高,负反馈会推动之后输出更多低电平;如果此前输出偏低,则推动之后输出更多高电平。
因此,单个 DSD 比特表达的不是“此刻输入电压等于多少”,而是:
调制器根据当前输入、历史误差和内部状态,决定下一个时钟周期应该输出正参考还是负参考,才能让一段时间内的平均输出跟随输入。
当输入为零时,理想输出的 1 和 0 大致各占一半;输入向正方向增加时,1 的局部密度增加;输入向负方向变化时,0 的局部密度增加。输入电压变化得多快,密度分布就随之变化得多快。
4.4 采样率与局部平均
DSD64 的时钟率为:
\[44.1\ \mathrm{kHz}\times64=2.8224\ \mathrm{MHz}\]一个 bit 周期约为:
\[\frac{1}{2.8224\ \mathrm{MHz}}\approx354\ \mathrm{ns}\]但 2.8224 MHz 不能直接与 PCM 的 44.1 kHz 比大小。PCM 的一次采样通常携带 16 bit 或 24 bit 幅度信息,DSD 的一次采样只有 1 bit。DSD 需要把许多个相邻 bit 放在一起,才能体现局部平均幅度。
观察窗口越长,密度统计越精确,但越难表示快速变化;观察窗口越短,时间跟随能力越好,但可用于估计幅度的 bit 数量更少。Σ-Δ 调制和噪声整形的意义,就是不靠简单、固定的滑动平均,而是利用反馈控制量化误差在时间和频率上的分布。
5 过采样与噪声整形
5.1 过采样提供频率空间
如果只使用 1-bit 量化而不采取其他措施,量化误差会非常大。DSD 能够工作,依靠的不只是高采样率,而是过采样与噪声整形的组合。
提高采样率后,量化噪声可以分布在更宽的频率范围中。在总噪声功率近似不变的前提下,音频频带只占整个奈奎斯特频带的一小部分,通过低通滤波便可以去掉大量带外噪声。但仅靠过采样仍不足以让 1-bit 系统获得很高的音频带内信噪比,因此还需要噪声整形。
5.2 噪声整形不消灭噪声
噪声整形利用反馈和环路滤波器改变量化误差的频谱分布。对音频信号而言,Σ-Δ 环路通常让信号保持低通特性,同时让量化误差呈现高通特性:低频量化噪声被压低,高频量化噪声被抬高。
这可以类比为整理房间:杂物并没有消失,而是从日常活动区域搬到了阁楼。音频频带是需要保持安静的房间,几十千赫兹以上的超声频带则提供了存放量化噪声的空间。
Analog Devices 对 Σ-Δ ADC 的说明也强调了这一点:过采样先把噪声铺到更宽频带,噪声整形再把更多量化噪声推向高频,后续低通滤波器负责去除带外部分。调制器阶数越高,通常可以更激进地压低带内噪声,但环路稳定性和设计复杂度也随之增加。
5.3 DSD64、DSD128 与 DSD256
| 名称 | 每声道采样率 | 相对于 44.1 kHz |
|---|---|---|
| DSD64 | 2.8224 MHz | 64 倍 |
| DSD128 | 5.6448 MHz | 128 倍 |
| DSD256 | 11.2896 MHz | 256 倍 |
| DSD512 | 22.5792 MHz | 512 倍 |
更高倍 DSD 为噪声整形和模拟滤波留下了更宽裕的频率空间,可以把噪声上升区域推得更远,或者采用较温和的滤波器。但它同时增加文件大小、接口速率和处理负担。只看 DSD 后面的倍数,不能判断录音、母带和最终播放一定更好。
6 DSD 的低通滤波
6.1 脉冲流中的音频与高频成分
直接观察 DSD 波形,会看到它始终在两个电平之间高速跳变,看起来完全不像平滑的模拟波形。这里需要把时域外观和频域成分分开。
一串高速脉冲可以分解为不同频率成分的叠加:
- 缓慢变化的脉冲平均值形成需要的音频成分;
- bit 级高速翻转形成高频能量;
- 噪声整形把大量量化误差集中到超声频段。
低通滤波器不是尝试逐个“修圆”方波边沿,而是允许低频分量通过,并衰减高频分量。高速跳变被平均后,留下的正是密度随时间变化所描述的慢速波形。
6.2 RC 平均的直观解释
最简单的一阶 RC 低通滤波器可以帮助建立直觉。电容不会在每个 354 ns 的 bit 周期内立刻充满或放空,而是对连续脉冲进行时间平均:
- 连续出现更多高电平时,电容平均电压上升;
- 高低电平接近各半时,平均电压接近中点;
- 连续出现更多低电平时,平均电压下降。
若滤波器截止频率远低于 2.8224 MHz,却高于需要保留的音频范围,它就能大幅削弱 bit 时钟和超声噪声,同时让 20 Hz~20 kHz 的音乐变化通过。
6.3 高频噪声能够被滤掉的原因
一个线性低通滤波器对每个频率给予不同增益。用 $H(f)$ 表示滤波器的频率响应,那么输出频谱为:
\[Y(f)=X(f)H(f)\]在音频频带内,$H(f)$ 接近 1,音乐信号被保留;进入超声频带后,$H(f)$ 逐渐下降,噪声被衰减。之所以可以这样做,是因为 DSD 已经主动把信号和大部分量化噪声安排在不同频率区域:需要的音乐主要在低频,代价则被推到高频。
“高频噪声在人耳听不到,所以不用管”并不严谨。即使人耳不能直接听到几十千赫兹信号,强超声能量仍可能让功放或扬声器承受额外负担,并通过非线性产生落入音频频带的互调失真。因此,DSD DAC 的模拟输出端仍需要合适的低通滤波,而不是把未经处理的 1-bit 脉冲直接送给后级。
6.4 实际滤波器的代价
理想低通滤波器可以在某个频率处垂直切断,现实滤波器却一定存在过渡带。截止频率、衰减速度、相位响应、群延迟、阶跃响应和器件误差之间需要折中。
- 截止频率过低,会影响可听频带高端的幅度和相位;
- 斜率过缓,可能留下过多超声噪声;
- 阶数很高,电路复杂度、相位变化和瞬态响应问题可能增加;
- 不同 DAC 对 DSD 的内部处理方式不同,有的直接处理 DSD,有的先转换成多位中间格式。
因此,“DSD 只需要一个简单模拟低通滤波器”描述的是理想化方向,而不是所有实际设备的完整实现。更高倍 DSD 的一个工程价值,就是让有用频带与噪声上升区之间隔得更远,从而放宽滤波器的过渡带要求。
7 DSD 的模拟味
7.1 模拟味不是可直接测量的格式属性
“模拟味”通常用来描述声音自然、连续、柔和、没有数码感,但它不是像频率响应、动态范围或总谐波失真那样具有统一定义的技术指标。不同听众使用这个词时,可能分别在描述高频质感、瞬态、空间感、失真特征、母带风格,甚至音量差异。
DSD 经常被认为更有模拟味,确实可以找到一些可能的技术和历史原因,但不能由此推导出“1-bit 天生比多位 PCM 更接近模拟”。
7.2 脉冲密度与模拟平均
DSD 的低频信息直接包含在高速脉冲的局部平均值中。理论上,一个开关式 1-bit DAC 加低通滤波器就能重建波形。这种“脉冲密度经过模拟积分后形成连续电压”的过程,在直觉上比多位 PCM 的插值、过采样和多位 DAC 更像连续模拟系统。
但“重建方式容易用模拟平均来解释”和“听起来必然更像模拟”是两件事。现代 PCM DAC 内部通常也会过采样,并转换成高速多位或少位 Σ-Δ 数据流再输出。到了芯片内部,PCM 和 DSD 的路径可能比文件标签显示的更相似。
7.3 滤波器与瞬态响应
早期 44.1 kHz PCM 系统需要在 20 kHz 音频上限与 22.05 kHz 奈奎斯特频率之间完成很陡的滤波。早期转换器和数字滤波器性能有限,陡峭滤波可能带来通带起伏、相位变化或振铃。DSD 的时钟率很高,有用频带和 bit 时钟之间相距很远,输出端可以使用过渡带较宽的模拟滤波器。这可能是 DSD 形成“自然、顺滑”声誉的技术背景之一。
但现代 PCM DAC 普遍使用过采样和高性能数字滤波,用户还可能选择线性相位、最小相位、快速滚降或慢速滚降等模式。滤波器差异仍可能影响测量结果和部分听感,但已经不能简单归结为“PCM 需要砖墙滤波,DSD 不需要滤波”。两者都需要滤波,只是噪声和镜像出现的位置、滤波链路及实现方式不同。
7.4 超声噪声与设备非线性
DSD 的超声噪声通常不是有益的音乐细节。如果它没有被充分滤除,后级电路的非线性可能把两个超声成分混合,产生差频。例如 30 kHz 和 33 kHz 的成分经过非线性系统后,可能生成 3 kHz 的互调产物,落入可听范围。
这些额外产物有时可能被主观描述为明亮、空气感、柔和或模拟感,也可能表现为粗糙和疲劳;它们取决于具体 DAC、功放和扬声器,而不是 DSD 应当保留的原始信息。因此,不能把超声噪声造成的设备相关失真当作 DSD 更高保真的证据。
7.5 母带版本差异
实际比较中最常见的问题不是格式,而是来源不同。同一张专辑的 CD、流媒体、SACD 和 DSD 下载版可能使用不同母带:
- 一个版本使用更少的动态压缩;
- 一个版本重新均衡过高频和低频;
- 一个版本来自更好的模拟母带;
- 不同版本的平均响度不同;
- DSD 版可能是面向发烧市场重新制作的版本。
此时 DSD 版听起来更自然,真正原因可能是母带处理更克制,而不是 1-bit 编码本身。只有使用同一源文件、经过受控转换、严格音量匹配并进行盲听,才能尽量把编码格式本身从其他变量中分离出来。
7.6 播放设备与心理预期
有些 DAC 为 PCM 和 DSD 使用不同数字滤波器、不同增益甚至不同模拟路径。即使输入来自同一母带,输出频率响应和电平也可能不同。很小的响度差异就可能让稍响的版本被认为更清晰、更有细节。
文件价格、封面标签、播放器显示的 DSD 标志以及试听者对某种格式的预期也会影响评价。这并不意味着主观体验是假的,而是说明“我更喜欢这个版本”和“这种编码在所有条件下更准确”属于两种不同结论。
关于高解析度音频能否被听出差异,研究结果并非一句“完全听不出”或“显著更好”可以概括。2016 年发表于 AES 的一项元分析认为,总体上存在幅度较小但有统计意义的辨别能力,并且训练会提高表现;它研究的是高解析度与标准解析度的总体比较,并不能单独证明 DSD 优于高规格 PCM。
8 数据率与文件大小
未压缩数字音频的原始数据率可以用下面的公式估算:
\[R=f_s\times N\times C\]其中 $f_s$ 是采样率,$N$ 是每次采样的位数,$C$ 是声道数。
| 格式 | 立体声原始数据率 | 三分钟理论数据量 |
|---|---|---|
| PCM 16-bit/44.1 kHz | 1.4112 Mbit/s | 约 31.8 MB |
| PCM 24-bit/96 kHz | 4.608 Mbit/s | 约 103.7 MB |
| PCM 24-bit/192 kHz | 9.216 Mbit/s | 约 207.4 MB |
| DSD64 | 5.6448 Mbit/s | 约 127.0 MB |
| DSD128 | 11.2896 Mbit/s | 约 254.0 MB |
| DSD256 | 22.5792 Mbit/s | 约 508.0 MB |
表中没有计算容器开销,也没有计算无损压缩。PCM 可以通过 FLAC、ALAC 等方式显著缩小,而且压缩率与音乐内容有关;SACD 使用 DST 对 DSD 进行无损压缩,DSF 文件通常则不使用类似 FLAC 的高效通用压缩。
9 录音与制作流程
9.1 PCM 制作
模拟信号 → ADC → PCM 录音 → 剪辑/混音/插件 → PCM 母带 → 发行
PCM 适合加、减、乘、卷积和频域变换,是数字音频工作站的自然工作格式。大量轨道叠加、自动化控制、均衡、动态处理和空间效果都可以高效完成。
9.2 DSD 直录
模拟信号 → DSD ADC → 少量剪切或拼接 → DSD 发行
如果录音以同期演奏为主,麦克风平衡和混音主要在模拟域完成,后期只进行少量剪切,DSD 可以保持相对直接的制作路径。这类流程在古典、爵士和原声录音中比较有吸引力,但对录音现场和前期决策要求很高。
9.3 DSD 与 DXD 混合制作
DSD 录音 → 转换为 DXD → 剪辑/混音/母带 → 重新调制为 DSD → 发行
对 1-bit DSD 直接做增益、均衡或混音会破坏原有噪声整形结构,也很容易发生过载。因此,复杂制作经常转入多位高采样率环境。DXD 通常指 24-bit/352.8 kHz PCM,它为 DSD 制作提供高带宽、多位的中间工作格式。
所以,“最终文件是 DSF”不等于整个制作过程从 ADC 到发行始终保持 1-bit DSD。评价一份 DSD 音源时,录音来源和制作历史比文件后缀更有信息量。
10 播放与传输
10.1 PCM 播放链路
PCM 文件 → 解码 → 数字滤波与过采样 → DAC → 模拟低通滤波 → 放大器
现代 PCM DAC 很少直接以文件原始采样率驱动一个简单电阻网络。芯片通常先做插值和过采样,再把多位 PCM 转换为高速多位或少位数据流,最后由开关单元和模拟滤波器生成输出。
10.2 DSD 播放链路
DSD 文件 → DSD 数据流 → 调制或内部转换 → DAC → 模拟低通滤波 → 放大器
部分 DAC 可以沿相对直接的路径处理 DSD;另一些会把 DSD 转为多位中间格式,以便完成音量控制、滤波和其他内部处理。产品标注“支持原生 DSD”通常说明接口和芯片能接收 DSD 数据,不一定代表芯片内部从输入到模拟输出完全不改变数据表示。
10.3 Native DSD 与 DoP
Native DSD 通过接口协议直接发送 DSD 数据。DoP 是 DSD over PCM,它把 DSD 比特打包进看起来像 PCM 的数据帧中,并加入标记字节,让接收端识别和还原 DSD。
DoP 不会把 DSD 数值计算成 PCM 幅度,它只是借用成熟的 PCM 传输通道运送 DSD 数据。由于加入了封装和标记,DoP 所需的接口速率通常高于原始 DSD 码率。
11 PCM 与 DSD 的比较
| 对比项 | PCM | DSD |
|---|---|---|
| 表示方式 | 多位数值直接表示采样幅度 | 高速 1-bit 脉冲密度表示局部平均趋势 |
| 常见规格 | 16/44.1、24/48、24/96、24/192 | DSD64、DSD128、DSD256 |
| 量化噪声 | 可配合抖动与噪声整形,分布取决于实现 | 强烈整形到超声频段 |
| 编辑与 DSP | 直接、成熟 | 复杂处理通常需转为多位格式 |
| 无损压缩 | FLAC、ALAC 等生态成熟 | DST 等应用范围较窄 |
| 文件格式 | WAV、AIFF、FLAC、ALAC | DSF、DFF |
| 典型载体 | CD、影视、游戏、广播、流媒体 | SACD、发烧下载 |
| 硬件兼容性 | 广泛 | 需要完整链路支持 |
| 超声噪声 | 取决于采样率与转换器实现 | DSD64 尤其需要关注带外噪声 |
| 主要优势 | 易处理、易存储、兼容性高 | 适合特定直录与 SACD 发行体系 |
还需要避免两个极端结论。第一,不能因为 PCM 易于编辑,就认为它一定经过更多处理、声音必然不自然;第二,也不能因为 DSD 数据流可以通过低通滤波重建,就认为所有 DSD 音源都比 PCM 更直接。真实制作链路和播放实现决定了格式标签背后的内容。
12 应用场景
12.1 音乐制作
多轨录音、流行音乐制作、影视声音、广播和游戏通常优先使用 PCM。主要原因不是 DSD 无法记录声音,而是制作阶段需要大量数学运算和插件处理。
12.2 现场直录
对后期处理较少、强调现场演奏和自然声场的项目,DSD 直录具有一定吸引力。它更依赖麦克风选择、摆位、模拟前端和现场平衡,一旦进入复杂数字制作,仍可能转换到 DXD 或其他多位格式。
12.3 音乐发行与收藏
PCM 是 CD、流媒体和下载市场的主体,FLAC 在兼容性、元数据和存储效率之间取得了很好平衡。DSD 的主要价值集中在 SACD、已有 DSD 母带、特定唱片公司的原生录音和发烧收藏。
12.4 芯片内部转换
许多现代 ADC 和 DAC 使用 Σ-Δ 架构,但芯片内部的调制器可能是多位的,时钟率和噪声整形方案也不等于消费文件格式中的 DSD。Σ-Δ 是转换器架构,DSD 是基于高速 1-bit 噪声整形数据流的存储和传输格式,两者密切相关但不完全等同。
13 格式选择
| 使用需求 | 更合适的选择 |
|---|---|
| 日常听歌、手机和电脑播放 | PCM / FLAC |
| 录音、剪辑、混音和母带 | PCM 或 DXD |
| 影视、游戏和广播 | PCM |
| 注重无损压缩和兼容性 | FLAC / ALAC |
| 收藏 SACD 或已有原生 DSD 录音 | DSD |
| 建立跨设备音乐库 | PCM / FLAC |
| 比较同一专辑的不同版本 | 优先核对母带来源和响度 |
| 单纯追求更好音质 | 先关注录音、母带、DAC 与播放环境 |
对大多数听众,PCM/FLAC 是最实用的音乐收藏方案。拥有支持 DSD 的 DAC,也不意味着必须把 PCM 音乐全部转换成 DSD;转换不会凭空增加录音中不存在的信息,反而引入新的滤波和噪声整形步骤。
如果某个 DSD 版本来自更好的母带,它当然可能是更值得收藏的版本;如果同一母带以高质量 PCM 和 DSD 分别发行,则不能仅凭采样率数字判断谁一定更好。
14 总结
PCM 与 DSD 是数字音频中的两条不同路线。PCM 在每个采样时刻使用多位数字记录幅度,表示直观、运算方便、生态成熟;DSD 使用高速 1-bit Σ-Δ 调制,让脉冲密度随输入变化,并通过反馈把量化噪声集中到超声频带。
DSD 不是 AM 或 FM,也不是简单地用一个比较器判断模拟电压正负。每个 bit 都是闭环调制器结合当前输入和历史误差作出的决定,许多 bit 的时间分布共同描述音频信号。播放时,低通滤波器保留脉冲流中的低频平均趋势,衰减高速开关成分和超声量化噪声,从而恢复连续电压。
所谓 DSD 的“模拟味”,可能与早期滤波器实现、直录和母带策略、具体 DAC 的模拟输出级以及主观预期有关,但它不是 1-bit 格式自动附带的物理属性。超声噪声也不是额外音乐细节,而是把音频带内噪声压低所付出的代价,需要通过合理滤波加以控制。
最终,格式只是整条音频链路中的一环。录音、母带、转换器、滤波器、模拟电路、放大器、扬声器、房间声学和聆听条件,往往比文件扩展名更能决定实际声音。PCM 胜在通用、可处理和高效率,DSD 则在特定录音方式、SACD 体系和收藏场景中保留了独特价值。理解两者的原理之后,选择就不必建立在采样率数字或格式神话上。
15 参考资料
- Analog Devices, Fundamental Principles Behind the Sigma-Delta ADC Topology
- Analog Devices, Sigma-Delta ADCs Tutorial
- Sony, Sony Launches Super Audio CD
- Audio Engineering Society, High-Resolution Audio: A History and Perspective
- Joshua D. Reiss, A Meta-Analysis of High Resolution Audio Perceptual Evaluation
- DoP Open Standard, DSD Audio over PCM Frames
- Benchmark Media Systems, DSD Provides a Direct Stream from A/D to D/A