从采样、量化到噪声整形:彻底理解 PCM 与 DSD


1 前言

        在数字音频领域,PCM 和 DSD 经常被放在一起比较。CD、WAV、FLAC、流媒体和绝大多数影视音频使用 PCM 体系;SACD、DSF、DFF 以及一些发烧音乐下载则使用 DSD。围绕两者的讨论中,还经常出现“DSD 更接近模拟”“PCM 更方便但不够自然”“DSD 的采样率高达 MHz,所以音质更好”等说法。

        这些说法有的抓住了一部分技术特征,有的则把采样率、文件格式、DAC 架构、母带版本和主观听感混在了一起。PCM 和 DSD 的确采用了不同的数字表达方式,但它们面对的是同一个任务:如何把连续变化的模拟声音记录下来,再尽可能准确地还原成模拟信号。

        本文从声音、电压和采样开始,依次介绍 PCM 的多位量化、DSD 的高速 1-bit 调制、过采样、反馈与噪声整形,然后讨论两者在录音、编辑、存储和播放中的实际差异。尤其会详细回答两个容易被模糊处理的问题:DSD 的每一个 0 和 1 究竟是怎样产生的,以及所谓“模拟味”到底可能来自哪里。

        如果先用一句话概括全文:PCM 用较低的采样率和较多的位数直接保存幅度,DSD 用极高的时钟率和 1-bit 数据流保存局部平均趋势,并通过噪声整形把量化噪声移出主要听觉频带。


2 从声音到电压

2.1 声音是连续变化的压力

        声音在空气中表现为压力随时间的变化。麦克风把这种压力变化转化为电压变化,经过前置放大后送入模数转换器 ADC。声音越强,通常对应电压摆幅越大;音调越高,对应电压变化越快。

        模拟电压在时间和幅度上都是连续的。数字系统却只能保存有限个数字,因此需要完成两个离散化过程:

模拟信号、PCM采样与量化

2.2 采样率与可表达带宽

        采样率 $f_s$ 表示每秒采样多少次。44.1 kHz 就是每秒、每声道取得 44100 个采样值。对于最高频率为 $B$ 的理想带限信号,为避免不同频率在采样后混叠,采样率需要满足:

\[f_s > 2B\]

        这就是奈奎斯特采样条件。人耳通常讨论的听觉频带上限约为 20 kHz,因此 CD 选择 44.1 kHz 采样率,在 20 kHz 音频带宽之外留出一段滤波过渡带。实际 ADC 在采样前还要使用抗混叠低通滤波器,避免高于目标频带的信号折叠进音频范围。

        采样并不等于把离散点用直线连接。只要原始信号受到带宽限制并满足采样条件,理论上可以通过 sinc 插值完整重建。现代 DAC 中的数字插值滤波器和模拟重建滤波器共同完成这一过程。

2.3 量化与量化误差

        位深决定每个 PCM 采样值可以使用多少个二进制位。$N$ 位量化器具有:

\[2^N\]

        个可能的码值。16-bit 有 65536 个码值,24-bit 有 16777216 个码值。模拟输入通常不会恰好落在某个量化等级上,真实值与量化值之差就是量化误差。

        对满幅正弦波和理想均匀量化器,量化信噪比常用下面的近似式估算:

\[\mathrm{SNR}\approx 6.02N+1.76\ \mathrm{dB}\]

        16-bit 对应约 98 dB,24-bit 理论上约 146 dB。但这不意味着一台 24-bit ADC 真能得到 146 dB 的有效动态范围。麦克风本底噪声、前置放大器、热噪声、电源、时钟和模拟电路都会先成为限制。


3 PCM 的幅度编码

3.1 一个时刻对应一个数值

        PCM 是 Pulse Code Modulation,即脉冲编码调制。其核心思路十分直接:每隔固定时间测量一次输入电压,然后用一个多位二进制数保存测量结果。

        假设 ADC 的归一化输入范围为 $-1$ 到 $+1$,几个连续采样可能是:

采样时刻 输入幅度 量化后的 PCM 数值
$t_0$ 0.00 0
$t_1$ 0.32 10485
$t_2$ 0.75 24575
$t_3$ 0.41 13434
$t_4$ -0.20 -6554

        表中的数字只是一个简化示例,但说明了 PCM 最关键的关系:一个采样时刻对应一个幅度数值。 采样率决定多久记录一次,位深决定每次记录可以有多细。

3.2 PCM 的优点

        PCM 的优势不仅在播放,更在处理。两个采样值可以直接相加完成混音,乘以系数可以改变音量,卷积可以实现滤波,傅里叶变换可以分析频谱。均衡、压缩、混响、声像、限幅和采样率转换等数字信号处理算法,几乎都以多位 PCM 或浮点数作为自然的运算对象。

        因此,从录音工作站、影视制作、广播、游戏音频到流媒体,PCM 都是最普遍的工作格式。专业软件内部还经常使用 32-bit 或 64-bit 浮点数,以获得很大的运算余量,减少中间处理中的溢出和舍入问题。

3.3 PCM 与文件格式

        PCM 是声音的数字表示方法,而 WAV、AIFF、FLAC 并不是与 PCM 并列的采样技术。

名称 类型 说明
PCM 数字音频表示方法 用多位采样值表示幅度
WAV、AIFF 容器格式 通常封装未压缩 PCM,也能容纳其他编码
FLAC、ALAC 无损压缩格式 解码后恢复出完全相同的 PCM 数据
MP3、AAC、Opus 有损压缩格式 利用听觉模型舍弃部分信息以降低码率

        所以,FLAC 与 WAV 在解码得到相同 PCM 数据、播放链路正常的条件下,并不存在“压缩过所以波形不完整”的问题。


4 DSD 的脉冲密度编码

4.1 单个比特不能表示精确幅度

        DSD 是 Direct Stream Digital。经典 DSD 每个采样时刻只有 1 bit,因此只能保存 0 或 1。放到电路中,也可以理解为输出只能在两个固定电平之间切换,例如 $-V_{\mathrm{ref}}$ 和 $+V_{\mathrm{ref}}$。

        这马上带来一个问题:如果只能输出最高和最低两个电平,中间的电压如何表示?答案不是让某一个比特携带精确幅度,而是观察一小段时间内正负脉冲的比例。正脉冲多,局部平均值为正;负脉冲多,局部平均值为负;两者接近各半,局部平均值接近零。

DSD脉冲密度与幅度

4.2 DSD 与脉冲密度调制

        DSD 最接近 PDM,也就是脉冲密度调制。它不是无线电中的调幅 AM 或调频 FM,也不是改变脉冲宽度的 PWM。

调制方式 发生变化的量
AM 高频载波的幅度
FM 高频载波的瞬时频率
PWM 每个脉冲的宽度或占空比
PDM 固定时钟下,一段时间内正负脉冲的密度
DSD 经过高阶噪声整形的高速 1-bit PDM 数据流

        DSD 的脉冲幅度固定,每一个 bit 的时间长度也固定。它并没有一条连续正弦载波供音频去改变幅度或频率。变化的是一串 0 和 1 的排列方式,以及局部时间窗口中 1 所占的比例。

        用一个最简化的双极性模型可以建立直觉。假设 1 对应 $+1$,0 对应 $-1$,在某个时间窗口中 1 的比例为 $p$,那么这一段脉冲的平均值为:

\[x=p\times(+1)+(1-p)\times(-1)=2p-1\]

        反过来:

\[p=\frac{x+1}{2}\]
归一化目标幅度 1 的比例 简化后的局部序列
+1.0 100% 1111111111111111
+0.5 75% 1110111011101110
0 50% 1010101010101010
-0.5 25% 1000100010001000
-1.0 0% 0000000000000000

        这张表只是帮助理解密度与平均值的关系。真实 DSD 不是把每 16 个比特机械地排成固定比例。比特的具体位置由 Σ-Δ 调制器的当前输入、过去误差、环路滤波器状态和稳定性设计共同决定。

4.3 DSD 的真实采样过程

        常见的说法是“DSD 用 1-bit ADC 以 2.8224 MHz 采样”。这句话没有错,但容易让人误以为 DSD 每隔约 354 ns 把模拟电压粗暴地判断为高或低。真实过程更接近一个不断纠错的闭环系统。

Sigma-Delta调制器结构

        一个简化的 Σ-Δ 调制器包含求差、环路滤波、1-bit 量化器和反馈 DAC,基本过程如下:

  1. 模拟输入与反馈 DAC 的输出相减,得到当前误差;
  2. 积分器或更高阶环路滤波器累积并处理误差;
  3. 1-bit 量化器根据环路状态输出 0 或 1;
  4. 这个比特一方面成为 DSD 输出,另一方面送入 1-bit DAC;
  5. 反馈 DAC 产生正或负参考电平,回到输入端参与下一次求差;
  6. 如果此前输出偏高,负反馈会推动之后输出更多低电平;如果此前输出偏低,则推动之后输出更多高电平。

        因此,单个 DSD 比特表达的不是“此刻输入电压等于多少”,而是:

调制器根据当前输入、历史误差和内部状态,决定下一个时钟周期应该输出正参考还是负参考,才能让一段时间内的平均输出跟随输入。

        当输入为零时,理想输出的 1 和 0 大致各占一半;输入向正方向增加时,1 的局部密度增加;输入向负方向变化时,0 的局部密度增加。输入电压变化得多快,密度分布就随之变化得多快。

4.4 采样率与局部平均

        DSD64 的时钟率为:

\[44.1\ \mathrm{kHz}\times64=2.8224\ \mathrm{MHz}\]

        一个 bit 周期约为:

\[\frac{1}{2.8224\ \mathrm{MHz}}\approx354\ \mathrm{ns}\]

        但 2.8224 MHz 不能直接与 PCM 的 44.1 kHz 比大小。PCM 的一次采样通常携带 16 bit 或 24 bit 幅度信息,DSD 的一次采样只有 1 bit。DSD 需要把许多个相邻 bit 放在一起,才能体现局部平均幅度。

        观察窗口越长,密度统计越精确,但越难表示快速变化;观察窗口越短,时间跟随能力越好,但可用于估计幅度的 bit 数量更少。Σ-Δ 调制和噪声整形的意义,就是不靠简单、固定的滑动平均,而是利用反馈控制量化误差在时间和频率上的分布。


5 过采样与噪声整形

5.1 过采样提供频率空间

        如果只使用 1-bit 量化而不采取其他措施,量化误差会非常大。DSD 能够工作,依靠的不只是高采样率,而是过采样与噪声整形的组合。

        提高采样率后,量化噪声可以分布在更宽的频率范围中。在总噪声功率近似不变的前提下,音频频带只占整个奈奎斯特频带的一小部分,通过低通滤波便可以去掉大量带外噪声。但仅靠过采样仍不足以让 1-bit 系统获得很高的音频带内信噪比,因此还需要噪声整形。

5.2 噪声整形不消灭噪声

        噪声整形利用反馈和环路滤波器改变量化误差的频谱分布。对音频信号而言,Σ-Δ 环路通常让信号保持低通特性,同时让量化误差呈现高通特性:低频量化噪声被压低,高频量化噪声被抬高。

PCM与DSD噪声频谱

        这可以类比为整理房间:杂物并没有消失,而是从日常活动区域搬到了阁楼。音频频带是需要保持安静的房间,几十千赫兹以上的超声频带则提供了存放量化噪声的空间。

        Analog Devices 对 Σ-Δ ADC 的说明也强调了这一点:过采样先把噪声铺到更宽频带,噪声整形再把更多量化噪声推向高频,后续低通滤波器负责去除带外部分。调制器阶数越高,通常可以更激进地压低带内噪声,但环路稳定性和设计复杂度也随之增加。

5.3 DSD64、DSD128 与 DSD256

名称 每声道采样率 相对于 44.1 kHz
DSD64 2.8224 MHz 64 倍
DSD128 5.6448 MHz 128 倍
DSD256 11.2896 MHz 256 倍
DSD512 22.5792 MHz 512 倍

        更高倍 DSD 为噪声整形和模拟滤波留下了更宽裕的频率空间,可以把噪声上升区域推得更远,或者采用较温和的滤波器。但它同时增加文件大小、接口速率和处理负担。只看 DSD 后面的倍数,不能判断录音、母带和最终播放一定更好。


6 DSD 的低通滤波

6.1 脉冲流中的音频与高频成分

        直接观察 DSD 波形,会看到它始终在两个电平之间高速跳变,看起来完全不像平滑的模拟波形。这里需要把时域外观和频域成分分开。

        一串高速脉冲可以分解为不同频率成分的叠加:

        低通滤波器不是尝试逐个“修圆”方波边沿,而是允许低频分量通过,并衰减高频分量。高速跳变被平均后,留下的正是密度随时间变化所描述的慢速波形。

6.2 RC 平均的直观解释

        最简单的一阶 RC 低通滤波器可以帮助建立直觉。电容不会在每个 354 ns 的 bit 周期内立刻充满或放空,而是对连续脉冲进行时间平均:

        若滤波器截止频率远低于 2.8224 MHz,却高于需要保留的音频范围,它就能大幅削弱 bit 时钟和超声噪声,同时让 20 Hz~20 kHz 的音乐变化通过。

DSD低通重建

6.3 高频噪声能够被滤掉的原因

        一个线性低通滤波器对每个频率给予不同增益。用 $H(f)$ 表示滤波器的频率响应,那么输出频谱为:

\[Y(f)=X(f)H(f)\]

        在音频频带内,$H(f)$ 接近 1,音乐信号被保留;进入超声频带后,$H(f)$ 逐渐下降,噪声被衰减。之所以可以这样做,是因为 DSD 已经主动把信号和大部分量化噪声安排在不同频率区域:需要的音乐主要在低频,代价则被推到高频。

        “高频噪声在人耳听不到,所以不用管”并不严谨。即使人耳不能直接听到几十千赫兹信号,强超声能量仍可能让功放或扬声器承受额外负担,并通过非线性产生落入音频频带的互调失真。因此,DSD DAC 的模拟输出端仍需要合适的低通滤波,而不是把未经处理的 1-bit 脉冲直接送给后级。

6.4 实际滤波器的代价

        理想低通滤波器可以在某个频率处垂直切断,现实滤波器却一定存在过渡带。截止频率、衰减速度、相位响应、群延迟、阶跃响应和器件误差之间需要折中。

        因此,“DSD 只需要一个简单模拟低通滤波器”描述的是理想化方向,而不是所有实际设备的完整实现。更高倍 DSD 的一个工程价值,就是让有用频带与噪声上升区之间隔得更远,从而放宽滤波器的过渡带要求。


7 DSD 的模拟味

7.1 模拟味不是可直接测量的格式属性

        “模拟味”通常用来描述声音自然、连续、柔和、没有数码感,但它不是像频率响应、动态范围或总谐波失真那样具有统一定义的技术指标。不同听众使用这个词时,可能分别在描述高频质感、瞬态、空间感、失真特征、母带风格,甚至音量差异。

        DSD 经常被认为更有模拟味,确实可以找到一些可能的技术和历史原因,但不能由此推导出“1-bit 天生比多位 PCM 更接近模拟”。

7.2 脉冲密度与模拟平均

        DSD 的低频信息直接包含在高速脉冲的局部平均值中。理论上,一个开关式 1-bit DAC 加低通滤波器就能重建波形。这种“脉冲密度经过模拟积分后形成连续电压”的过程,在直觉上比多位 PCM 的插值、过采样和多位 DAC 更像连续模拟系统。

        但“重建方式容易用模拟平均来解释”和“听起来必然更像模拟”是两件事。现代 PCM DAC 内部通常也会过采样,并转换成高速多位或少位 Σ-Δ 数据流再输出。到了芯片内部,PCM 和 DSD 的路径可能比文件标签显示的更相似。

7.3 滤波器与瞬态响应

        早期 44.1 kHz PCM 系统需要在 20 kHz 音频上限与 22.05 kHz 奈奎斯特频率之间完成很陡的滤波。早期转换器和数字滤波器性能有限,陡峭滤波可能带来通带起伏、相位变化或振铃。DSD 的时钟率很高,有用频带和 bit 时钟之间相距很远,输出端可以使用过渡带较宽的模拟滤波器。这可能是 DSD 形成“自然、顺滑”声誉的技术背景之一。

        但现代 PCM DAC 普遍使用过采样和高性能数字滤波,用户还可能选择线性相位、最小相位、快速滚降或慢速滚降等模式。滤波器差异仍可能影响测量结果和部分听感,但已经不能简单归结为“PCM 需要砖墙滤波,DSD 不需要滤波”。两者都需要滤波,只是噪声和镜像出现的位置、滤波链路及实现方式不同。

7.4 超声噪声与设备非线性

        DSD 的超声噪声通常不是有益的音乐细节。如果它没有被充分滤除,后级电路的非线性可能把两个超声成分混合,产生差频。例如 30 kHz 和 33 kHz 的成分经过非线性系统后,可能生成 3 kHz 的互调产物,落入可听范围。

        这些额外产物有时可能被主观描述为明亮、空气感、柔和或模拟感,也可能表现为粗糙和疲劳;它们取决于具体 DAC、功放和扬声器,而不是 DSD 应当保留的原始信息。因此,不能把超声噪声造成的设备相关失真当作 DSD 更高保真的证据。

7.5 母带版本差异

        实际比较中最常见的问题不是格式,而是来源不同。同一张专辑的 CD、流媒体、SACD 和 DSD 下载版可能使用不同母带:

        此时 DSD 版听起来更自然,真正原因可能是母带处理更克制,而不是 1-bit 编码本身。只有使用同一源文件、经过受控转换、严格音量匹配并进行盲听,才能尽量把编码格式本身从其他变量中分离出来。

7.6 播放设备与心理预期

        有些 DAC 为 PCM 和 DSD 使用不同数字滤波器、不同增益甚至不同模拟路径。即使输入来自同一母带,输出频率响应和电平也可能不同。很小的响度差异就可能让稍响的版本被认为更清晰、更有细节。

        文件价格、封面标签、播放器显示的 DSD 标志以及试听者对某种格式的预期也会影响评价。这并不意味着主观体验是假的,而是说明“我更喜欢这个版本”和“这种编码在所有条件下更准确”属于两种不同结论。

        关于高解析度音频能否被听出差异,研究结果并非一句“完全听不出”或“显著更好”可以概括。2016 年发表于 AES 的一项元分析认为,总体上存在幅度较小但有统计意义的辨别能力,并且训练会提高表现;它研究的是高解析度与标准解析度的总体比较,并不能单独证明 DSD 优于高规格 PCM。


8 数据率与文件大小

        未压缩数字音频的原始数据率可以用下面的公式估算:

\[R=f_s\times N\times C\]

        其中 $f_s$ 是采样率,$N$ 是每次采样的位数,$C$ 是声道数。

格式 立体声原始数据率 三分钟理论数据量
PCM 16-bit/44.1 kHz 1.4112 Mbit/s 约 31.8 MB
PCM 24-bit/96 kHz 4.608 Mbit/s 约 103.7 MB
PCM 24-bit/192 kHz 9.216 Mbit/s 约 207.4 MB
DSD64 5.6448 Mbit/s 约 127.0 MB
DSD128 11.2896 Mbit/s 约 254.0 MB
DSD256 22.5792 Mbit/s 约 508.0 MB

        表中没有计算容器开销,也没有计算无损压缩。PCM 可以通过 FLAC、ALAC 等方式显著缩小,而且压缩率与音乐内容有关;SACD 使用 DST 对 DSD 进行无损压缩,DSF 文件通常则不使用类似 FLAC 的高效通用压缩。


9 录音与制作流程

9.1 PCM 制作

模拟信号 → ADC → PCM 录音 → 剪辑/混音/插件 → PCM 母带 → 发行

        PCM 适合加、减、乘、卷积和频域变换,是数字音频工作站的自然工作格式。大量轨道叠加、自动化控制、均衡、动态处理和空间效果都可以高效完成。

9.2 DSD 直录

模拟信号 → DSD ADC → 少量剪切或拼接 → DSD 发行

        如果录音以同期演奏为主,麦克风平衡和混音主要在模拟域完成,后期只进行少量剪切,DSD 可以保持相对直接的制作路径。这类流程在古典、爵士和原声录音中比较有吸引力,但对录音现场和前期决策要求很高。

9.3 DSD 与 DXD 混合制作

DSD 录音 → 转换为 DXD → 剪辑/混音/母带 → 重新调制为 DSD → 发行

        对 1-bit DSD 直接做增益、均衡或混音会破坏原有噪声整形结构,也很容易发生过载。因此,复杂制作经常转入多位高采样率环境。DXD 通常指 24-bit/352.8 kHz PCM,它为 DSD 制作提供高带宽、多位的中间工作格式。

        所以,“最终文件是 DSF”不等于整个制作过程从 ADC 到发行始终保持 1-bit DSD。评价一份 DSD 音源时,录音来源和制作历史比文件后缀更有信息量。

PCM与DSD制作流程


10 播放与传输

10.1 PCM 播放链路

PCM 文件 → 解码 → 数字滤波与过采样 → DAC → 模拟低通滤波 → 放大器

        现代 PCM DAC 很少直接以文件原始采样率驱动一个简单电阻网络。芯片通常先做插值和过采样,再把多位 PCM 转换为高速多位或少位数据流,最后由开关单元和模拟滤波器生成输出。

10.2 DSD 播放链路

DSD 文件 → DSD 数据流 → 调制或内部转换 → DAC → 模拟低通滤波 → 放大器

        部分 DAC 可以沿相对直接的路径处理 DSD;另一些会把 DSD 转为多位中间格式,以便完成音量控制、滤波和其他内部处理。产品标注“支持原生 DSD”通常说明接口和芯片能接收 DSD 数据,不一定代表芯片内部从输入到模拟输出完全不改变数据表示。

10.3 Native DSD 与 DoP

        Native DSD 通过接口协议直接发送 DSD 数据。DoP 是 DSD over PCM,它把 DSD 比特打包进看起来像 PCM 的数据帧中,并加入标记字节,让接收端识别和还原 DSD。

        DoP 不会把 DSD 数值计算成 PCM 幅度,它只是借用成熟的 PCM 传输通道运送 DSD 数据。由于加入了封装和标记,DoP 所需的接口速率通常高于原始 DSD 码率。


11 PCM 与 DSD 的比较

对比项 PCM DSD
表示方式 多位数值直接表示采样幅度 高速 1-bit 脉冲密度表示局部平均趋势
常见规格 16/44.1、24/48、24/96、24/192 DSD64、DSD128、DSD256
量化噪声 可配合抖动与噪声整形,分布取决于实现 强烈整形到超声频段
编辑与 DSP 直接、成熟 复杂处理通常需转为多位格式
无损压缩 FLAC、ALAC 等生态成熟 DST 等应用范围较窄
文件格式 WAV、AIFF、FLAC、ALAC DSF、DFF
典型载体 CD、影视、游戏、广播、流媒体 SACD、发烧下载
硬件兼容性 广泛 需要完整链路支持
超声噪声 取决于采样率与转换器实现 DSD64 尤其需要关注带外噪声
主要优势 易处理、易存储、兼容性高 适合特定直录与 SACD 发行体系

        还需要避免两个极端结论。第一,不能因为 PCM 易于编辑,就认为它一定经过更多处理、声音必然不自然;第二,也不能因为 DSD 数据流可以通过低通滤波重建,就认为所有 DSD 音源都比 PCM 更直接。真实制作链路和播放实现决定了格式标签背后的内容。


12 应用场景

12.1 音乐制作

        多轨录音、流行音乐制作、影视声音、广播和游戏通常优先使用 PCM。主要原因不是 DSD 无法记录声音,而是制作阶段需要大量数学运算和插件处理。

12.2 现场直录

        对后期处理较少、强调现场演奏和自然声场的项目,DSD 直录具有一定吸引力。它更依赖麦克风选择、摆位、模拟前端和现场平衡,一旦进入复杂数字制作,仍可能转换到 DXD 或其他多位格式。

12.3 音乐发行与收藏

        PCM 是 CD、流媒体和下载市场的主体,FLAC 在兼容性、元数据和存储效率之间取得了很好平衡。DSD 的主要价值集中在 SACD、已有 DSD 母带、特定唱片公司的原生录音和发烧收藏。

12.4 芯片内部转换

        许多现代 ADC 和 DAC 使用 Σ-Δ 架构,但芯片内部的调制器可能是多位的,时钟率和噪声整形方案也不等于消费文件格式中的 DSD。Σ-Δ 是转换器架构,DSD 是基于高速 1-bit 噪声整形数据流的存储和传输格式,两者密切相关但不完全等同。


13 格式选择

使用需求 更合适的选择
日常听歌、手机和电脑播放 PCM / FLAC
录音、剪辑、混音和母带 PCM 或 DXD
影视、游戏和广播 PCM
注重无损压缩和兼容性 FLAC / ALAC
收藏 SACD 或已有原生 DSD 录音 DSD
建立跨设备音乐库 PCM / FLAC
比较同一专辑的不同版本 优先核对母带来源和响度
单纯追求更好音质 先关注录音、母带、DAC 与播放环境

        对大多数听众,PCM/FLAC 是最实用的音乐收藏方案。拥有支持 DSD 的 DAC,也不意味着必须把 PCM 音乐全部转换成 DSD;转换不会凭空增加录音中不存在的信息,反而引入新的滤波和噪声整形步骤。

        如果某个 DSD 版本来自更好的母带,它当然可能是更值得收藏的版本;如果同一母带以高质量 PCM 和 DSD 分别发行,则不能仅凭采样率数字判断谁一定更好。


14 总结

        PCM 与 DSD 是数字音频中的两条不同路线。PCM 在每个采样时刻使用多位数字记录幅度,表示直观、运算方便、生态成熟;DSD 使用高速 1-bit Σ-Δ 调制,让脉冲密度随输入变化,并通过反馈把量化噪声集中到超声频带。

        DSD 不是 AM 或 FM,也不是简单地用一个比较器判断模拟电压正负。每个 bit 都是闭环调制器结合当前输入和历史误差作出的决定,许多 bit 的时间分布共同描述音频信号。播放时,低通滤波器保留脉冲流中的低频平均趋势,衰减高速开关成分和超声量化噪声,从而恢复连续电压。

        所谓 DSD 的“模拟味”,可能与早期滤波器实现、直录和母带策略、具体 DAC 的模拟输出级以及主观预期有关,但它不是 1-bit 格式自动附带的物理属性。超声噪声也不是额外音乐细节,而是把音频带内噪声压低所付出的代价,需要通过合理滤波加以控制。

        最终,格式只是整条音频链路中的一环。录音、母带、转换器、滤波器、模拟电路、放大器、扬声器、房间声学和聆听条件,往往比文件扩展名更能决定实际声音。PCM 胜在通用、可处理和高效率,DSD 则在特定录音方式、SACD 体系和收藏场景中保留了独特价值。理解两者的原理之后,选择就不必建立在采样率数字或格式神话上。


15 参考资料

  1. Analog Devices, Fundamental Principles Behind the Sigma-Delta ADC Topology
  2. Analog Devices, Sigma-Delta ADCs Tutorial
  3. Sony, Sony Launches Super Audio CD
  4. Audio Engineering Society, High-Resolution Audio: A History and Perspective
  5. Joshua D. Reiss, A Meta-Analysis of High Resolution Audio Perceptual Evaluation
  6. DoP Open Standard, DSD Audio over PCM Frames
  7. Benchmark Media Systems, DSD Provides a Direct Stream from A/D to D/A
Back to Archive
WeChat QR Code

Scan to connect