Featured image of post Headphone Systems A Cloud-listener's Perspective

Headphone Systems A Cloud-listener's Perspective

浅显云一下耳机系统

前言

在笔者看来,HiFi 市场的高度信息不对等导致了消费主义玄学和片面伪科学盛行,不仅阻碍行业良性发展,更造成了玩家挑选设备困难,最终催生无休止的“以价论声”焦虑。此背景下,唯有提升科学认知,建立可验证的判断框架,身为局中人的我们才能在鱼龙混杂的产品叙事中保持清醒,少交“智商税“。

然而真正科学 HiFi 的门槛很高——既要学习信号系统、模电数电、电声工程、心理声学,又要仪器测量、实践验证,若非相关专业从事者,需要投入大量时间精力。

好在 AI 的迅速发展使得往高墙内一窥成为可能,本文所云便是通过大量 AI 问答( Kimi 2.6/2.7、GPT 5.5 )总结的,希望对读者有所启迪。

HiFi 系统漫游

音频文件 → 解码 → PCM/DSD 数据流 → (DSP 处理) → 传输协议+物理层 → [DAC] → 模拟信号 → 音量控制(衰减)→ 电压放大 → 电流放大 → [耳机] → 人耳 → [人脑] → 听觉

不难看出从内存中的音频文件到人脑产生的听觉,其中经过了 1 次衰减、2 次放大、3 次转换(数模转换、电声转换、声-感知转换),这几个步骤在整个路径中对声音影响最大。

常见的 HiFi 产品都可以被拆分为这些环节,值得注意的是我们常说的“解码器”其实是一个源于早期翻译的错误称呼。DAC 全称 Digital to Analog Converter 顾名思义功能是数模转换,而解码(decode)的概念和编码(encode)是对应的。

音源

信号表示方式

模拟音源

物理量连续变化——声音以连续的物理波形形式记录和重放。

  • 记录原理:声波的振幅和频率直接对应记录介质上的物理变化(如黑胶沟槽的深浅/宽窄、磁带磁粉的磁化强度)
  • 数学本质:连续函数 $f(t)$,在任意时间点都有定义
  • 特点:信息密度"无限"(理论上),但每一次复制/传输都会引入噪声和失真(信噪比逐级劣化)

数字音源

离散采样+量化——将声波转换为一系列数字编码。

  • 记录原理:按固定时间间隔(采样率)测量声波振幅,并用有限位数的数字表示(量化)
  • 数学本质:离散序列 $f[n]$,仅在采样点有定义
  • 核心参数:
    • 采样率(如44.1kHz、96kHz):决定可还原的最高频率(奈奎斯特极限:$f_{max} = f_s/2$)
    • 位深(如16bit、24bit):决定动态范围(~6dB/bit,16bit≈96dB)
  • 特点:复制无损,但存在量化误差;需要重建滤波器将离散信号恢复为连续波形

数字音乐的文件格式:PCM 与 DSD 是两大流派,前者 多 bit,后者 1bit。PCM 原始格式为 .wav,FLAC 与 ALAC 编码是无损压缩。老烧认为能听出 .wav 与 .flac 区别是荒谬的——无损压缩是可逆的,两者解码出的 PCM 数据逐比特一致(注意:一致的是解码后的音频数据,两个文件本身的哈希值当然不同)。若能听出区别,说明系统保真度堪忧。.m4a 容器可以封装 AAC 有损编码和 ALAC 无损编码,大多来自 Apple Music。Apple Music 的音源文件通常与其他流媒体存在微小区别。

为什么 16bit 44.1kHz 已经足够保真:

1.奈奎斯特-香农采样定理

人耳可听频率上限约为 20kHz(年轻人,且因个体差异和听力损伤会下降)。根据采样定理,采样率只需大于信号最高频率的 2 倍 即可无失真地重建原始信号。 44.1kHz 的奈奎斯特频率为 22.05kHz,完全覆盖了人耳可听范围,并留有约 2kHz 的过渡带用于抗混叠滤波器的滚降。

2.过采样(Oversampling)与重建滤波

早期的 CD 播放器确实面临重建滤波器设计困难的问题——需要在 20kHz 处近乎平坦,在 22.05kHz 处急剧衰减(“砖墙滤波器”),这在模拟域很难实现且会引入相位失真。

过采样解决了这个问题:

  • 播放器内部以 2×、4×、8× 甚至更高倍数对 44.1kHz 进行过采样
  • 将镜像频谱推到更高的频率,大幅降低了对模拟重建滤波器的陡峭度要求
  • 现代 DAC(如 Delta-Sigma 架构)通常在内部以 MHz 级别运行,配合数字插值滤波器,重建过程极为精确

3.噪声整形(Noise Shaping)

这里需要区分制作端与回放端两个不同环节的噪声整形:

  • 制作端(录音/母带):在把高精度母带降至 16bit 时,可以使用噪声整形抖动(如 POW-r、Sony SBM),把量化噪声的频谱推向人耳不敏感的高频区域,使 3–4kHz 最敏感频段的感知噪声底等效于约 110–120dB。这是"超过 96dB"说法的真实出处,但它在文件生成的那一刻就已经定型。
  • 回放端(DAC):Delta-Sigma DAC 利用噪声整形将自身再量化产生的噪声从低频推向高频区域。但它对 16bit 文件中已经焙入的量化噪声无能为力——一张普通 16bit 录音的有效动态范围上限就是约 96dB(加 TPDF 抖动约 98dB),任何回放设备都无法超越它。

好在绝大多数商业音乐的动态范围在 10-20dB 之间。即使是古典音乐现场录音,其动态范围也极少超过 60-70dB,96dB 的容器依然绰绰有余。

4.环境噪声本底

这是一个经常被忽略的关键因素:

  • 安静的录音室环境噪声约为 20-30dBA
  • 普通家庭的房间噪声约为 30-40dBA
  • 典型消声室的本底噪声约为 0-15dBA,世界纪录级(如微软 Building 87 消声室)甚至低至 -20dBA 以下

这意味着,如果你想听到 16bit 量化噪声(约 -96dBFS),你的听音音量必须大到让峰值信号达到约 110dB SPL 以上——这已是摇滚现场级别的音量,接近痛阈(约 120–130dB SPL)的下沿,且在这种音量下,房间噪声和听力本身的非线性失真会完全掩盖量化噪声。


既然 16bit/44.1kHz 已经足够,更高规格如 24bit/96kHz 的意义是?

1.录音和混音阶段:24bit 的"动态余量"

数字增益调整:在混音中,音轨经常被衰减 20-40dB 后再进行后续处理。如果用 16bit,衰减后有效位深可能只剩 8-10bit,会引入明显的量化失真。24bit 提供了充足的"数字余量"(headroom)。

多轨叠加:数十轨叠加时,噪声会累积。24bit 确保在复杂的 DSP 链路中始终保持高保真。

2.回放端 DSP 处理中的精度损失

几乎所有的数字信号处理(数字音量衰减、EQ、采样率转换等等)都会引入舍入误差。24bit(甚至 32bit float)作为工作精度,可以确保即使经过数十次处理,累积误差仍远低于可闻阈值;而 16bit 可能经由 DSP 之后只剩 12bit 甚至更低。

3.96kHz/192kHz 的混音优势

插件处理:许多数字音频算法(尤其是非线性处理如失真、压缩、模拟建模)在更高采样率下表现更好,因为减少了混叠失真。

采样率转换:从 96kHz 向下转换到 44.1kHz 时,数字滤波器有更多空间进行优化,最终 44.1kHz 的成品质量可能略好于直接在 44.1kHz 下制作。

4.母带和存档

作为"数字母带",24bit/96kHz 提供了更高的安全余量,未来如果需要重新处理或重新发行,有更大的灵活性。类似于摄影中的 RAW 格式——交付给用户的是 JPEG,但摄影师需要 RAW 来修图。

产品形态详解

黑胶唱片

维度科学细节
记录方式立体声采用 45/45 制式:两个声道分别记录在 V 形沟槽的两壁上,横向分量对应左右声道之和、垂直分量对应差(纯横向/纯垂直调制的单声道为 legacy)
物理限制低频需要大振幅→沟槽变宽→唱片容量减少;高频受唱针质量/循迹能力限制(一般有效上限15-20kHz)
失真来源唱针摩擦沟槽(磨损)、偏芯/抖晃(wow & flutter)、共鸣、静电噪声
“温暖感"来源谐波失真(尤其是偶次谐波)、低频共振、高频衰减形成的特定频响曲线

黑胶的本底噪声(~-60dB)和动态范围(~60-70dB)远低于CD,其"自然度"主要来自失真特性,而非"没有数模转换”——事实上大量现代黑胶从数字母带刻片,链路中早已存在 DAC。

CD

维度科学细节
标准参数44.1kHz/16bit(1982年Sony/Philips红皮书标准)
物理载体聚碳酸酯基盘上的凹坑(pit)和平地(land),激光读取
容量74分钟(广为流传的说法是大贺典雄为容纳贝多芬第九交响曲而定;实际由 12cm 盘径、刻录密度等多因素共同决定)
纠错机制CIRC(交叉交织里德-所罗门码),可修复轻微划痕
理论性能动态范围~96dB,频响0-22.05kHz

现代数字音频系统

当代数字音频已分化出多条技术路径:

基于电脑的音频(PC-HiFi)

1
电脑(USB/光纤/同轴输出)→ DAC

技术要点:

  • USB音频:异步传输模式(DAC主导时钟,减少抖动)
  • 文件格式:PCM、DSD
  • 位流 vs 包传输:USB Audio Class 2.0支持高达PCM 768kHz/32bit或DSD 512
  • 抖动(Jitter):数字时钟精度影响时域误差,现代异步方案已将其降至可忽略水平

关于 USB 音频传输以及 USB 线材,强烈推荐阅读:https://www.rainlain.com/index.php/2026/05/07/5957/

网播&数播

1
网络(NAS/流媒体服务)→ 数播(内置CPU+解码)→ DAC

科学优势:

  • 电气隔离:以太网的变压器耦合(PHY 层磁件)与光纤传输可提供天然的电气隔离,阻断前端地环路噪声;注意这是物理层特性,而非 TCP/IP 协议本身的功劳。USB 方面,异步传输已解决时钟主导权问题,噪声影响取决于具体设计,二者孰优并无绝对结论
  • 专用系统:精简OS(如Volumio、Roon)减少电脑的多任务干扰

流媒体协议:

  • UPnP/DLNA、AirPlay 2(ALAC编码)、Roon RAAT(专有低延迟协议)
  • MQA:折叠高频信息至较低采样率容器,本质是有损编码,其"无损"宣传长期存在争议;MQA Ltd 已于 2023 年进入破产管理并被 Lenbrook 收购,Tidal 等主要平台已转向 FLAC,属于正在退场的格式

参考资料:

1.Ken C. Pohlmann, Principles of Digital Audio, 6th Edition, McGraw-Hill, 2010

2.H. Nyquist, “Certain Topics in Telegraph Transmission Theory”, Trans. AIEE, 1928

3.C. E. Shannon, “Communication in the Presence of Noise”, Proc. IRE, 1949

4.Bob Katz, Mastering Audio: The Art and the Science, 3rd Edition, 2014

DAC

数字信号的本质

声音是空气的振动,麦克风把这种振动转换为连续变化的电压(模拟信号)。为了存储和传输,我们需要对这个连续信号进行采样和量化:

1
2
3
4
5
时间 →  0ms    1ms    2ms    3ms    4ms    5ms...
电压 →  0.5V   0.8V   0.3V  -0.2V  -0.6V  -0.1V...
           │      │      │      │      │      │
           ▼      ▼      ▼      ▼      ▼      ▼
          采样   采样    采样    采样    采样   采样

每个采样点用一个数字表示。比如用16位二进制:

采样电压量化值16位二进制
+满幅327670111 1111 1111 1111
000000 0000 0000 0000
-满幅-327681000 0000 0000 0000

关键:数字信号只是一串0和1,每个位代表一个“开关”是开还是关。它不是电压,不是声音,也不是任何物理量本身——它只是对信息的编码。

DAC 的任务

DAC(Digital-to-Analog Converter,数模转换器)的任务很简单:

根据一串数字码,生成一个与其数值对应的模拟电压或电流。

例如:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
数字码:

1011

↓ 解析为二进制

8 + 0 + 2 + 1 = 11

↓ DAC

输出一个与11对应的模拟电压

理想情况下:

$$ V_{out}=K\times\sum_{k=0}^{N-1}b_k2^k $$

其中:

  • $b_k$ 是第 $k$ 位的值(0或1,$b_0$ 为最低位 LSB,$b_{N-1}$ 为最高位 MSB)
  • $N$ 是数字码的位数
  • $K$ 是比例系数(理想 DAC 中 $K=V_{ref}/2^N$,使满码输出趋近 $V_{ref}$)

因此,DAC的核心问题可以简化为:

如何让不同的数字位产生不同的模拟权重?

最直观的答案是:使用不同大小的电阻。

权电阻网络

权电阻网络是最直观的DAC。

二进制权重

以4位数字为例:

1
2
3
4
5
b₃ b₂ b₁ b₀

权重:

8   4   2   1

例如:

1
1011 = 8 + 0 + 2 + 1 = 11

如果每一位都控制一条电流路径,就可以让不同的位产生不同大小的电流:

$$ I_k=\frac{V_{ref}}{2^kR} $$

最终:

$$ I_{total}= \sum_{k=0}^{N-1} b_k\frac{V_{ref}}{2^kR} $$

(下标约定与上文一致:$b_0$ 为 LSB,权重最小、串联电阻最大;$b_{N-1}$ 为 MSB,权重最大、电阻最小。)

再通过电流-电压转换得到输出。

权电阻网络的问题

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
        Vref
          │
         ┌┴┐
         │ │ R        MSB
         └┬┘
          ├── 开关 ───┐
         ┌┴┐          │
         │ │ 2R
         └┬┘          │
          ├── 开关 ───┤
         ┌┴┐          │
         │ │ 4R
         └┬┘          │
          ├── 开关 ───┤
         ...
         ┌┴┐
         │ │ 2ⁿR      LSB
         └┬┘          │
          ├── 开关 ───┤
          └───────────┘
                │
              运放
                │
              Vout

它的思想非常直观:

1
2
3
4
5
6
7
MSB → 最大电流
 ↓
下一位 → 一半电流
 ↓
下一位 → 再减半
 ↓
LSB → 最小电流

问题也同样明显。

如果是8位DAC:

数字位所需电阻
b₇(MSB)R
b₆2R
b₅4R
b₄8R
b₃16R
b₂32R
b₁64R
b₀(LSB)128R

如果:

$$ R=1k\Omega $$

那么最大和最小电阻之间已经相差128倍。

对于更高位数的DAC,电阻比例会以指数形式增长:

1
2
16 bit → 1 : 65536
24 bit → 1 : 16777216

在芯片内部制造并精确匹配如此巨大的电阻范围显然非常困难。

因此,工程师提出了R-2R梯形网络。


R-2R 梯形网络

核心思想

R-2R网络只需要两种名义阻值:

1
2
R
2R

通过重复的结构,利用电阻分压实现二进制权重。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
        Vref
          │
         2R
          │
          ├──── 开关 MSB
          │
          R
          │
         2R
          │
          ├──── 开关
          │
          R
          │
         2R
          │
          ├──── 开关
          │
         ...
          │
          R
          │
         2R
          │
          └──── GND

二进制权重的实现

R-2R网络的关键在于:

从每一级看进去,后面的网络都可以被等效为相同的负载。

因此,每经过一级,电压或电流就会减半:

1
2
3
4
5
6
7
8
9
MSB: Vref / 2
       ↓
      Vref / 4
       ↓
      Vref / 8
       ↓
      Vref / 16
       ↓
       ...

恰好对应:

1
2
3
4
5
1/2
1/4
1/8
1/16
...

R-2R 相比权电阻的优势

特性权电阻网络R-2R网络
所需名义阻值多种2种
匹配关系多种比例主要是1:2
匹配难度很高相对较低
芯片面积较大较小
工程实现困难成熟

但R-2R仍然依赖:

  • 电阻匹配
  • 开关精度
  • 参考电压稳定性
  • 温度稳定性
  • I/V转换电路

因此,R-2R DAC的核心难点不是“能不能产生电压”,而是:

能否让每一个数字码都产生足够准确的模拟电平。


电流舵

R-2R网络的开关需要在不同电压节点之间切换。

当速度提高时,开关的:

  • 导通电阻
  • 寄生电容
  • 电荷注入
  • 开关延迟

都会影响线性度。

电流舵DAC采用另一种思路,把转换从电压域搬到电流域:

使用一组电流源,并通过开关将这些电流导向不同的输出节点或支路。

1
2
3
4
5
6
7
        电流源 I
            │
       ┌────┴────┐
       │         │
     开关1      开关2
       │         │
     OUT+       OUT-

在一个简化的差分结构中:

1
2
输入1 → 电流导向 OUT+
输入0 → 电流导向 OUT-

而不是:

1
2
输入1 → 电流源开启
输入0 → 电流源关闭

因此可以避免部分电流源反复启停造成的问题,并有利于降低高速转换中的毛刺;但实际毛刺性能仍取决于开关结构、时序和电流单元的匹配。


电流舵 DAC 的分段结构

单元电流源

假设每个单元都是:

$$ I_{unit}=I $$

那么:

数字码接通单元数输出电流
000000I
000111I
001022I
001133I
………
11111515I

这种方式称为温度计码(Thermometer Code)。

为什么不直接使用二进制权重?

假设一个4位DAC使用二进制电流源:

1
2
3
4
1I
2I
4I
8I

从:

1
0111 → 1000

变化时,四个开关可能同时翻转。

由于每个开关的实际延迟不同:

1
2
3
4
5
0111
 ↓
0000
 ↓
1000

输出可能短暂经过错误的电流值,从而产生毛刺。

温度计码则将输出分成许多相同的单元:

1
2
3
4
5
6
7
8
9
0000
 ↓
0001
 ↓
0011
 ↓
0111
 ↓
1111

在理想的单调码转换过程中,相邻输出码只需要增加或减少一个相同的电流单元。

因此高位通常使用温度计码,低位使用二进制码,这种结构称为分段式DAC。

实际的分段点需要根据具体架构进行设计:

1
2
3
4
5
6
7
高位 → 温度计码
      ↓
      更好的单调性与毛刺性能

低位 → 二进制码
      ↓
      更少的硬件资源

I/V 转换

电流型DAC输出的是:

$$ I_{out} $$

而音频系统通常需要:

$$ V_{out} $$

因此需要:

$$ I\rightarrow V $$

电阻负载

最简单的方式:

1
2
3
4
Iout ─── Rload ─── GND
          │
          ▼
         Vout

根据欧姆定律:

$$ V_{out}=I_{out}R_{load} $$

缺点是:

  • DAC输出端电压会随电流变化
  • 电流源的工作状态会受到输出电压影响
  • 线性度可能下降
  • 输出摆幅受到限制

运放 I/V 转换

更常见的方式是跨阻放大器:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
                 Rfb
          ┌─────/\/\────┐
          │             │
Iout ─────┴───(-)       │
                │\      │
                │ \_____┴── Vout
                │ /
                │/
               (+)
                │
               GND

负反馈使:

$$ V_-\approx V_+=0V $$

因此DAC输出端的电压变化较小。

理想情况下:

$$ V_{out}=-I_{out}R_{fb} $$

这就是:

跨阻放大器(Transimpedance Amplifier,TIA)。


重建滤波器

DAC 为什么还需要滤波?

数字采样产生的频谱并不只有原始音频。

以44.1kHz采样为例:

1
2
3
4
5
6
7
8
原始音频:
0 ───────── 20kHz

第一镜像(以 fs=44.1kHz 为中心对称复制):
24.1kHz ─── 64.1kHz

第二镜像(以 2fs=88.2kHz 为中心):
68.2kHz ─── 108.2kHz

注意:镜像以采样率的整数倍为中心,带宽与基带相同(±20kHz)。第一镜像的下沿 $f_s - f_{max} = 44.1 - 20 = 24.1$ kHz 才是离基带最近、最需要被滤除的分量。以上仅为频率位置示意,未反映零阶保持引入的 sinc 幅度包络(镜像幅度随频率按 sin(x)/x 衰减)。

因此DAC之后需要:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
DAC
 │
 ▼
基带 + 采样镜像
 │
 ▼
模拟低通滤波器
 │
 ▼
模拟音频

理想滤波器:

1
2
3
4
5
6
7
8
9
幅度
  │
1 ├───────────┐
  │           │
  │           └────────
  │
  └────────────────────────→ 频率
              ↑
          截止频率

实际滤波器不可能无限陡峭。

这就产生了一个问题:

1
2
3
4
20kHz       24.1kHz
  │             │
  ▼             ▼
音频上限      第一镜像下沿

44.1kHz系统的过渡带(20kHz → 24.1kHz)只有约 4.1kHz,非常窄。

这就是为什么现代DAC大量使用数字过采样。


NOS

NOS(Non-Over-Sampling)DAC的特点是:

输入采样率是多少,DAC核心就以多少采样率工作,不进行数字插值。

例如:

1
2
3
4
5
6
7
44.1kHz PCM
     │
     ▼
直接DAC转换
     │
     ▼
模拟输出

而现代过采样DAC:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
44.1kHz PCM
     │
     ▼
数字插值
     │
     ▼
352.8kHz
     │
     ▼
DAC核心

NOS 并不是“没有滤波器”。它只是:不在数字域进行插值。


NOS 的高频衰减

如果 DAC 将每个采样值保持一个完整的采样周期:

1
2
3
4
5
6
7
8
9
采样点:

●────●────●────●

零阶保持:

┌───┐
│   └───┐
│       └───┐

这称为:Zero-Order Hold(ZOH,零阶保持)。

零阶保持的频率响应为:

$$ H(f)=T\cdot \mathrm{sinc}(fT) $$

归一化后:

$$ |H(f)| = \left| \frac{\sin(\pi f/f_s)}{\pi f/f_s} \right| $$

因此:频率越高,零阶保持的输出幅度越低。

对于采用零阶保持等传统保持型输出方式的 NOS DAC,这就是其高频滚降的主要数学原因。

不过,实际产品的最终频响还会受到以下等因素影响:

  • DAC 输出结构
  • 模拟滤波器
  • 输出级带宽
  • 是否采用 sinc 补偿

因此,理论 ZOH 响应不一定等于最终测得的产品频响。

定量计算理论衰减

当:

$$ f_s=44.1kHz $$$$ f=20kHz $$

则:

$$ |H(f)| = \left| \frac{\sin(\pi\times20000/44100)}{\pi\times20000/44100} \right| \approx0.694 $$

换算为分贝:

$$ 20\log_{10}(0.694) \approx-3.17dB $$

因此:

理想 44.1kHz NOS DAC 仅考虑零阶保持时,在20kHz处的理论幅度衰减约为 3.17dB。

对于不同采样率:

采样率20kHz处理论ZOH衰减
44.1kHz≈ -3.17dB
96kHz≈ -0.63dB
192kHz≈ -0.16dB

采样率越高,20kHz 相对于采样率越低,ZOH造成的高频衰减越小。


NOS 产生较近的采样镜像

NOS 不进行数字插值,因此镜像频谱仍然靠近基带:

1
2
3
4
5
6
44.1kHz采样:

0 ─────── 20kHz
          │
          │
24.1kHz ─────── 64.1kHz

因此 NOS DAC 的信号流是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
数字采样
    │
    ▼
零阶保持
    │
    ▼
基带 + 高频镜像
    │
    ▼
模拟低通滤波器
    │
    ▼
模拟输出

所以:

NOS DAC 不是没有重建滤波器,而是把更多的重建任务交给了模拟滤波器。


过采样

如果对44.1kHz信号进行8倍插值:

1
2
3
44.1kHz
    ↓
352.8kHz

那么第一组镜像的中心位于 352.8kHz 附近。

如果原始音频带宽为 0~20kHz,则第一组镜像大约位于:

$$ 352.8-20=332.8kHz $$

到:

$$ 352.8+20=372.8kHz $$

之间。

1
2
3
4
0~20kHz
    │
    │
    └────────────── 第一组镜像约 332.8~372.8kHz

相比原始 44.1kHz 系统:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
原始采样:

20kHz ─── 22.05kHz
   ↑          ↑
音频上限    镜像

8×过采样:

20kHz ─────────────── 332.8kHz
   ↑                       ↑
音频上限                第一组镜像

模拟滤波器的过渡带大幅变宽,因此:

过采样并不是为了创造新的音频信息,而是为了让重建滤波器更容易实现,把滤波工作搬到数字域。


Delta-Sigma DAC

现代音频DAC的主流架构之一是 Delta-Sigma(ΔΣ)DAC。它的基本思路是用速度换精度,即:

提高采样率,并利用噪声整形把量化噪声推向高频。

典型结构:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
PCM 输入
   │
   ▼
数字插值滤波器
   │
   ▼
提高采样率
   │
   ▼
Delta-Sigma 调制器
   │
   ▼
低位数高速数据
   │
   ▼
DAC 核心
   │
   ▼
模拟滤波器
   │
   ▼
模拟输出

噪声整形

量化一定会产生误差。

普通量化:

1
2
3
4
5
量化噪声
  │
  │ ───────────────
  │
  └────────────────→ 频率

Delta-Sigma 通过反馈环路重新分配噪声:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
噪声
  │
  │                 /
  │                /
  │               /
  │              /
  │_____________/
  └────────────────→ 频率
       ↑
    音频带宽

结果:音频带内,噪声尽可能低;超声频段,噪声被推高。

需要注意的是:

噪声整形并没有消除量化噪声,而是重新分配了噪声的频谱能量。

通过模拟低通滤波器,可以去除其中的大部分超声频率成分。


1-bit 不等于 ΔΣ

早期和部分经典 ΔΣ DAC使用 1-bit 量化器,其优势是:

  • 只有两个模拟状态
  • 不需要匹配多个模拟电平
  • 理论上容易保证单调性

但缺点是:

  • 量化器本身的量化误差较大
  • 需要更强的噪声整形
  • 需要更高的过采样率
  • 高频超声噪声可能较强

因此:

“Delta-Sigma DAC 内部是 1-bit ”是对部分架构的描述,不是现代 Delta-Sigma DAC 的普遍规律。


现代 ΔΣ DAC通常采用多位量化

现代音频DAC中存在大量多位 Delta-Sigma 架构。

但需要注意:现代音频 ΔΣ DAC 并不存在统一的量化器位数。

量化器可以采用:

1
2
3
4
5
6
7
1 bit
  ↓
少数几bit
  ↓
5~6 bit
  ↓
更多bit

具体选择取决于整个架构的工程折中。

例如:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
输入:

24 bit / 192kHz
        ↓
数字插值 + 噪声整形
        ↓

高速数据:

数bit / 数MHz甚至更高
        ↓
多位DAC核心

这里必须区分:

输入PCM的位深,与 Delta-Sigma 调制器输出的位数不是同一个概念。

并不意味着:

1
2
3
4
5
24 bit
   ↓
简单压缩
   ↓
5 bit

更准确的理解是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
输入:
较高的幅度分辨率
        │
        ▼
数字插值 + 噪声整形
        │
        ▼
较低的单次幅度分辨率
        │
        │
        └── 但采样率大幅提高
                │
                ▼
        大量高速采样点
                │
                ▼
        模拟滤波
                │
                ▼
        高带内分辨率

在过采样和噪声整形的帮助下,系统可以用较低的单次量化精度和更高的时间采样密度,降低音频带宽内的量化噪声。


现代 ΔΣ DAC 的量化位数

为什么许多现代多位 Delta-Sigma DAC 选择几位到数位量化?这是一个工程折中。

量化器优点缺点
1 bit模拟匹配简单量化噪声和噪声整形压力大
2~4 bit在复杂度和噪声之间折中仍有一定噪声整形压力
5~6 bit单次量化误差较低需要更好的模拟匹配
更高位数单次量化精度更高模拟线性度和匹配难度增加

因此:

增加量化器位数可以降低单次量化误差,减轻噪声整形的压力;但同时,DAC核心需要生成更多精确的模拟电平,对电流源或电阻的匹配提出更高要求。

实际设计通常需要在以下因素之间进行折中:

1
2
3
4
5
6
7
量化器位数
      ↕
过采样率
      ↕
噪声整形复杂度
      ↕
模拟DAC核心的线性度

因此:

5~6 bit可以是某些现代多位 ΔΣ 架构的典型范围,但不能代表所有现代音频 DAC。


多位 DAC 需要 DEM

假设多个电流单元理论上应该完全相同:

1
2
3
I₁ = 1.000mA
I₂ = 1.000mA
I₃ = 1.000mA

但实际制造中:

1
2
3
I₁ = 1.000mA
I₂ = 0.998mA
I₃ = 1.003mA

如果每次都使用固定的电流单元:

1
2
输出码A → I₁ + I₂
输出码B → I₁ + I₃

误差就会形成确定性的失真。

**DEM(Dynamic Element Matching,动态元件匹配)**的做法是轮换使用不同的单元:

1
2
3
4
第1次:I₁ + I₂ + I₃
第2次:I₄ + I₅ + I₆
第3次:I₂ + I₄ + I₇
第4次:I₁ + I₅ + I₈

这样:

1
2
3
4
5
静态匹配误差
      ↓
动态化
      ↓
更容易被整形或滤除的高频误差

DEM 的本质不是让元件变得完全一致,而是将固定的元件失配误差转换成更容易处理的动态误差。

DAC 架构对比

特性NOS R-2R过采样 Delta-Sigma
数字插值无有
DAC工作采样率原始采样率通常更高
20kHz附近频响可能存在ZOH滚降通常可以实现更平坦的频响
镜像频率较近被推远
模拟滤波器要求较高相对较低
主要难点电阻匹配噪声整形与多位匹配
典型实现R-2R多位ΔΣ

因此:

NOS的核心代价是可能存在ZOH高频滚降和较近的镜像;过采样的核心代价是更复杂的数字滤波和更高的超声频率能量。

两者都是工程取舍。

完整信号流总结

从文件到耳朵:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
┌──────────────────────────────────────────────────────┐
│                      数字域                           │
│                                                      │
│     音频文件 → 解码 → PCM数据流                         │
│                         │                            │
│                         ▼                            │
│                 数字滤波 / 音量控制                     │
│                         │                            │
│              ┌──────────┴────────┐                   │
│              │                   │                   │
│           NOS路径            过采样路径                │
│              │                   │                   │
│              │              插值/过采样                │
│              │                   │                   │
│              │              Delta-Sigma              │
│              │                噪声整形                │
│              │                   │                   │
└──────────────┼───────────────────┼───────────────────┘
               │                   │
               ▼                   ▼
          R-2R DAC            多位DAC核心
               │                   │
               └────────┬──────────┘
                        ▼
                     I/V转换
                        │
                        ▼
                   模拟重建滤波
                        │
                        ▼
                   输出缓冲/驱动
                        │
                        ▼
                     耳机/音箱

关键物理量总结

概念物理意义主要决定因素
分辨率最小可分辨电压步进位数
满幅电压最大输出电压参考电压、增益
线性度实际输出偏离理想值的程度元件匹配、温度
建立时间输出达到稳定值所需的时间开关速度、带宽
毛刺码变化时的瞬态误差开关时序、寄生参数
SNR信号与噪声的比值噪声底
动态范围最大信号与噪声底之差模拟和数字噪声
THD谐波失真转换器与输出级非线性
抖动采样时刻的时间误差时钟系统
ZOH滚降零阶保持导致的高频衰减采样率
重建滤波去除采样镜像和超声噪声数字/模拟滤波器

关于抖动值得补充量级概念:随机抖动对采样信噪比的影响约为 $SNR_{jitter}=-20\log_{10}(2\pi f, t_{jitter})$,频率越高越敏感。而人耳对抖动的可闻阈值远宽松于发烧叙事所暗示的水平——实验表明,正弦抖动在高电平高频纯音这一最有利条件下的检测阈约为 10ns 量级,音乐节目下还要高出 1–2 个数量级。现代异步 USB 与 PLL 方案的典型抖动已在 ns 甚至亚 ns 级,远低于任何可闻阈值,这是"现代方案已将抖动降至可忽略水平"这一判断的定量依据。

核心结论

从信号处理角度看:

  • R-2R:用精密模拟元件直接实现数字码到模拟量的映射
  • 电流舵:通过将电流导向不同输出路径实现高速数模转换
  • I/V转换:把DAC输出的电流转换为电压
  • 重建滤波:去除采样产生的镜像频谱
  • NOS:不进行数字插值,因此传统零阶保持结构可能产生随频率升高而增加的高频滚降
  • 过采样:把镜像推向更高频率,降低模拟滤波器的过渡带要求
  • Delta-Sigma:利用高采样率和噪声整形降低可听频段内的量化噪声
  • 现代多位Delta-Sigma:通过量化器位数、过采样率、噪声整形和模拟DAC核心线性度之间的工程折中实现高带内性能

因此:

DAC并不是简单地把“0和1”变成电压。

它实际上是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
数字采样
   ↓
数字滤波/插值
   ↓
噪声整形
   ↓
多位或1位量化
   ↓
DAC核心
   ↓
电流/电压转换
   ↓
模拟重建滤波
   ↓
输出缓冲
   ↓
模拟音频

不同 DAC 架构的主要差异,不在于某一种架构是否拥有某种神秘的“声音”,而在于:

它们把精度、噪声、失真、滤波和实现难度分配到了信号链的不同位置。

参考资料:

1.Ken C. Pohlmann, Principles of Digital Audio, 6th Edition, McGraw-Hill, 2010

2.Walt Kester (ed.), The Data Conversion Handbook, Analog Devices / Newnes, 2005

3.Richard Schreier & Gabor C. Temes, Understanding Delta-Sigma Data Converters, Wiley, 2005

4.dCS, Ring DAC Explained https://dcsaudio.com/assets/dCS-Ring-DAC-Explained.pdf

DSP:以 HQPlayer 为例

在信号抵达 DAC 之前,数字域是最后一个可以精确控制、无损处理的环节。HQPlayer 本质上是一个高精度数字信号处理引擎,它将重采样、抖动/噪声整形、Delta-Sigma 调制、卷积均衡与矩阵路由等工具整合为一条完整的处理链路。

重采样滤波器

DAC 章节已阐明过采样的物理意义:将采样镜像推向更高频率,降低模拟重建滤波器的压力。但具体选择何种数字滤波器,涉及对理想低通重建核的不同工程逼近。

理想重建滤波器的脉冲响应为 sinc 函数:

$$ h(t) = \frac{\sin(2\pi f_c t)}{2\pi f_c t} $$

(此处为归一化形式,$h(0)=1$;理想低通滤波器严格的脉冲响应为 $2f_c,\mathrm{sinc}(2f_c t)$,相差的增益因子可被通带增益吸收,不影响此处关于形状的讨论。)

该响应在时域无限延伸且非因果($t<0$ 时非零),任何实际实现都必须在时域截断,并引入窗函数。截断导致吉布斯现象(频域通带波纹与阻带泄漏),而非因果性则表现为预振铃(pre-ringing)——在瞬态信号到达之前出现非零输出。

HQPlayer 的滤波器家族可按相位特性与时频权衡分类:

线性相位滤波器

系数满足对称性 $h[k] = h[N-1-k]$,所有频率分量具有相同群延迟,保持波形完整性。代价是存在对称的预振铃与后振铃。

滤波器特点适用场景
poly-sinc-lp通用线性相位,适度预振铃古典音乐、室内乐
poly-sinc-long-lp更长核,更陡峭滚降、更高阻带衰减对频响纯净度要求高的场景
poly-sinc-ext2极陡峭滚降,完全截止于奈奎斯特频率,两阶段处理追求极致频响与谐波结构
poly-sinc-gauss-long高斯型,最优时频联合分辨率,极高阻带衰减兼顾时域与频域性能
sinc-M / sinc-Mx百万级抽头,恒定或自适应长度最高技术质量源素材

最小相位滤波器

将能量集中于因果部分,消除预振铃,但引入相位非线性(不同频率群延迟不同)。适合包含强瞬态的录音。

滤波器特点适用场景
poly-sinc-mp无预振铃,后振铃较长流行、摇滚、电子
poly-sinc-shrt-mp更短后振铃,瞬态响应最优鼓点、打击乐
poly-sinc-long-mp更长后振铃,改善滚降陡度需要更好衰减的最小相位场景

中间相位与切趾滤波器

中间相位(Intermediate Phase) 如 poly-sinc-long-ip,在预振铃与相位非线性之间取折中:极小预振铃 + 轻微群延迟差异,适合爵士、布鲁斯等既需要一定空间感又含瞬态的音乐。

切趾(Apodizing)滤波器 的设计目标是修复源信号中已存在的预振铃缺陷。许多现代录音在 ADC 或母带阶段使用了锐截止数字滤波器,引入了可测量的预振铃误差。HQPlayer 主界面的 “Apod” 计数器 统计了此类误差的检测次数。手册明确指出:当单 track 的 Apod 计数超过 10 时,强烈建议使用 apodizing 滤波器(如 poly-sinc-gauss-xla)。其原理并非简单叠加"味道",而是用具有优化时频响应的核覆盖原始缺陷。

特殊用途滤波器

  • poly-sinc-mqa/mp3-lp:针对 MQA 或 MP3 编码内容优化,清理编码过程引入的高频噪声,早期缓滚降
  • poly-sinc-hires-lp:专为 HiRes 内容设计,极高阻带衰减,同时适用于有损压缩格式回放
  • IIR / IIR2:模拟风格滤波器,无预振铃但长后振铃,类似模拟滤波器的相位特性

选择逻辑:以下音乐类型与滤波器的对应关系属于经验性偏好而非科学定论——预振铃的可闻性在双盲测试中并未稳固确立,仅供参考。先观察 Apod 计数 → 超过 10 则必须用 apodizing;未超过时,古典/真实声学录音优先线性相位,流行/电子/强瞬态优先最小相位,爵士/布鲁斯可考虑中间相位。


字长缩减

HQPlayer 内部以 64-bit 浮点精度运算,但 DAC 硬件通常只接受 24-bit、16-bit 或 1-bit(DSD)。将高位深信号降至硬件位深的过程称为字长缩减(Word-length Reduction),其核心挑战是控制量化误差。

设量化步长为 $\Delta$,舍入量化器定义为:

$$ Q(x) = \Delta \cdot \text{round}\left(\frac{x}{\Delta}\right) $$

量化误差 $\epsilon = x - Q(x)$,满足 $|\epsilon| \leq \Delta/2$。

若输入 $x[n]$ 为低频正弦信号,确定性舍入会使 $\epsilon[n]$ 呈现与信号相关的周期性模式,产生谐波失真。例如 1kHz 正弦经 16-bit 直接舍入,谐波失真可能达到 -90dB 以下,但在安静段落或高增益系统中仍可闻。

抖动

抖动(Dither)通过添加随机噪声打破量化误差与信号的相关性。设抖动噪声为 $\nu[n]$,则:

$$ Q(x[n] + \nu[n]) - x[n] \approx \nu[n] + \epsilon_q[n] $$

其中 $\epsilon_q[n]$ 为与信号独立的量化噪声。

RPDF(矩形分布):白噪声,概率密度 $p(\nu) = \frac{1}{\Delta}$($|\nu| \leq \Delta/2$),方差 $\Delta^2/12$。计算轻量,但仅适合 24-bit 以上输出。

TPDF(三角分布):两个独立 RPDF 之和,概率密度:

$$ p(\nu) = \frac{1}{\Delta}\left(1 - \frac{|\nu|}{\Delta}\right), \quad |\nu| \leq \Delta $$

方差 $\sigma^2 = \Delta^2/6$。TPDF 是行业标准,可将谐波完全转化为白噪声,适用于任何采样率,是 44.1/48kHz 回放的首选。

Gauss1(高斯分布):平坦频谱的高质量抖动,推荐用于 ≤96kHz 且不使用噪声整形的场景。

噪声整形

抖动将谐波转化为白噪声,而噪声整形(Noise Shaping)进一步利用反馈环路将噪声能量从低频推向高频。$M$ 阶噪声整形系统的 z 域噪声传递函数为:

$$ NTF(z) = (1 - z^{-1})^M $$

频域功率谱密度:

$$ S_{noise}(f) = S_q(f) \cdot \left|2\sin\left(\frac{\pi f}{f_s}\right)\right|^{2M} $$

在音频带内($f \ll f_s$),近似有:

$$ |NTF(f)| \approx \left(\frac{2\pi f}{f_s}\right)^M $$

即每倍频程噪声功率下降 $6M$ dB。但代价是超声频段噪声被急剧放大,必须由后级模拟低通滤波器抑制。

HQPlayer 提供的噪声整形选项具有明确的工程定位:

选项阶数/类型推荐采样率说明
NS11阶≥176.4kHz简单噪声整形,超声敏感设备慎用
NS44阶≥88.2kHz类似传统"shaped dither"
NS55阶8x/16x (352.8kHz+)激进整形,适合 PCM1704 等
NS99阶4x (176.4/192kHz)专为 4x 率设计,适合 TDA154x 等老式 16-bit DAC
LNS1515阶线性16x (705.6/768kHz)平滑斜率,专为最高 PCM 率优化
shaped成型 dither≥88.2kHz噪声频谱经成型以降低可闻度

关键认知:噪声整形并未消除噪声,而是依据人耳绝对听阈的频谱形状(对 2–5kHz 最敏感,对低频与超声频段不敏感;A-weighting 曲线正是这一特性的粗略近似,但它描述的是等响度加权而非掩蔽效应)重新分配频谱能量。配合过采样将噪声推向 MHz 级频率,后级模拟滤波器可在保留音频带内极高动态范围的同时,去除超声噪声。


Delta-Sigma 调制

当输出模式设为 SDM(DSD)时,HQPlayer 需要将多 bit PCM 转换为 1-bit 或少数几位的超高采样率码流。这一过程由 Delta-Sigma 调制器完成。

$M$ 阶 ΔΣ 调制器的线性化模型给出信号传递函数(STF)与噪声传递函数(NTF):

$$ STF(z) = 1, \quad NTF(z) = (1 - z^{-1})^M $$

频域幅度响应:

$$ |NTF(f)| = \left|2\sin\left(\frac{\pi f}{f_s}\right)\right|^M $$

调制阶数 $M$ 的选择是噪声抑制与超声噪声能量的权衡:

  • 5 阶:超声噪声能量相对较低,适合模拟重建滤波器较简单的 DAC
  • 7 阶:低频噪声抑制更强,但超声噪声更激进,要求 DAC 具备更好的高频滤波能力

HQPlayer 调制器体系

系列阶数特性适用 DAC
DSD5 / DSD75 / 7固定配置,非自适应简单重建滤波的 DAC
ASDM5EC / ASDM7EC5 / 7自适应 + 扩展补偿主流 ΔΣ DAC;ESS Sabre 推荐 5 阶
ASDM*EC-light5 / 7轻量版,降低 CPU 负载性能受限系统
ASDM*EC-fast5 / 7瞬态与负载优化实时性要求高的场景
ASDM*EC-super5 / 7超级版,更高精度计算资源充足时
ASDM*EC-512+fs5 / 7专为 512x 及以上率优化DSD512/DSD1024 输出
AMSDM77伪多比特≥20.48 MHz 输出率
AHM7EC5L75电平混合(实验性)扬声器系统,不建议作为数字音量控制

自适应调制器(ASDM) 的核心在于根据输入信号动态调整调制器参数。对于低电平高动态信号,优化噪声频谱分布;对于大信号,防止调制器过载。手册特别指出:

使用 PCM→SDM 转换时,建议数字音量不超过 -3 dBFS。高过采样比会产生显著的样间过冲(inter-sample overs),而过载 ΔΣ 调制器会产生明显的噪声。HQPlayer 会自动监测调制深度,必要时限制在 50% 以维持保真度。

DirectSDM 选项可在源为 DSD 且输出为 DSD 时完全旁路所有处理(包括音量控制),此时 PCM 音量固定为 -3 dBFS。这实现了 bit-perfect 的 DSD 直通,但牺牲了数字音量调节能力。


卷积引擎

卷积是 LTI(线性时不变)系统在时域的完全表征。输出信号 $y[n]$ 是输入 $x[n]$ 与系统脉冲响应 $h[n]$ 的离散卷积:

$$ y[n] = \sum_{k=0}^{L-1} h[k] \cdot x[n-k] $$

对于房间校正或耳机均衡,脉冲响应长度 $L$ 可达数万甚至数十万样点,直接卷积的计算复杂度为 $O(N \cdot L)$,计算量巨大。

HQPlayer 提供两种基于 FFT 的快速卷积算法:

Overlap-add:将输入信号分块,每块补零后做 FFT,与 $H(k)$ 频域相乘,IFFT 后将重叠部分相加。计算复杂度降至 $O(N \log L)$,CPU 占用较低,推荐。

Overlap-save:另一种分块 FFT 方法,通过重叠保留而非重叠相加实现,计算量略大,但在某些边界条件下具有数值优势。

脉冲响应的工程要求

  • 格式:单声道 RIFF (WAV) 格式
  • 采样率:建议使用 352.8kHz 采样的扩展频响滤波器。此时高频响应已覆盖所有可能的需求,可禁用 “Expand HF”,避免 HQPlayer 对低频 IR 进行高频外推引入 artifacts
  • 增益补偿:HQPlayer 自动计算 IR 的估计增益,显示于 “IR gain” 框。用户可据此设置 “Gain compensation”。当选择正增益补偿时,该补偿在卷积被禁用时以负增益形式应用,便于 A/B 对比

重要:当源素材采样率与脉冲响应采样率不同时,HQPlayer 会自动将 IR 重采样至源素材率。对于大型 IR 文件,此操作可能显著增加 CPU/GPU 负载。建议预先准备与目标播放率匹配的 IR 文件。 注意:卷积引擎与矩阵处理器不建议同时启用。若需在矩阵处理中使用 EQ,应直接在矩阵的 “Process” 列加载 IR 文件,而非同时开启简单卷积引擎。


矩阵处理

矩阵处理是 HQPlayer 最强大的 DSP 功能,支持最多 128 个虚拟通道(pipeline),可实现跨通道混合、滤波、延迟与相位控制。

通道路由与混合

  • Source Ch:指定输入源通道
  • Mix Ch:指定逻辑输出通道
  • Gain:支持 dB 或线性标度。线性标度下负值可实现相位反转,支持 M/S(Mid/Side)处理

当多个虚拟通道映射到同一输出通道时,输出为各通道之和:

$$ y_{out}[n] = \sum_{i} g_i \cdot x_{src_i}[n] $$

参数均衡(IIR 插件)

基于双二次(Biquad)滤波器,标准传递函数:

$$ H(z) = \frac{b_0 + b_1 z^{-1} + b_2 z^{-2}}{1 + a_1 z^{-1} + a_2 z^{-2}} $$

支持的滤波器类型及参数:

类型参数说明
lp / hpf=频率, q=Q / s=斜率低通/高通
lp1 / hp1f=频率一阶低通/高通
peakf, q/bw, g=增益(dB)峰值/凹陷
lshelf / hshelff, q/s, g低/高搁架
notchf, q/bw陷波
biquadb0,b1,b2,a0,a1,a2原始系数

IIR to FIR 转换:HQPlayer 可将参数 EQ 转换为 FIR 卷积实现。勾选时转换为线性相位 FIR(引入预振铃,适合平缓 EQ);未勾选时转换为最小相位 FIR(保留原始最小相位特性)。高 Q 值、大增益的 EQ 设置在线性相位转换下会产生显著预振铃,需谨慎使用。

延迟与距离补偿

“delay” 插件支持三种延迟定义:

  • 样本数:s=样本数
  • 时间:t=秒数
  • 距离:d=米数,声速默认 $v = 343.956,\text{m/s}$

距离到延迟的转换:

$$ \Delta t = \frac{d}{v} $$

HQPlayer 自动按当前目标采样率将时间转换为样本延迟。结合 “Channel balance” 中的距离设置,可精确补偿多声道系统中各扬声器到听音位的到达时间差。值得注意的是,距离处理在 DirectSDM 模式下依然可用,实现了 DSD bit-perfect 直通下的时延补偿。

后处理

  • Bauer cross-feed:耳机交叉馈送,通过模拟扬声器串扰增强空间感。支持自定义截止频率与电平
  • Loudness:响度自适应控制,随音量调整低频/高频补偿
  • Correction:特定 DAC 型号与输出率下的校正曲线,修正 DAC 的非理想频响

电平控制与动态管理

限幅器

HQPlayer 内置软膝限幅器,当任何通道输出超过 0 dBFS 时自动衰减。限幅触发时:

  • 音量旋钮颜色变为红色
  • “Limited” 计数器递增

限幅灵敏度取决于所选滤波器和过采样比。高过采样比会放大样间过冲概率,因此手册强烈建议常规听音音量不超过 -3 dBFS。

固定音量

当不需要 HQPlayer 数字音量控制时(如使用外置模拟音量控制),可启用 Fixed Volume:

  • 勾选:固定音量约为 -3 dB,为典型音乐内容提供足够 headroom
  • 未勾选(灰色):固定音量约为 -6 dB,适合包含大量数字限幅/削波的重度压缩内容

将 Volume min 和 Volume max 设为相同值也可实现固定音量,但 Fixed Volume 选项针对典型 inter-sample over 进行了优化。

PCM 增益补偿

由于 DSD 的调制特性,许多 DAC 的 PCM 0 dBFS 与 DSD 0 dB 输出电平不同。HQPlayer 提供补偿表:

DAC 类型补偿值
AK4490-3.5 dB
AK4493-1 至 -3.5 dB
AK4499-4.1 dB
ESS Sabre0 dB
Holo Audio-6 dB
Denafrips-3.2 dB

自适应增益

开启自适应增益(Adaptive Gain)后,HQPlayer 会基于 ReplayGain 或库分析数据自动调整回放电平。库扫描时计算的关键指标包括:

  • True Peak:dBTP,提示是否存在样间过冲
  • RMS:均方根电平
  • LUFS:集成响度
  • LU:响度范围
  • Apod 计数:提示是否需要 apodizing 滤波器

若元数据包含正值增益,需预留额外 headroom,否则限幅器将频繁触发。

20kHz 滤波器

针对伪 HiRes 或先前被不良上采样的内容,HQPlayer 提供极高性能的 20kHz 低通滤波器。其设计优化了时间-频率性能,对 20kHz 以上提供快速陡峭衰减。

启用条件:仅在源采样率 ≥2x(≥88.2kHz)时生效。对于 44.1kHz 素材,20kHz 已接近奈奎斯特极限(22.05kHz),该滤波器无意义。


DSP 链路总览与决策框架

完整的 DSP 处理链路可概括为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
PCM/DSD 源
│
▼
[20kHz 滤波器] ── 可选,清理伪 HiRes
│
▼
[重采样滤波器] ── 1x/Nx 选择,时频权衡
│
▼
[矩阵处理] ── 可选,路由/EQ/延迟/卷积
│
▼
[字长缩减] ── 抖动/噪声整形
│
▼
[Delta-Sigma 调制] ── 若输出模式为 SDM
│
▼
[限幅器/音量控制] ── 电平管理
│
▼
DAC 硬件

参数选择决策树:

  1. 源分析:查看格式、采样率、Apod 计数、true peak
  2. 输出模式:R2R DAC → PCM;ΔΣ DAC → SDM(极少数 DAC 两种模式均优)
  3. 滤波器:Apod > 10 → 必用 apodizing;古典/真实声学 → 线性相位;流行/电子/强瞬态 → 最小相位;爵士/布鲁斯 → 中间相位
  4. 字长缩减:≤96kHz → TPDF/Gauss1;4x 率 → NS9;8x/16x 率 → NS5/LNS15
  5. SDM 调制器:ESS Sabre → ASDM5EC;其他多位 ΔΣ → ASDM7EC;512x+ → 选用 512+fs 优化版本;计算受限 → light 版本
  6. 后处理:先完成 Channel balance(电平/距离),再按需启用矩阵 EQ 或卷积

DSP 不是"调味剂",而是信号重建链路的最后一段数字优化。所有参数选择都应回归到可测量的目标:降低带内噪声、消除镜像、补偿物理系统缺陷、防止调制器过载。脱离测量数据的"听感描述",往往只是大脑对特定时域振铃或频响倾斜的适应性反应。

参考资料:

1.HQPlayer 官方手册(Signalyst),滤波器/调制器/字长缩减章节

2.A. V. Oppenheim & R. W. Schafer, Discrete-Time Signal Processing, 3rd Edition, Pearson, 2009

3.Stanley P. Lipshitz & John Vanderkooy, 关于抖动与噪声整形的 AES 系列论文

耳机

耳机是整个 HiFi 系统中最复杂的换能环节。DAC 和放大器主要处理电信号,而耳机需要把电信号转换为振膜的机械运动,再通过空气形成声压,最终与人的耳廓、耳道和鼓膜耦合。因此,耳机实际上是一套电—机械—声学耦合系统。

理解耳机,也就意味着需要从一个更基本的问题开始:

输入一个电信号之后,耳机的机械结构究竟如何把它变成空气压力?

在进入换能器结构之前,首先需要知道我们究竟应该如何测量这套系统。

耳机的重要测量指标

指标主要回答的问题
频率响应耳机在不同频率输出多少声音?
阻抗曲线耳机在不同频率下有多难驱动?
灵敏度给定电压或功率能够产生多少声压?
THD振膜运动是否保持线性?
谐振 / Q 值系统储存了多少机械或声学能量?
IR / CSD信号停止后,系统还会持续多久?

一般认为频率响应是最重要的测量指标。原因很简单:人耳对频谱变化非常敏感,而耳机的频响偏差往往远大于现代电子设备的频响偏差。

但频率响应又有一个非常特殊的问题:

耳机测到的并不只是耳机本身,而是“耳机 + 耳廓 + 耳道 + 测量系统”共同形成的结果。

因此,理解耳机测量,首先必须理解“测量到的声音究竟在哪里产生”。


频率响应

频率响应(Frequency Response)描述的是:当输入信号电平保持一定时,改变信号频率,耳机最终能够在耳道中产生多少声压。

假设输入电压固定为:

$$ V_{in}=1V_{rms} $$

然后依次输入:

1
2
3
4
5
6
20Hz
40Hz
80Hz
160Hz
...
20kHz

测量耳道中的声压级:

$$ SPL=20\log_{10}\left(\frac{p}{20\mu Pa}\right) $$

就可以得到一条频率响应曲线。

例如:

1
2
3
4
5
6
7
8
SPL
 │
 │        ______
 │       /      \
 │______/        \______
 │
 └──────────────────────→ f
       20Hz       20kHz

它描述的并不是“耳机振膜在不同频率下移动了多少”,而是:

整个耳机系统最终在测量位置产生了多少声压。

这一区别非常重要,因为从振膜到鼓膜之间还存在大量声学结构:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
振膜
 ↓
前腔 / 后腔
 ↓
耳罩 / 耳塞
 ↓
耳廓
 ↓
耳道
 ↓
鼓膜

因此最终测得的频率响应实际上可以理解成多个环节传递函数的乘积:

$$ H_{total}(f)=H_{driver}(f)*H_{acoustic}(f)*H_{ear}(f) $$

其中 $H_{driver}$ 是换能器本身,$H_{acoustic}$ 是腔体、导管、耳罩等产生的声学传递函数,而 $H_{ear}$ 则代表人体耳廓、耳道等结构的影响。

这也是为什么耳机频响不能像 DAC 一样简单地追求:

1
2
20Hz ───────────────── 20kHz
          0dB

如果直接把一个扬声器放在自由空间中测量,“平坦”有一定意义;但耳机最终不是工作在自由空间,而是工作在人耳附近。


人工耳和耦合器

既然最终目标是测量耳膜附近的声压,那么最理想的方法显然是:

把麦克风放到人的耳膜旁边。

问题在于,这种方法既难以标准化,也无法重复。

每个人的耳道长度、截面积、耳廓形状都不同,即使同一个人重新佩戴一次耳机,耳机与耳朵之间的位置也可能发生变化。

因此工程上需要使用**人工耳(Artificial Ear)和耦合器(Coupler)**建立一个可重复的标准负载。

最简单的理解方式是:

1
2
3
4
5
6
7
真实耳朵:

耳机 → 耳廓 → 耳道 → 鼓膜

实验室:

耳机 → 人工耳 → 标准声学阻抗 → 麦克风

耦合器并不是简单的“一个麦克风”。

它需要尽可能模拟真实耳道在一定频率范围内的声学负载,包括空气体积、声学阻抗以及压力变化。因此不同标准会规定不同的耦合器结构。

对于入耳式耳机,常见测量系统会使用类似 IEC 60318-4 的标准耳模拟器。其意义不是“制造一个和真人完全一样的耳朵”,而是:

规定一个所有实验室都能够重复使用的标准声学负载。

这样一来,不同耳机之间才能进行相对公平的比较。


IEM高频测不准

入耳式耳机(IEM)的高频测量尤其容易出现差异。很多不同测量机构测试同一副 IEM 时,会发现:

1
2
3
4
5
20Hz ─────── 5kHz
       基本一致

6kHz ─────── 20kHz
       差异明显增加

原因在于高频声波的波长已经与耳道尺寸处于同一数量级。

声波波长为:

$$ \lambda=\frac{c}{f} $$

取空气中的声速:

$$ c\approx343m/s $$

在 10kHz 时:

$$ \lambda=\frac{343}{10000} \approx34.3mm $$

而人的耳道长度通常只有几厘米;这意味着在 10kHz 左右,耳道已经不再能够被简单看成一个“无限小的点”。

声波会发生:

  • 反射;
  • 干涉;
  • 驻波;
  • 相位变化。

因此,仅仅改变 IEM 在耳道中的插入深度,就可能明显改变高频响应。

例如插入位置发生约 1mm 的变化,在高频区域就可能造成数 dB 的变化。

可以简单表示为:

1
2
3
4
5
6
7
8
9
插入深度改变
      ↓
耳道有效长度改变
      ↓
驻波位置改变
      ↓
相位关系改变
      ↓
高频 SPL 改变

因此 IEM 高频测量的主要困难并不是“麦克风不够好”,而是:

测量对象本身对几何位置极其敏感。

这也是为什么实验室通常需要重复插入、重复测量,然后进行统计处理。

因此,在阅读 IEM 高频频响时,尤其应该避免把 10kHz 以上每一个很小的峰谷都理解成耳机一定存在对应的物理缺陷。

低频到中频区域通常具有更高的测量一致性,而高频则需要考虑测量系统和佩戴位置带来的不确定性。


头戴式耳机需要HATS

头戴式耳机的问题更加复杂。

IEM 可以直接进入耳道附近,但头戴式耳机需要同时考虑:

  • 耳廓;
  • 头部绕射;
  • 耳罩;
  • 耳罩与皮肤之间的密封;
  • 耳机在头部上的位置。

因此,仅仅使用一个标准耦合器已经不足以完整描述头戴式耳机,需要 HATS(Head And Torso Simulator,头部和躯干模拟器)。

典型结构可以理解为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
                 耳机
          ┌───────────────┐
          │               │
          ▼               ▼
       人工耳           人工耳
          │               │
          ▼               ▼
       麦克风           麦克风

              人工头部
                  │
              人工躯干

HATS 的意义在于把耳机放置在一个具有标准几何尺寸的“人”上。这样,测量结果不仅包含耳机本身,还可以包含头部和耳廓对声波传播产生的影响。

耳廓并不是一个简单的障碍物,而是一个复杂的声学滤波器。不同方向进入耳廓的声音会产生不同的反射和干涉,因此:

$$ H_{ear}(f,\theta,\phi) $$

实际上是一个同时依赖频率和空间方向的传递函数。

这也是 HRTF(Head-Related Transfer Function,头相关传递函数)产生的基础。

因此,一副头戴耳机的频率响应,本质上并不是:

1
耳机 → 麦克风

而更接近:

1
2
3
4
5
6
7
耳机
 ↓
头部 / 耳廓
 ↓
耳道
 ↓
鼓膜位置

这也是为什么仅仅把一个麦克风放在耳机前方,无法得到真正有意义的“人耳频响”。


不同测量机构的数据不同

即使使用同一人工耳或 HATS,不同实验室的结果仍然可能存在差异。

原因主要来自两个方面:

补偿曲线不同

同一个 Raw Response,可以根据不同 Target 进行不同的补偿。

佩戴方式不同

头戴式耳机尤其容易受到佩戴影响:

  • 夹持位置;
  • 耳罩角度;
  • 耳罩密封;
  • 耳机与耳廓距离

IEM 则对插入深度更加敏感。因此:

不同网站的频响曲线不能在不了解测量系统的情况下逐点比较。

应该首先确认:

条件是否一致
测量设备人工耳 / HATS 类型
耦合器标准是否一致
补偿曲线Target 是否一致
佩戴方式是否一致
插入深度是否一致
重复测量是否进行统计

只有这些条件大致一致,频响曲线之间的比较才具有意义。


从 Free Field 到 Diffuse Field 再到 Harman Target & BK5128

既然人体本身会改变频率响应,那么接下来就出现一个非常重要的问题:

耳机到底应该调成什么样才算“正确”?

答案并不是简单的“全频段 0dB”。

早期研究主要从扬声器和声场出发,形成了不同的参考目标。

其中一个思路是 Free Field(自由场)。它假设声音主要来自正前方,测量系统希望模拟人在自由声场中面对一个声源时的听觉条件。

另一种重要思路是 Diffuse Field(扩散场)。扩散场假设声音来自多个方向,耳朵因此会形成不同的频率响应。

这两种目标都试图回答:

如果耳机能够在耳膜处重现某种自然声场,它应该具有什么样的频率响应?

但随着大量主观听音实验的发展,人们逐渐发现,仅仅从物理声场推导目标并不一定能够得到最佳的听感偏好。

因此出现了以受试者主观评价为基础的 Harman Target。

Harman 思路的核心并不是声称“某一条曲线是物理上唯一正确的曲线”,而是通过受控听音实验寻找:

多数听者更偏好的频率响应形状。

因此需要区分三个概念:

1
2
3
4
5
6
7
物理声场目标
      ↓
Free Field / Diffuse Field

统计听音偏好
      ↓
Harman Target

它们解决的问题并不完全相同。

而近年来,B&K 5128 等新一代测量系统进一步试图提高人工耳在高频区域对真人耳道声学特性的模拟能力。

传统 IEC 60318-4 耳模拟器在一定频率范围内非常实用,但到了更高频率,其标准耳道与真人耳之间的差异会越来越明显。

因此可以把这些测量体系理解成不同阶段的工程逼近:

方法核心思想主要意义
Free Field模拟自由声场从声场重建目标
Diffuse Field模拟扩散声场考虑多方向入射
Harman Target基于主观偏好统计寻找多数人的偏好
IEC 60318-4标准化耳模拟器提供可重复测量
BK5128更接近真人耳的声学模拟改善高频与个体耳道模拟

因此,所谓“目标曲线”本身并不是耳机声音的物理定律,而是:

测量系统对“自然声音”或“多数人偏好”的一种工程定义。


夹具测量的局限与 Personal HRTF:统计学意义和个人体验的矛盾

到了这里,就会出现耳机测量最根本的矛盾。

假设我们拥有一个完美的人工耳,它能够代表一群人的平均耳朵。

那么它可以非常准确地告诉我们“一般人”会得到什么样的频率响应。

但它仍然无法告诉某一个具体的人:

“你自己的鼓膜会接收到什么声音。”

原因就是 HRTF。

HRTF 可以简单理解为:

$$ HRTF(f,\theta,\phi) = \frac{P_{ear}(f,\theta,\phi)} {P_{free}(f,\theta,\phi)} $$

它描述声音从某个方向进入耳朵后,头部、耳廓和耳道对频谱造成的改变。

其中:

  • $f$ 是频率;
  • $\theta$、$\phi$ 描述声源方向;
  • $P_{ear}$ 是耳朵附近的声压;
  • $P_{free}$ 是自由场中的参考声压。

问题在于,每个人的:

  • 耳廓形状;
  • 耳道长度;
  • 耳道截面积;
  • 头部尺寸;
  • 耳道弯曲方式

都存在差异。

因此:

1
2
3
4
5
6
7
平均 HRTF
    ↓
适用于统计意义上的多数人

个人 HRTF
    ↓
可能显著偏离平均值

这就形成了一个非常有意思的矛盾:

标准化测量越统一,越适合比较产品;但它越不可能完全代表某一个人的耳朵。

反过来,如果我们完全按照某个人的 HRTF 进行个性化校正,又会失去标准化比较的意义。

因此,耳机测量实际上存在两个不同目标:

目标最重要的东西
产品之间公平比较标准化夹具
预测个人听感个人 HRTF
大规模统计研究平均 HRTF / Target
个性化 EQ个人耳道与佩戴测量

这也是为什么“某条曲线在夹具上最接近目标曲线”与“某个人听起来最好”并不是完全等价的命题。

更准确的理解应该是:

标准化测量解决的是“如何公平描述产品”,而个人 HRTF 解决的是“这个产品在我的耳朵里究竟是什么声音”。

两者并不存在谁取代谁的问题。


阻抗曲线

如果频率响应描述的是:

耳机把输入信号变成多少声音。

那么阻抗曲线描述的就是:

耳机在不同频率下对输入电信号呈现怎样的负载。

最简单的交流阻抗可以写成:

$$ Z(f)=R+jX(f) $$

其中:

  • $R$ 是电阻部分;
  • $X(f)$ 是随频率变化的电抗。

对于一个理想纯电阻负载,阻抗与频率无关。

$$ Z=R $$

但真实耳机远远不是纯电阻。它同时包含:

  • 音圈电阻;
  • 音圈电感;
  • 振膜机械阻抗;
  • 悬边弹性;
  • 空气负载;
  • 腔体声学阻抗。

因此阻抗曲线实际上可以看作耳机内部机械和声学系统的一个“电学窗口”。


动圈阻抗峰:振膜机械谐振

动圈耳机通常会在低频区域出现一个明显的阻抗峰。

这是因为动圈振膜可以近似看成一个质量+弹簧+阻尼组成的机械振荡系统。

如果先忽略阻尼,其固有频率为:

$$ f_0= \frac{1}{2\pi} \sqrt{\frac{k}{m}} $$

其中:

  • $m$ 是系统等效质量;
  • $k$ 是等效刚度。

当输入频率接近 $f_0$ 时,振膜的机械运动会发生明显变化。

这种机械谐振也会反映到电气侧,因此典型动圈耳机可能出现:

1
2
3
4
5
6
7
8
阻抗
 │
 │        /\
 │       /  \
 │______/    \________
 │
 └────────────────────→ f
          f0

这个峰值的位置和高度可以提供很多信息,例如:

  • 峰值位置与机械谐振频率有关;
  • 峰值高度与系统阻尼有关;
  • 峰值附近的机械状态会影响低频响应;
  • 耳放输出阻抗还可能通过这个阻抗变化进一步改变频响。

音圈具有电感

动圈耳机的音圈本质上是一组线圈。因此除了电阻 $R$ 之外,还存在电感 $L$。

理想电感的感抗为:

$$ X_L=2\pi fL $$

随着频率增加:

$$ X_L\propto f $$

所以音圈的阻抗通常会随着频率上升而增加。

一个简化的音圈模型可以写成:

$$ Z_{coil}=R+j2\pi fL $$

实际耳机当然比这个模型复杂,因为音圈还与磁路、振膜机械运动和反电动势耦合。

因此真实阻抗曲线通常是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
低频:
机械谐振
   ↓
出现阻抗峰

中频:
音圈电阻
   ↓
阻抗较稳定

高频:
音圈电感
   ↓
阻抗逐渐上升

这也解释了为什么一个“标称 32Ω”的动圈耳机,在高频也并不一定始终保持 32Ω。


平板耳机:阻抗平坦

平板磁驱动耳机通常具有与传统动圈不同的阻抗特征。

由于平板振膜的驱动力分布更均匀,其机械谐振通常不像典型动圈那样表现出非常明显的低频阻抗峰。

因此很多平板耳机的阻抗曲线更加平坦:

1
2
3
4
5
6
阻抗
 │
 │──────────────────
 │
 │
 └──────────────────→ f

这并不意味着平板耳机完全没有机械或声学谐振,而是说:

其电气阻抗通常不会像典型动圈那样出现非常明显的低频机械谐振峰。


灵敏度

灵敏度(Sensitivity)描述的是:

给耳机施加规定的电压或功率之后,能够产生多大的声压。


标注值大多于 1kHz 测得

很多耳机厂商会在规格表中给出:

1
2
Sensitivity:
96 dB/mW

这些数字通常是在规定的测试条件和某个参考频率附近得到的,而不是“整个频段平均效率”。

最常见的参考频率是 1kHz。因此标注值并不意味着:

1
2
20Hz → 20kHz
全部都是 96dB/mW

因为耳机的频率响应本身就不是平坦的。

如果耳机在 1kHz 输出 96dB SPL,而在 100Hz 因为频响下降了 6dB,那么在相同输入功率下,100Hz 的输出就只有约 90dB SPL。

因此灵敏度主要用于回答:

这副耳机总体上需要多少电压/功率才能获得目标声压?

而不是用来替代完整频率响应。


两种单位的换算

常见单位有两种:

1
2
dB/mW
dB/V

已知耳机阻抗,可用

$$ Sensitivity_{mW} = Sensitivity_V - 10\log_{10}\left(\frac{1000}{R}\right) $$

进行换算。

因此:

参数固定条件主要意义
dB/mW功率固定更适合比较电声效率
dB/V电压固定更适合估算实际设备输出
阻抗负载固定决定电压与功率之间关系

总谐波失真

如果频率响应主要描述耳机“发出什么声音”,那么 THD 描述的是:

耳机在输出过程中增加了多少原本不存在的谐波。

理想线性系统满足:

$$ y(t)=A\sin(\omega t) $$

输入一个单频正弦波,输出仍然应该只有同一个频率。

但真实振膜存在各种非线性:

  • 悬边刚度随位移变化;
  • 音圈在磁隙中的磁场并非绝对均匀;
  • 振膜可能发生弯曲;
  • 空气负载可能出现非线性;
  • 大振幅下机械结构可能偏离线性工作区。

因此输出可能变成:

$$ y(t) = A_1\sin(\omega t) + A_2\sin(2\omega t) + A_3\sin(3\omega t) + \cdots $$

原本只有:

$$ f $$

现在出现:

1
2
3
4
2f
3f
4f
...

这些整数倍频率就是谐波。


Distortion 的真实内涵

THD 定义为:

$$ THD= \frac{ \sqrt{V_2^2+V_3^2+V_4^2+\cdots} }{ V_1 } $$

其中:

  • $V_1$ 是基波;
  • $V_2$ 是二次谐波;
  • $V_3$ 是三次谐波;
  • 后面依次类推。

例如输入:

1
1kHz

FFT 后可能看到:

1
2
3
4
5
1kHz   基波
2kHz   二次谐波
3kHz   三次谐波
4kHz   四次谐波
...

THD 把这些谐波的总能量合并成一个数字。

因此:

THD 是一个“总量指标”,而不是失真频谱本身。

两副耳机可能拥有相同的 THD:

1
0.1%

但其中一副可能主要产生二次谐波,另一副主要产生高阶谐波——它们的失真结构并不相同。

因此,如果要深入分析失真,不能只看一个 THD 数值,还需要看:

1
2
3
4
5
THD vs Frequency
+
各阶 Harmonic
+
SPL

这样才能知道耳机究竟在哪个频率、什么声压下开始进入明显的非线性区。


奇次谐波与偶次谐波

谐波可以进一步按照阶数分类:

类型频率例子
二次谐波$2f$1kHz → 2kHz
三次谐波$3f$1kHz → 3kHz
四次谐波$4f$1kHz → 4kHz
五次谐波$5f$1kHz → 5kHz

其中:

1
2
3
4
5
偶次:
2f、4f、6f……

奇次:
3f、5f、7f……

奇次和偶次并不能简单对应为“好失真”和“坏失真”。真正重要的是:

  • 失真的大小;
  • 失真出现在哪个频率;
  • 失真属于哪一阶;
  • 随输入声压如何变化。

耳机尤其容易在低频出现更高的 THD。

原因是对于相同的声压级,低频需要更大的振膜位移。

因此:

1
2
3
4
5
6
7
低频
 ↓
需要更大位移
 ↓
悬边/磁路/振膜非线性增加
 ↓
THD增加

这也是为什么很多耳机的 THD 图在 20Hz~100Hz 区域明显高于中频。

对于平板耳机,由于整个振膜受到更加均匀的驱动力,很多产品在低频区域可以实现很低的失真,但这并不是平板结构的绝对保证。

因此:

THD 最重要的意义不是告诉我们“这副耳机好不好”,而是告诉我们它在多大的输出幅度下还能保持线性。

频率响应更接近回答:

“它会发出怎样的声音?”

THD 更接近回答:

“在这个声压下,它还能不能准确地发出这个声音?”


谐振与储能

频率响应、THD 和时间响应看起来是三个不同问题,但它们背后存在一个共同的物理概念:

谐振(Resonance)。

耳机中的振膜并不是自由运动的。它受到:

  • 振膜质量;
  • 悬边刚度;
  • 空气弹性;
  • 机械阻尼;
  • 声学阻尼

共同作用。

因此,可以把一个简化的耳机单元看成质量—弹簧—阻尼系统。

其运动方程可以写成:

$$ m\ddot{x}+c\dot{x}+kx=F(t) $$

其中:

  • $m$ 是等效质量;
  • $c$ 是阻尼;
  • $k$ 是等效刚度;
  • $x$ 是振膜位移;
  • $F(t)$ 是驱动力。

忽略阻尼时,固有频率为:

$$ f_0= \frac{1}{2\pi} \sqrt{\frac{k}{m}} $$

当输入频率接近 $f_0$ 时,系统容易产生明显的振幅响应,这就是谐振。

谐振是耳机结构对特定频率的“共鸣”现象;而储能是支撑这一现象的物理基础——能量在振膜、空气、悬边等元件之间的暂存与交换。


谐振不一定是坏事

很多人看到“谐振”两个字,会直接认为它代表设计缺陷。

实际上:

任何真实的机械系统都存在谐振。

真正需要控制的是:

  • 谐振的位置;
  • 谐振的 Q 值;
  • 谐振的幅度;
  • 谐振之后的衰减速度。

一个适当控制的谐振甚至可以提高系统效率。

例如低频单元需要较高的输出能力,如果完全没有任何机械共振,往往意味着需要付出更大的驱动力。

真正的问题是高 Q、低阻尼的谐振。

例如:

1
2
3
4
5
6
7
输入停止
   ↓
振膜仍然继续振动
   ↓
空气仍然继续受到激励
   ↓
输出出现拖尾

因此,所谓“声音拖”“低频收不住”等描述,在一定程度上可以与系统储能联系起来。


品质因数(Q值)

Q 值用于描述谐振系统的“尖锐程度”以及能量损耗情况。

对于经典二阶系统,可以近似理解为:

$$ Q \propto \frac{\text{储存能量}} {\text{每周期损失的能量}} $$

Q 越高:

1
2
3
谐振峰更尖
衰减更慢
储能更多

Q 越低:

1
2
3
谐振峰更宽
衰减更快
阻尼更强

可以简单画成:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
高Q:

        /\
       /  \
______/    \______

低Q:

      /----\
_____/      \_____

因此,Q 值并不是一个单独决定音质的“越低越好”参数。

如果阻尼过强,系统效率可能下降;如果阻尼过弱,则容易形成明显峰值和长时间拖尾。

工程设计实际上是在:

1
2
3
4
5
6
7
效率
 ↕
频响平坦度
 ↕
瞬态
 ↕
阻尼

之间寻找平衡。


储能的来源

耳机中的储能并不只有一个来源。

首先是机械储能。

振膜和悬边具有质量与弹性,因此振膜运动时会不断进行动能和势能之间的转换。

其次是空气储能。

封闭腔体中的空气可以被压缩,因此具有类似弹簧的作用。

第三是声学腔体中的驻波和谐振。

空气柱、导管、耳道都可能在特定频率下储存能量。

因此:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
振膜
 ↓
机械储能
 ↓
空气
 ↓
声学储能
 ↓
腔体 / 导管
 ↓
再次反馈

这也是为什么耳机的时间响应并不是单纯由“振膜轻不轻”决定的。一个非常轻的振膜,如果配合高 Q 的腔体,同样可能出现明显拖尾。

所以所谓“速度快”不能简单等价于:

振膜质量小。

更准确的说法应该是:

系统在激励停止之后,能够多快地释放储存的能量。


脉冲响应

前面的频率响应、阻抗和 THD 主要描述稳态或频域特性。

但耳机播放音乐时,声音并不是无限持续的正弦波,而是不断出现:

  • 鼓点;
  • 人声起音;
  • 吉他拨弦;
  • 打击乐;
  • 音符停止。

因此还需要观察:

输入停止之后,耳机的输出如何随时间变化。

这就是脉冲响应(Impulse Response,IR)。

如果给一个理想系统输入:

$$ x(t)=\delta(t) $$

那么系统输出:

$$ y(t)=h(t) $$

其中 $h(t)$ 就是系统的脉冲响应。

对于线性时不变系统,只要知道 $h(t)$,理论上就可以描述系统对任意输入信号的响应。

这也是为什么脉冲响应具有如此重要的地位。


CSD(瀑布图)、方波测试、阶跃

CSD(Cumulative Spectral Decay)即累积频谱衰减,通常以瀑布图形式表示。

它同时包含:

1
2
3
4
5
频率
+
时间
+
幅度

例如:

1
2
3
4
5
6
7
幅度
 │\
 │ \
 │  \__
 │     \___
 │         \____
 └────────────────→ 时间

如果某个频率附近存在高 Q 谐振,那么输入停止之后,该频率仍然可能持续存在。

因此 CSD 可以看到:

1
2
3
4
5
6
7
频率响应峰
     ↓
谐振
     ↓
储能
     ↓
长时间拖尾

所以 CSD 可以理解为:

连接频率响应与时间响应的一座桥梁。


方波测试则是另一种观察方式。

方波本身由大量谐波组成:

$$ Square(t) = \sum_{n=1,3,5...}^{\infty}\frac{1}{n}\sin(n\omega t) $$

因此,如果系统能够保持这些谐波之间正确的幅度和相位关系,输出方波就能够较好地保持原来的形状。

但耳机的频响和相位响应会改变这些谐波,因此:

1
2
3
4
5
理想方波
   ↓
系统
   ↓
变形方波

可以通过方波的形状观察系统的频域特性。

不过,方波并不是一个独立于频率响应的“神奇测试”。它本质上仍然是在用一种特殊输入信号观察系统对不同频率成分的处理方式。


**阶跃响应(Step Response)**同样如此。

输入从:

1
0

突然变成:

1
1

观察系统输出:

1
2
3
0 ──────┐
        │
        └────── 1

如果系统存在过冲、振铃或较长的衰减过程,就会反映在阶跃响应中。

因此:

测量主要观察
频率响应稳态幅频特性
CSD频率随时间的衰减
方波响应多频率成分共同作用后的波形
阶跃响应系统对快速变化输入的响应
IR系统完整的时域响应

这些测试并不是互相独立的“玄学指标”,而是从不同角度观察同一个系统。


从一个脉冲到所有测量

理解傅里叶变换之后,可以进一步看到这些指标之间的联系。

时域中的脉冲响应:

$$ h(t) $$

经过傅里叶变换,可以得到频率响应:

$$ H(f)=\mathcal{F}{h(t)} $$

因此:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
                脉冲响应 h(t)
                      │
             ┌────────┴────────┐
             │                 │
          时域分析           傅里叶变换
             │                 │
       ┌─────┴─────┐           ▼
       │           │       频率响应 H(f)
    阶跃响应       瞬态          │
       │                   ┌───┴───┐
       │                  幅度     相位
       │
       ▼
      CSD / 时间衰减

因此,一副耳机并不是“拥有十几个互不相关的指标”。

更准确的理解是:

同一个物理系统,可以从时域、频域、电域和机械域被不同方式观察。

频率响应告诉我们系统在不同频率下的稳态输出;

阻抗告诉我们这个机械—声学系统如何反映到电气负载上;

THD 告诉我们系统偏离线性的程度;

CSD 则告诉我们某些频率的能量是否会在激励停止后继续存在。

把这些指标放在一起,才能真正开始理解耳机。

而下一步的问题就自然出现了:

如果耳机是一套机械—声学系统,那么一个理想的换能器究竟应该如何运动?

理想换能器

在讨论具体耳机结构之前,需要先明确一个问题:

什么样的换能器,才算是理想换能器?

耳机的本质任务,是将输入电信号完全转换为对应的机械运动,再转换为空气压力变化。

理想情况下,输入:$x(t)$ 输出:$P(t)$

两者之间应该保持严格对应。

也就是说:输入振幅增加一倍,振膜位移增加一倍,声压增加一倍;同时,输入频率改变,振膜能够准确跟随,不产生额外振动。

因此,一个理想换能器应该满足:

  1. 完全线性的力转换;
  2. 振膜作为整体运动;
  3. 没有额外机械共振;
  4. 没有能量储存;
  5. 无限宽的频率响应。

然而现实中不存在这样的换能器。

所有耳机设计,本质上都是在有限材料和结构条件下,尽可能接近这一目标。


活塞运动

理想换能器最重要的特征之一,是振膜能够进行活塞运动。

所谓活塞运动,是指整个振膜作为刚体整体前后移动,整个振膜位移完全一致。

此时:

  • 相位一致;
  • 声波方向稳定;
  • 失真最低。

实际振膜并不是无限刚性的。当输入频率升高,振膜不同位置受到不同力,导致振膜产生弯曲。这种非整体运动称为:Break-up(分割振动)。

此时不同区域:

  • 振幅不同;
  • 相位不同。

最终输出声波发生叠加:

$$ P_{total} = P_1+P_2+...+P_n $$

如果:

$$ \phi_1\neq\phi_2 $$

则会产生:

  • 声压抵消;
  • 频响波动;
  • 高频峰谷。

因此理想振膜需要同时满足:

  • 足够轻;
  • 足够刚;
  • 足够阻尼。

这三个条件存在天然矛盾。


振膜质量、刚性与阻尼

振膜运动可以由牛顿第二定律描述:

$$ F=ma $$

其中:

  • $F$ 为驱动力;
  • $m$ 为运动质量;
  • $a$ 为加速度。

对于相同驱动力:

质量越小:

$$ a=\frac{F}{m} $$

越大。

因此,轻质量有利于:

  • 高频响应;
  • 瞬态速度。

但如果只追求轻,会导致:

  • 刚性不足;
  • 容易弯曲;
  • Break-up 提前出现。

因此振膜还需要高刚性。

材料刚性通常由杨氏模量表示:

$$ E=\frac{\sigma}{\epsilon} $$

其中:

  • $\sigma$ 为应力;
  • $\epsilon$ 为应变。

E 越高,材料越不容易形变。


然而,高刚性材料通常具有较低内部阻尼。

例如金属:

特性表现
刚性高
质量较低
内阻尼较低

容易:

  • 高频延伸好;
  • 但存在明显共振峰。

因此第三个重要参数是:

内部阻尼(Internal Damping)

阻尼决定机械振动能量如何消耗。如果阻尼不足,会产生长时间振铃。

波前

除了振膜本身的机械运动之外,理想换能器还需要考虑另一个重要问题:

振膜产生的声波,是否能够以正确的方式传播到听者耳中?

这涉及声波的空间传播特性,也就是波前(Wavefront)。

所谓波前,是指声波中所有具有相同相位的点所组成的曲面。

例如,一个理想点声源产生的声波:

1
2
3
4
5
6
7
8

      )
   )
)
●
)
   )
      )

声波以球面形式向外传播,每一个圆弧代表同一时间内具有相同相位的位置。

对于耳机而言,理想状态下振膜应该产生稳定、连续的波前,使不同区域产生的声波能够在耳道入口处正确叠加。


振膜尺寸与波长的关系

声波的基本关系为:

$$ \lambda=\frac{c}{f} $$

其中:

  • $\lambda$ 为波长;
  • $c$ 为声速;
  • $f$ 为频率。

空气中的声速约为:

$$ c\approx343m/s $$

因此:

频率波长
100Hz3.43m
1kHz34.3cm
10kHz3.43cm
20kHz1.72cm

可以看到,在低频区域,波长远大于振膜尺寸。

例如:

一个40mm耳机振膜:

$$ D=40mm $$

而100Hz声波:

$$ \lambda=3.43m $$

二者相差巨大。

此时整个振膜相当于一个点声源,因此低频通常更容易保持一致。

但随着频率升高:

当 $\lambda \approx D$ 时,不同位置产生的声波开始出现明显相位差,不同区域的运动状态不同。

最终:

$$ P_{total} = \sum_{n=1}^{N}P_n e^{j\phi_n} $$

其中:

  • $P_n$ 为局部声压;
  • $\phi_n$ 为相位差。

如果不同区域相位不一致,会产生:

  • 相互增强;
  • 相互抵消。

最终表现为:

  • 高频响应波动;
  • 局部峰值;
  • 声场不稳定。

Near Field 与耳机声场

耳机与音箱最大的区别之一,是听者距离振膜非常近。

音箱:

1
2
3
4
5
扬声器
  ↓
数米距离
  ↓
人耳

声波经过较长距离传播,已经接近远场(Far Field)。

而耳机:

1
2
3
4
5
振膜
↓
几厘米
↓
耳道

通常处于近场(Near Field)。

近场中:

  • 声压变化更复杂;
  • 相位关系更敏感;
  • 声学结构影响更明显。

因此耳机不能简单套用音箱理论。


耳机中的声学波导

为了控制波前,很多耳机都会加入声学结构。

例如:

  • 导管;
  • 网罩;
  • 阻尼材料;
  • 前腔。

这些结构实际上构成了声学波导(Acoustic Waveguide)。

其作用类似:

1
2
3
4
5
振膜
↓
声学通道
↓
耳道入口

通过控制:

  • 空气质量;
  • 声阻;
  • 腔体容积;

调整不同频率的传播。


对于入耳式耳机,导管尤其重要,因为导管本身就是一个小型声学传输系统。

可以近似为:

1
2
3
4
5
6
7
振膜
|
|
| 导管
|
↓
耳道

其长度、直径会影响:

  • 高频共振;
  • 相位响应;
  • 输出阻抗。

因此不同 IEM 即使使用相同单元,仅改变导管结构,也可能产生完全不同的声音。


声波叠加与相位一致性

理想情况下,多个振膜区域应该同时运动;

并且:

$$ \phi_1=\phi_2=...=\phi_n $$

此时,所有声波同相叠加:

$$ P_{total}=P_1+P_2+...+P_n $$

输出效率最高。

但实际结构中,由于:

  • 振膜弯曲;
  • 材料阻尼;
  • 腔体反射;

会产生:

$$ \Delta\phi\neq0 $$

导致部分能量抵消。

这也是为什么:

  • 大振膜不一定一定更好;
  • 高频延伸需要严格控制振膜刚性;
  • 单元结构不能只看尺寸。

理想波前与实际耳机的差距

理想换能器:

1
2
3
4
5
振膜
↓
平滑连续波前
↓
耳道

实际耳机:

1
2
3
4
5
6
7
8
9
振膜
↓
局部振动
↓
腔体反射
↓
耳道共振
↓
鼓膜

因此最终听到的声音,是:

$$ Sound = Driver + Mechanical + Acoustic + HRTF $$

共同作用的结果。


因此,理想换能器不仅要求振膜本身能够准确运动,还要求产生的声波能够以正确的方式传播。

这也是为什么现代耳机设计并不是简单追求:

  • 更大的振膜;
  • 更强的磁铁;
  • 更高的频响范围。

真正重要的是:

让机械运动、声学传播和人耳响应形成一个协调的整体。

动圈

动圈(Dynamic Driver)是目前耳机中最成熟、应用最广泛的换能器结构。它的基本原理并不复杂:利用永久磁场与音圈电流之间产生的电磁力,推动振膜运动,再由振膜推动空气形成声波。

但“让振膜动起来”并不是动圈真正困难的地方。真正的工程问题是:

如何让振膜的运动尽可能准确地跟随输入电信号,同时把失真、储能和非线性控制在足够低的水平。

因此,一只动圈单元实际上是一个完整的机电系统:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
电信号
  ↓
音圈电流
  ↓
磁场中的电磁力
  ↓
音圈运动
  ↓
振膜运动
  ↓
空气压力变化
  ↓
声波

其中磁路、音圈、振膜和悬边并不是互相独立的零件,而是一个相互耦合的系统。磁路决定驱动力如何产生,音圈负责把电流转换为机械力,振膜负责把机械运动转换为空气运动,而悬边则负责约束振膜并提供机械回复力与阻尼。


基本工作原理

动圈换能器可以简化为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
        永磁体
     ┌───────────┐
     │           │
     │   磁场 B  │
     │           │
     └─────┬─────┘
           │
        音圈 L
           │
         振膜
           │
          空气

音频信号首先由放大器转换为随时间变化的电流。当电流流过处于永久磁场中的音圈时,导体会受到洛伦兹力(Lorentz Force):

$$ \mathbf{F}=BIL $$

其中:

  • $B$ 为磁感应强度;
  • $I$ 为通过音圈的电流;
  • $L$ 为处于有效磁场中的导线长度。

因此,在理想情况下,如果磁场 $B$ 和有效导线长度 $L$ 保持不变,那么:

$$ F\propto I $$

也就是说,电流发生怎样的变化,驱动力就按照相同的比例变化。这就是动圈能够重现模拟音频信号的根本原因。

例如输入一个正弦电流:

$$ I(t)=I_0\sin(\omega t) $$

在理想磁路中:

$$ F(t)=BLI_0\sin(\omega t) $$

于是振膜受到一个同频率、同相位的周期性驱动力,并进一步推动空气产生相应的压力变化。

整个过程可以表示为:

1
2
3
4
5
6
7
电流 I(t)
   ↓
洛伦兹力 F(t)
   ↓
振膜位移 x(t)
   ↓
空气压力 p(t)

因此动圈并不是“把电信号变成声音”这么简单,而是连续完成:

电 → 电磁力 → 机械运动 → 空气压力。


从电流到位移

如果暂时忽略阻尼和复杂的声学负载,可以把振膜看成一个质量-弹簧系统:

$$ m\ddot{x}+kx=F $$

再代入:

$$ F=BLI $$

得到:

$$ m\ddot{x}+kx=BLI $$

这里可以看到一个非常重要的关系:

磁路决定驱动力,振膜和悬边决定这个驱动力最终如何转化为位移。

因此即使两个单元拥有完全相同的 $BL$,只要:

  • 振膜质量 $m$ 不同;
  • 悬边刚度 $k$ 不同;
  • 阻尼 $c$ 不同;

最终频率响应和瞬态响应仍然会不同。

实际系统需要进一步写成:

$$ m\ddot{x}+c\dot{x}+kx=BLI $$

其中 $c$ 为机械阻尼。

这也解释了为什么不能单独用“磁铁强不强”或者“BL 值大不大”判断一个动圈单元的性能。


交流电为什么能够重现音乐

假设输入的是一个 100Hz 的正弦信号,电流方向不断变化,因此洛伦兹力的方向也不断变化:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
电流向前
   ↓
音圈受到向前的力
   ↓
振膜向前运动

电流反向
   ↓
力的方向反向
   ↓
振膜向后运动

于是振膜以 100Hz 的周期往复运动,空气中便形成 100Hz 的压力变化。

如果输入变成 1kHz,振膜每秒完成约 1000 次对应的周期性运动;如果输入达到 20kHz,则要求整个机械系统能够在每秒两万次的变化下仍然保持足够准确的响应。

因此,动圈高频能力的真正限制并不是“音频电路能不能输出 20kHz”,而是:

振膜、音圈和悬边能否在如此高的频率下保持接近理想的运动状态。


磁路

从:

$$ F=BIL $$

可以直接看出,提高动圈驱动力的方法主要有三个:

$$ B\uparrow,\qquad L\uparrow,\qquad I\uparrow $$

其中 $I$ 受到耳放输出能力、音圈阻抗和热容量等因素限制,因此换能器本身主要通过优化 $B$ 和 $L$ 来提高驱动力。

这就是磁路(Motor Structure)存在的意义:

在有限体积内建立足够强、足够均匀,并且随振膜位移变化尽可能小的磁场。

一个典型动圈磁路可以简化为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
       永磁体
   ┌───────────┐
   │           │
   └─────┬─────┘
         ↓
      磁通集中
         ↓
      ┌─────┐
      │磁隙 │ ← 音圈
      └─────┘
         ↑
      磁通返回

磁铁本身并不是最终目的。真正重要的是:

磁通是否能够被有效地集中到音圈所在的磁隙中。


磁感应强度

磁路最直接的指标之一是磁感应强度 $B$。

根据:

$$ F=BIL $$

在其它条件相同的情况下:

$$ B\uparrow \Rightarrow F\uparrow $$

因此更强的磁场能够让同样的电流产生更大的驱动力。

现代耳机大量使用钕铁硼(NdFeB)永磁材料,就是因为其具有较高的磁能积,可以在较小体积内提供较强的磁场。

但“磁铁越强越好”并不是完整的结论。因为如果磁场分布不均匀,即使中心位置的 $B$ 很高,音圈在实际运动过程中仍然会经历明显的磁场变化。


磁场均匀性

理想情况下,音圈在整个工作位移范围内都应该处于近似恒定的磁场:

$$ B(x)\approx B_0 $$

于是:

$$ F(x)=B(x)IL $$

能够近似保持:

$$ F\approx B_0IL $$

但如果音圈移动后:

$$ B(x)\neq B_0 $$

那么相同的输入电流会产生不同的驱动力。

例如:

1
2
3
4
5
6
7
8
9
音圈位置:

   -x       0       +x
    │       │        │
    ↓       ↓        ↓

   B1      B0       B2

   不同位置磁场不同

此时:

$$ F(-x)\neq F(0)\neq F(+x) $$

于是输入信号与振膜驱动力之间不再保持严格线性,产生非线性失真。

因此,高性能动圈磁路追求的不只是高磁通密度,更重要的是在整个音圈运动范围内保持良好的磁场线性。


BL值

工程上经常使用 $BL$ Product 描述电机系统的驱动力能力:

$$ BL=B\times L $$

因此:

$$ F=BL\cdot I $$

$BL$ 越大,意味着在相同电流下可以产生更大的电磁力。

例如:

参数单元 A单元 B
$B$1.0 T1.5 T
$L$0.01 m0.01 m
$BL$0.010 T·m0.015 T·m

如果两者通过相同电流:

$$ I=0.1A $$

则:

$$ F_A=0.001N $$

而:

$$ F_B=0.0015N $$

单元 B 的理论驱动力更大。

但这并不意味着单元 B 一定更好。

因为最终性能还取决于:

  • 振膜质量;
  • 悬边刚度;
  • 机械阻尼;
  • 音圈质量;
  • 磁场线性;
  • 振膜最大位移。

因此 $BL$ 更适合被理解为电机系统的驱动力参数,而不是耳机音质的评分。


磁路结构

为了获得更好的磁场,不同动圈单元会采用不同磁路设计。

常见结构包括:

结构特点
单磁体结构简单、成本较低
双磁体可以改善磁通利用
环形磁体有利于围绕音圈形成对称磁场
对称磁路减少运动过程中的磁场变化
高磁能积磁体在较小体积获得较高磁通

高端动圈单元经常采用复杂磁路,并不是为了“堆磁铁”,而是为了同时优化:

$$ B $$

和:

$$ B(x) $$

也就是既提高磁通密度,又尽量保持位移范围内的磁场稳定。


磁路与失真

动圈的非线性失真来源之一,就是磁路的非线性。

如果:

$$ BL(x) $$

随位移发生明显变化,那么驱动力:

$$ F(x)=BL(x)I $$

就会随着位移变化。

由于输入信号本身又决定了位移,因此系统会产生非线性。可以简单理解为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
理想:

输入 I
 ↓
线性 BL
 ↓
输出 F

实际:

输入 I
 ↓
BL 随位置变化
 ↓
输出 F 不再完全线性
 ↓
THD / IMD

因此优秀的磁路设计通常会努力扩大线性冲程(Linear Excursion)

即让音圈在较大的运动范围内仍然保持接近恒定的驱动力。


音圈

磁路负责建立磁场,而真正把电流转换成机械力的,是音圈(Voice Coil)。

音圈可以理解为固定在振膜上的轻质量导线线圈。

典型结构:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
             振膜
       ─────────────
             │
         音圈骨架
             │
       ╔═══════════╗
       ║)))))))))))║
       ╚═══════════╝
             │
           磁隙

音圈通常悬浮在磁路形成的狭窄磁隙中。

当电流流过线圈:

$$ F=BIL $$

产生的力作用于音圈,并通过音圈骨架传递给振膜。

因此:

1
2
3
4
5
6
7
电信号
  ↓
音圈
  ↓
电磁力
  ↓
振膜

音圈实际上就是电路和机械系统之间的连接桥梁。


音圈线材

音圈需要在:

  • 低质量;
  • 高导电率;
  • 足够机械强度;
  • 足够耐热;

之间进行平衡。

常见导体包括:

  • 铜;
  • 铝;
  • 铜包铝(CCAW)等。

铜的电导率较高,因此相同长度和截面积下电阻较低;铝的密度更低,因此在追求低运动质量时具有优势。

音圈的导体材料、线径、匝数都会同时影响:

$$ R $$

以及:

$$ M_{coil} $$

因此音圈设计本质上也是一个电气与机械之间的折中。


音圈匝数与 BL

增加音圈有效导线长度 $L$ 可以提高:

$$ BL $$

因为:

$$ F=BIL $$

但增加匝数也会带来代价:

  • 导线更长;
  • 电阻增加;
  • 音圈质量增加;
  • 电感增加;
  • 发热增加。

因此不能简单地通过增加线圈匝数无限提高驱动力。

最终需要优化:

$$ BL \quad\text{vs.}\quad M_{coil} \quad\text{vs.}\quad R_e \quad\text{vs.}\quad L_e $$

这也是现代动圈单元中音圈设计越来越精细的原因。


音圈电阻与阻抗

音圈的直流电阻为:

$$ R_e $$

而交流情况下还存在电感:

$$ X_L=2\pi fL_e $$

因此音圈的阻抗可以近似表示为:

$$ Z(f)=R_e+j2\pi fL_e $$

低频时:

$$ 2\pi fL_e $$

较小,阻抗主要由电阻决定。

随着频率升高,电感抗逐渐增加,因此动圈耳机的高频阻抗通常会缓慢上升。


音圈电感与高频

音圈本质上是一个电感,因此:

$$ X_L=2\pi fL $$

随着频率升高:

$$ X_L\uparrow $$

于是:

$$ Z(f)\uparrow $$

这会改变高频区域的电流:

$$ I=\frac{V}{Z} $$

如果放大器输出电压保持不变,那么阻抗增加意味着电流下降。

因此音圈电感不仅影响阻抗曲线,也可能间接影响高频输出。

不过实际耳机的高频响应还受到:

  • 振膜分割振动;
  • 腔体;
  • 声学阻尼;
  • 磁路;
  • 耳道;

等因素共同影响,因此不能把高频衰减简单归因于音圈电感。


音圈的热问题

音圈还承担一个非常现实的问题:

散热。

输入功率最终有一部分转换成热量:

$$ P=I^2R $$

当大电流持续通过音圈时:

$$ P_{heat}\uparrow $$

音圈温度升高,铜线或铝线的电阻也会发生变化。

对于金属导体:

$$ R(T)=R_0[1+\alpha(T-T_0)] $$

温度升高:

$$ R\uparrow $$

于是同样的输入电压下:

$$ I=\frac{V}{R} $$

会下降。

这意味着音圈发热不仅关系到可靠性,也可能影响长时间大音量工作时的输出能力。

因此高功率耳机单元需要同时考虑:

  • 音圈线径;
  • 线圈面积;
  • 磁隙结构;
  • 通风;
  • 磁体温度;
  • 骨架导热。

音圈与振膜质量

音圈并不是一个“没有重量的导线”,它本身属于振动系统的一部分。

总运动质量可以近似表示为:

$$ M_{ms} = M_{diaphragm} + M_{voice\ coil} + M_{air} + \cdots $$

因此音圈越重:

$$ M_{ms}\uparrow $$

机械系统的高频运动能力通常越容易受到限制。

但如果为了减轻质量而过度缩小音圈:

  • 散热能力下降;
  • 有效导线长度减少;
  • BL 可能下降;
  • 最大输入功率下降。

因此音圈设计始终是在:

驱动力、质量、电阻、电感和散热之间寻找平衡。


振膜

如果说磁路负责“产生力”,音圈负责“传递力”,那么振膜就是动圈真正完成声学转换的部分。

振膜的任务可以概括为:

将音圈的机械运动转换为空气压力变化,并尽可能保持输入信号的时间和幅度关系。


不可能三角的应对方式:复合振膜

如前文所说,振膜设计存在一个经典的“不可能三角”:

轻、刚、阻尼,很难同时做到极致。

例如:

金属振膜

通常具有:

  • 高刚性;
  • 较低质量;
  • 但内部阻尼相对有限。

因此容易获得良好的高频延伸,却需要控制高频共振。

软质聚合物

通常:

  • 阻尼较高;
  • 共振容易控制;

但刚性相对较低。

因此工程师开始使用复合振膜:

1
2
3
4
5
表层:高刚性材料
        ↓
核心:轻质材料
        ↓
底层:高阻尼材料

不同材料承担不同任务。

例如:

  • 刚性层负责提高弯曲模态频率;
  • 轻质层负责降低运动质量;
  • 阻尼层负责吸收残余振动。

因此现代所谓“复合振膜”的核心思想并不是简单地把材料叠在一起,而是:

让不同材料分别承担质量、刚性和阻尼三个维度的优化任务。


振膜尺寸与高频

振膜尺寸也会直接影响高频性能。

声波波长:

$$ \lambda=\frac{c}{f} $$

频率越高:

$$ f\uparrow \Rightarrow \lambda\downarrow $$

当波长逐渐接近振膜尺寸时,不同位置之间的相位差开始明显增加。

因此:

$$ D\sim\lambda $$

时,振膜更难维持理想的整体活塞运动。

这也是为什么大振膜并不意味着一定拥有更好的高频。

大振膜:

  • 低频移动空气能力强;
  • 但高频更容易出现分割振动。

小振膜:

  • 高频更容易保持整体运动;
  • 但低频需要更大的位移才能移动相同空气体积。

因此振膜尺寸本质上也是:

低频效率与高频活塞运动之间的工程折中。


振膜几何

振膜并不一定是简单的平面。实际耳机经常采用:

  • 圆顶;
  • 椭圆;
  • 环形;
  • 锥形;
  • 波纹;
  • 多层曲面;

等结构。

原因在于:

几何形状本身就是一种机械设计手段。

例如增加曲率,可以提高结构刚性:

1
2
3
4
5
6
7
8
平面:

──────────

曲面:

   ╭────╮
 ╭─╯    ╰─╮

相同材料和厚度下,具有合理曲率的结构通常能够获得更高的抗弯能力。

因此振膜性能不仅由材料决定:

1
性能=材料+厚度+几何+阻尼+边界条件

这也是为什么不能简单地说:“某种材料比另一种材料好。”

即使使用完全相同的材料,通过改变:

  • 厚度;
  • 曲率;
  • 加强筋;
  • 涂层;
  • 悬挂方式;

也可以得到完全不同的机械响应。


悬边

振膜不能完全自由地悬浮,否则它会在受到驱动力后不断移动而无法稳定回到中心位置。

因此动圈单元需要**悬边(Surround)**将振膜固定在支架上。

悬边同时承担三个任务:

  1. 提供回复力;
  2. 限制振膜横向运动;
  3. 提供一定机械阻尼。

因此前面的质量-弹簧-阻尼模型:

$$ m\ddot{x}+c\dot{x}+kx=F $$

其中:

  • $m$ 主要来自振膜和音圈;
  • $k$ 很大程度来自悬边;
  • $c$ 则来自悬边材料、振膜材料以及其它机械损耗。

悬边与低频

系统固有频率:

$$ f_0= \frac{1}{2\pi} \sqrt{\frac{k}{m}} $$

因此:

$$ k\downarrow \Rightarrow f_0\downarrow $$

较柔软的悬边可以降低机械谐振频率,使单元更容易获得较低的低频延伸。

但悬边过软也会带来:

  • 振膜控制力下降;
  • 大位移时非线性增加;
  • 横向运动增加;
  • 最大位移受限。

因此低频设计不能简单理解成:

“悬边越软,低频越好。”

真正需要的是在目标频率下获得足够位移,同时保持良好的线性。


悬边的非线性

理想悬边应该满足:

$$ F=kx $$

也就是位移增加一倍,回复力也增加一倍。

但实际悬边往往存在非线性:

$$ F(x)=k_1x+k_2x^2+k_3x^3+\cdots $$

当振膜位移较小时,高阶项影响不明显。

当大音量低频信号使振膜产生较大位移时:

$$ k_2x^2,\quad k_3x^3 $$

开始变得重要。于是系统产生非线性失真。

因此低频 THD 很大程度上取决于:

  • 悬边线性;
  • 磁路线性;
  • 振膜刚度;
  • 音圈位移范围。

悬边与振膜并不是独立的

最后需要注意,悬边并不是一个可以单独评价的部件。

例如:

1
2
3
振膜很轻
+
悬边很软

可能获得很低的谐振频率,但大位移下容易失控。

反过来:

1
2
3
振膜很重
+
悬边很硬

虽然机械系统稳定,但灵敏度和低频延伸可能受到限制。

因此完整的动圈单元实际上可以看成:

$$ \boxed{ 磁路 + 音圈 + 振膜 + 悬边 } $$

四者共同构成一个机电换能系统。

其中:

部件核心作用主要影响
磁路提供磁场BL、效率、失真
音圈电→机械力阻抗、质量、功率、BL
振膜机械→声学频响、Break-up、瞬态
悬边约束与回复f0、低频、位移、阻尼

因此,动圈单元真正的设计目标并不是单独优化任何一个零件,而是:

让磁路产生线性的力,让音圈尽可能轻而高效,让振膜保持稳定的活塞运动,让悬边提供线性的回复力,最终使整个系统尽可能接近理想换能器。

声学负载

本节虽置于动圈单元之后,但声学负载的分析框架适用于所有换能原理——平板、静电、动铁的最终频响同样由换能器与腔体、导管、耳道负载共同塑造。这是理解耳机频响的通用视角。

前面讨论动圈单元时,主要关注的是:

1
2
3
4
5
6
7
电信号
 ↓
磁路
 ↓
音圈
 ↓
振膜

但振膜并不是系统的终点。

振膜真正需要推动的是空气。

因此,当振膜开始运动以后,整个耳机实际上还会进入另一个系统:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
振膜
 ↓
空气
 ↓
腔体
 ↓
导管 / 开孔
 ↓
耳道
 ↓
鼓膜

空气并不是一个“什么都没有”的介质。它本身具有:

  • 质量;
  • 弹性;
  • 阻尼。

因此空气也可以储存能量、产生共振,并对振膜运动形成阻力。

这意味着:

耳机最终的频率响应,并不只由换能器决定,而是由换能器与声学负载共同决定。

对于现代 IEM 来说,这一点尤其重要。

一个单元本身可以拥有非常优秀的频响,但只要改变:

  • 后腔体积;
  • 前腔体积;
  • 导管长度;
  • 导管直径;
  • 阻尼材料;
  • Vent 大小;

最终到达耳膜的频响就可能完全不同。

因此可以把整个系统写成:

$$ H_{total}(f) = H_{driver}(f) \cdot H_{acoustic}(f) \cdot H_{ear}(f) $$

其中:

  • $H_{driver}$:换能器本身;
  • $H_{acoustic}$:腔体、导管、阻尼和开孔;
  • $H_{ear}$:耳道和人耳本身。

也就是说:

振膜只是声学系统的起点,而不是终点。


空气

空气最重要的三个物理属性,可以分别对应到机械系统和电路系统中的三个基本元件:

空气的性质声学参数电路类比
空气质量Acoustic Mass电感 $L$
空气弹性Acoustic Compliance电容 $C$
空气阻尼Acoustic Resistance电阻 $R$

这并不是为了方便类比而强行套用电路概念。声学系统和机械、电路系统在数学形式上确实具有高度相似性。

因此可以利用电路理论分析:

  • 腔体;
  • 导管;
  • Vent;
  • 阻尼器;
  • 耳道;

最终建立一个完整的声学阻抗网络。


空气质量:Acoustic Mass

空气虽然很轻,但只要空气柱被限制在一个通道中,它就具有明显的惯性。

例如一根导管:

1
2
3
4
5
┌──────────────┐
│   空气空气   │
└──────────────┘
       ↑
     空气柱

当振膜推动空气时,空气柱需要整体加速。因此空气会产生类似质量的作用。

在简化模型中,声学质量可以近似表示为:

$$ M_a\approx \frac{\rho l}{S} $$

其中:

  • $\rho$:空气密度;
  • $l$:空气柱长度;
  • $S$:截面积。

于是:

$$ l\uparrow \Rightarrow M_a\uparrow $$

而:

$$ S\uparrow \Rightarrow M_a\downarrow $$

也就是说:

导管越长,空气越“重”;导管越粗,空气越“轻”。

这就是为什么导管长度和直径能够影响耳机的频率响应。


空气弹性:Acoustic Compliance

如果空气被限制在一个封闭腔体中,振膜推动空气时会压缩空气。

空气被压缩以后,会产生恢复力。这就相当于一个弹簧。

对于小信号,可以近似表示为:

$$ C_a\propto\frac{V}{\rho c^2} $$

其中:

  • $V$:腔体体积;
  • $\rho$:空气密度;
  • $c$:声速。

因此:

$$ V\uparrow \Rightarrow C_a\uparrow $$

也就是说:

腔体越大,空气弹簧越软。

反过来:

$$ V\downarrow \Rightarrow C_a\downarrow $$

空气弹簧变硬。

这也是为什么 IEM 中非常微小的腔体尺寸变化,都可能改变最终频响。


空气阻尼:Acoustic Resistance

现实中的空气运动不会完全无损。

空气与:

  • 管壁;
  • 阻尼材料;
  • 网孔;
  • 狭窄通道;

之间会产生能量损耗。

因此可以定义声学阻力:

$$ R_a $$

它描述的是声能在传播过程中被消耗的程度。

阻尼越大:

  • 共振峰越低;
  • Q 值越低;
  • 振铃越短。

阻尼越小:

  • 共振峰越明显;
  • Q 值越高;
  • 储能越强。

因此一个简单的声学共振器可以看成:

1
2
3
4
5
6
7
       R
       │
       L
       │
       C
       │
      GND

也就是一个:

RLC 网络。


后腔

后腔(Rear Cavity)是位于振膜后方的空气空间。

典型结构:

1
2
3
4
5
6
7
8
      振膜
       │
       ↓
   ┌───────┐
   │       │
   │ 后腔  │
   │       │
   └───────┘

后腔最直接的作用,是决定振膜背后的空气负载。

由于空气具有弹性,后腔实际上会对振膜形成一个额外的空气弹簧。

因此:

$$ V_{rear}\downarrow \Rightarrow C_{rear}\downarrow $$

空气弹性增强。

相应地,振膜会受到更明显的回复力。

所以:

后腔不是简单的“空腔”,而是换能器机械系统的一部分。


封闭式

封闭式耳机将后腔基本密封。

结构:

1
2
3
4
5
6
7
8
        振膜
         │
         ↓
   ┌──────────┐
   │          │
   │  封闭后腔 │
   │          │
   └──────────┘

当振膜向后运动:

1
2
3
4
5
6
7
振膜
 ↓
空气被压缩
 ↓
压力增加
 ↓
产生回复力

因此封闭后腔相当于给振膜增加了一根空气弹簧。

腔体越小:

$$ C_{air}\downarrow $$

空气弹簧越硬。

这会改变单元的低频机械系统。


封闭后腔的优点

封闭结构能够:

  • 隔离外部声音;
  • 减少前后声波直接相消;
  • 提供较稳定的低频加载;
  • 提高低频隔离能力。

因此封闭式耳机通常能够获得较强的低频存在感。

但代价是:

后腔中的空气压力会更加直接地参与振膜运动。

如果设计不合理,就可能产生:

  • 低频共振;
  • 压力感;
  • 较高 Q 值;
  • 腔体储能。

开放式

开放式耳机允许后腔与外部空气连通:

1
2
3
4
5
6
7
        振膜
         │
         ↓
   ┌──────────┐
   │          │──────→ 外部空气
   │  后腔    │
   └──────────┘

这样后腔空气不再完全封闭。

因此空气弹簧效应降低:

$$ C_{rear} \rightarrow 较弱 $$

同时振膜背面的压力更容易释放。

开放式结构的另一个重要作用,是允许振膜背面的声波向外辐射。

这会影响:

  • 低频响应;
  • 声场;
  • 与环境之间的声学耦合。

因此:

开放式 ≠ 单纯“漏音”。

它实际上改变了整个振膜的声学边界条件。


前腔

如果后腔主要决定振膜背面的空气负载,那么前腔就是:

振膜与耳膜之间的空气空间。

典型结构:

1
2
3
4
5
6
7
振膜
 ↓
前腔
 ↓
耳道
 ↓
鼓膜

对于耳机而言,前腔尤其重要,因为最终听到的声音就是经过这个空间以后到达鼓膜的。

前腔通常包括:

  • 振膜前方空间;
  • 耳罩内部空间;
  • 耳套形成的密闭空间;
  • IEM 导管;
  • 耳道入口附近空间。

它们都会参与声学响应。


入耳式耳机的耳套

对于 IEM:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
        IEM
         │
         ↓
       导管
         │
      ┌──┴──┐
      │耳套 │
      └──┬──┘
         ↓
        耳道

耳套实际上是声学系统的一部分。它首先决定密封程度。

如果耳套与耳道形成良好密封,低频空气压力能够有效建立。

如果存在泄漏:

1
2
3
4
5
6
7
振膜
 ↓
低频压力
 ↓
泄漏
 ↓
外界

低频能量就会被释放。

由于低频波长很长,对微小泄漏并不意味着“影响很小”。

实际上,耳套密封状态对 IEM 低频响应的影响往往远大于很多电子参数。


耳套还会改变:

  • 前腔体积;
  • 耳道入口距离;
  • 导管长度;
  • 耳机插入深度。

因此同一只 IEM:

1
浅插

与:

1
深插

可能得到明显不同的频响。

尤其是高频,因为此时波长已经与耳道和导管尺寸处于同一数量级。


头戴式耳机的耳罩

头戴式耳机的前腔则主要由:

  • 耳罩;
  • 耳垫;
  • 振膜;
  • 耳廓;

共同形成。

可以简化为:

1
2
3
4
5
6
7
8
9
振膜
 ↓
耳罩内部空气
 ↓
耳垫
 ↓
耳廓
 ↓
耳道

耳垫的厚度、材料和密封程度都会改变前腔。

例如:

耳垫变厚:

$$ V_{front}\uparrow $$

前腔体积增加。

耳垫变软:

  • 耳机与头部贴合方式改变;
  • 泄漏状态改变;
  • 耳廓耦合方式改变。

因此耳垫并不是简单的“舒适性配件”。

它实际上是:

头戴式耳机的重要声学元件。


声学阻抗

机械系统中存在:

$$ F=ma $$

电路中存在:

$$ V=ZI $$

而声学系统也存在对应关系。

声学阻抗定义为:

$$ Z_a= \frac{P}{U} $$

其中:

  • $P$:声压;
  • $U$:体积速度(Volume Velocity)。

因此:

声学阻抗描述的是空气运动有多“困难”。

如果某个结构声学阻抗很低,空气容易运动;如果声学阻抗很高,空气运动受到更强限制。


声学滤波器:空气组成的RLC网络

现代耳机中的:

  • 导管;
  • 腔体;
  • Vent;
  • 阻尼网;
  • 阻尼棉;
  • 耳道;

都可以被视为这个声学网络的一部分。

因此整个耳机实际上可以表示成:

1
2
3
4
5
6
7
换能器
   ↓
声学 RLC 网络
   ↓
耳道
   ↓
鼓膜

这也是为什么电声仿真中经常使用电路模型来模拟耳机。


共振频率

最简单的 LC 系统,其共振频率为:

$$ f_0= \frac{1}{2\pi\sqrt{LC}} $$

换成声学参数:

$$ f_0= \frac{1}{2\pi\sqrt{M_aC_a}} $$

这条公式说明:

只要改变空气质量或空气弹性,就可以改变共振频率。

例如:

导管变长:

$$ M_a\uparrow $$

则:

$$ f_0\downarrow $$

腔体变大:

$$ C_a\uparrow $$

同样会使:

$$ f_0\downarrow $$

因此一个很小的几何变化,就可能造成明显的声学频响变化。


阻尼材料

阻尼材料的作用,就是增加声学网络中的 $ R_a $

例如:

  • 阻尼网;
  • 海绵;
  • 无纺布;
  • 毛毡;
  • 微孔材料;

都可以通过增加空气运动阻力来降低共振 Q 值。

简单来说:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
没有阻尼:

      /\
     /  \
____/    \____


增加阻尼:

     /\
____/  \____

共振峰降低,响应更加平滑。

但阻尼并不是越大越好。

如果:

$$ R_a\uparrow\uparrow $$

空气流动被过度限制,可能导致:

  • 整体输出下降;
  • 高频衰减;
  • 瞬态改变。

因此阻尼材料真正的作用是:

控制特定频率的能量,而不是简单地“把声音变小”。


导管

导管(Nozzle / Tube)是 IEM 中最典型的声学元件。

它同时具有:

  • 空气质量;
  • 管壁损耗;
  • 截面积;
  • 长度;

因此本质上就是一个声学传输网络。

其空气质量近似:

$$ M_a\approx\frac{\rho l}{S} $$

所以:

$$ l\uparrow \Rightarrow M_a\uparrow $$$$ S\downarrow \Rightarrow M_a\uparrow $$

也就是说:长而细的导管具有更大的声学惯性。


导管还会形成管道共振。

对于近似一端封闭、一端开放的管道,其基频可以近似写成:

$$ f_0\approx\frac{c}{4L} $$

其中:

  • $c$ 为声速;
  • $L$ 为有效长度。

例如:

$$ L=17mm $$

则:

$$ f_0 \approx \frac{343}{4\times0.017} \approx5.0kHz $$

这已经落在非常敏感的听觉区域。因此 IEM 导管的尺寸并不是随意设计的。


开孔(Vent)

Vent 是耳机中一个看起来非常简单、但实际作用非常复杂的结构。

1
2
3
4
5
6
7
8
封闭腔体
┌───────────┐
│           │
│           │ ●
│           │
└───────────┘
             ↑
            Vent

Vent 的基本作用是让空气能够从腔体流向外部。

因此它可以改变:

  • 静态压力;
  • 低频声学阻抗;
  • 腔体共振;
  • 振膜运动阻尼。

为什么完全封闭后腔会产生问题?

如果后腔完全封闭:

1
2
3
4
5
6
7
振膜
 ↓
空气被压缩
 ↓
压力升高
 ↓
回复力增强

尤其在低频大振幅情况下,空气弹簧作用会越来越明显。

加入 Vent 后:

1
2
3
4
5
6
7
振膜
 ↓
后腔
 ↓
Vent
 ↓
外界

空气能够释放。于是后腔的等效声学刚度下降。

这会改变低频响应。

因此:

Vent 并不只是为了“让空气流通”,而是在主动改变后腔的声学阻抗。


Vent大小的影响

Vent 的尺寸会直接影响空气流动阻力。

Vent 越大:

  • 泄压越容易;
  • 低频压力更容易释放;
  • 后腔负载减弱。

Vent 越小:

  • 空气流动受到限制;
  • 后腔更接近封闭;
  • 低频加载更强。

但实际关系并不是简单的:“孔越大,低频越少”。

因为 Vent 本身还可能与腔体形成新的声学共振。


亥姆霍兹共振

亥姆霍兹共振(Helmholtz Resonance)是理解耳机声学结构最重要的例子之一。

最经典的结构就是:

1
2
3
4
5
6
7
8
9
       瓶口
        │
      ┌─┴─┐
      │   │
      │   │
      │空气│
      │腔体│
      │   │
      └───┘

它由一个空气腔体和一个狭窄开口组成。

其核心思想是:开口中的空气柱相当于质量,腔体中的空气相当于弹簧。

因此:

1
2
3
4
5
6
7
Vent空气柱
     ↓
Acoustic Mass

腔体空气
     ↓
Acoustic Compliance

两者组合以后,就形成一个共振系统。


Helmholtz 共振频率

理想化条件下:

$$ f_H= \frac{c}{2\pi} \sqrt{ \frac{A} {V L_{eff}} } $$

其中:

  • $A$:开口面积;
  • $V$:腔体体积;
  • $L_{eff}$:开口的有效长度。

由公式可以直接得到:

$$ A\uparrow \Rightarrow f_H\uparrow $$$$ V\uparrow \Rightarrow f_H\downarrow $$$$ L_{eff}\uparrow \Rightarrow f_H\downarrow $$

因此只需要改变:

  • Vent 面积;
  • 腔体体积;
  • Vent 长度;

就可以改变共振频率。


为什么 Helmholtz 结构可以调音?

假设一个腔体的 Helmholtz 共振位于:

$$ f_H=100Hz $$

那么在该频率附近,空气柱会发生明显振荡。

如果结构设计得当,它可以:

  • 增强某一频段;
  • 抵消某一频段;
  • 改变阻抗;
  • 改变相位。

因此它本质上就是一个:

声学滤波器。

现代耳机中大量结构都可以从这个角度理解。

例如:

1
2
3
4
5
Vent
+
后腔
=
Helmholtz Resonator

或者:

1
2
3
4
5
导管
+
前腔
=
声学共振系统

从 RLC 网络理解 Helmholtz

前面已经建立:

$$ M_a\leftrightarrow L $$$$ C_a\leftrightarrow C $$

因此 Helmholtz 共振器实际上就是一个简单的 LC 共振器。

其共振:

$$ f_H= \frac{1}{2\pi\sqrt{M_aC_a}} $$

而阻尼对应:

$$ R_a $$

因此实际 Helmholtz Resonator 并不是一个无限尖锐的理想共振,而是一个具有有限 Q 值的 RLC 网络。

这就把前面的所有概念连接起来:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
振膜
 ↓
空气
 ↓
Acoustic Mass
 ↓
Acoustic Compliance
 ↓
Acoustic Resistance
 ↓
RLC网络
 ↓
频响 + 相位

耳机真正的“调音”是什么

到这里,可以重新理解所谓的“调音”。

调音并不只是换一个振膜材料或者磁铁。

现代耳机设计实际上可以同时调整:

结构主要控制
振膜机械响应
磁路驱动力与线性
后腔后侧空气负载
前腔耳前声学负载
导管空气质量与共振
阻尼网共振 Q 值
Vent压力与低频负载
耳套密封与前腔
耳道最终声学滤波

因此:

$$ Sound=Driver+Cavity+Tube+Damping+Vent+Ear $$

这也是为什么:

耳机不是“一个换能器”,而是一个完整的机电声学系统。

而对于多单元 IEM 来说,这种思路更加重要。

因为多个单元之间除了需要解决:

1
电学分频

还需要解决:

1
2
3
4
5
6
7
8
9
声学分频
+
相位关系
+
声学阻抗
+
导管传播
+
腔体共振

因此现代 IEM 的复杂程度,并不是简单地来自“单元数量更多”。

真正复杂的是:

如何让多个不同换能器经过一整套空气组成的 RLC 网络后,在正确的频率、幅度和相位上到达耳膜。

这也正是后续平板、静电和动铁单元仍然需要面对的共同问题:

换能器可以改变,但空气永远是最后一级负载。

平板

基本思想与最大改变

动圈单元存在一个根本的结构问题:

振膜并不是被整个面积同时驱动,而是由中央或局部的音圈进行集中驱动。

真正直接受到洛伦兹力作用的,是位于磁隙中的音圈。振膜其它区域必须依靠材料本身的刚性,把音圈产生的力传递出去。

这就产生了前面讨论过的问题:

  • 振膜不同区域运动不同步;
  • 局部弯曲;
  • Break-up;
  • 相位差;
  • 波前畸变。

即使使用非常高刚性的振膜材料,也只能尽量推迟这些问题,而不能从驱动方式上彻底消除集中驱动的缺陷。


点驱动 → 面驱动

这是平板磁驱(Planar Magnetic)最重要的改变。

它不再使用一个独立的传统音圈,而是将导体线路(Trace)直接布置在整个振膜表面。

当电流通过这些线路,同时磁场覆盖整个振膜区域时,洛伦兹力就不再集中作用于某一个小区域,而是分布在整个振膜上。

因此两种结构可以简单对比:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
动圈:

        ↑
████████████
        ↓
      音圈


平板:

↑ ↑ ↑ ↑ ↑ ↑ ↑ ↑
████████████████
↓ ↓ ↓ ↓ ↓ ↓ ↓ ↓

动圈需要:

$$ 音圈\rightarrow振膜\rightarrow其它区域 $$

逐渐传递机械应力。

平板则更接近:

$$ 驱动力\rightarrow整个振膜 $$

因此振膜内部为了“把中心的力传到边缘”而产生的额外应力明显降低。


为什么面驱动更加理想?

洛伦兹力仍然满足:

$$ F=BIL $$

区别只在于:力作用在哪里。

动圈:

$$ F_{driver} \rightarrow 局部区域 $$

平板:

$$ F_{driver} \rightarrow 大面积分布 $$

如果整个振膜上的单位面积驱动力能够尽可能保持一致:

$$ \frac{F_1}{A_1} \approx \frac{F_2}{A_2} \approx ... $$

那么振膜各区域就不需要依赖自身刚性来完成如此强的力传递。

这会直接改善几个问题:

项目动圈平板
驱动方式点驱动面驱动
力的分布局部集中大面积分布
振膜内部应力较高较低
Break-up更依赖振膜刚性更容易控制
波前一致性受局部驱动影响通常更容易保持
运动质量音圈增加质量导体直接布置在振膜
低频失真取决于磁路/悬边取决于磁路/振膜/悬边

因此,平板真正解决的问题并不是简单的:“振膜更薄”。

而是从驱动力分布的根本上改变了振膜的工作方式。


面驱动并不意味着没有Break-up

面驱动降低了 Break-up 的驱动因素,但任何有限尺寸、有限刚性的振膜,都存在机械模态。

即使整个振膜受到完全均匀的驱动力:

  • 振膜仍然有质量;
  • 材料仍然存在有限刚性;
  • 振膜仍然存在边界条件;
  • 空气仍然提供声学负载。

因此仍然会存在:

$$ f_{mode1},f_{mode2},f_{mode3},... $$

只不过合理设计的平板振膜可以让这些模态:

  • 更晚出现;
  • 更弱;
  • 更分散;
  • 更容易被阻尼。

所以真正的目标仍然不是消灭 Break-up。

而是让 Break-up 尽可能晚、尽可能弱,并且不要形成尖锐的高 Q 共振。


为什么平板振膜可以非常薄?

传统动圈音圈属于运动系统的一部分,因此:

$$ M_{moving} = M_{diaphragm} + M_{voice\ coil} + \cdots $$

而平板的导体可以直接沉积或形成在薄膜表面,不再需要传统意义上的独立绕制音圈。

因此:

$$ M_{moving} \downarrow $$

可以进一步降低运动质量。

不过这里仍然存在一个工程折中:

振膜越薄,越容易降低质量,但也越依赖材料本身的刚性、张力和磁路设计来维持稳定运动。

因此“薄”本身并不是性能指标。真正重要的是:

$$ \frac{刚性}{面密度} $$

以及:

$$ 阻尼 $$

之间的综合关系。


导体线路

平板振膜上真正承担电流的,是导体线路(Trace)。

很多人理解平板耳机时,会把注意力放在:

  • 磁铁;
  • 薄膜;
  • 磁场强度。

但实际上,Trace 的几何结构同样是核心设计。

因为:Trace 不只是负责导电,它同时决定驱动力在振膜上的空间分布。


Trace 如何产生驱动力?

假设一条导体位于磁场中:

1
2
3
4
5
6
磁场:
↓↓↓↓↓↓↓↓↓↓

────────────
Trace
────────────

电流通过以后:

$$ F=BIL $$

产生垂直于导体和磁场方向的力。

如果振膜上有大量平行 Trace:

1
2
3
4
≈≈≈≈≈≈≈≈≈≈
≈≈≈≈≈≈≈≈≈≈
≈≈≈≈≈≈≈≈≈≈
≈≈≈≈≈≈≈≈≈≈

那么这些区域都能够产生驱动力。

因此 Trace 的:

  • 宽度;
  • 间距;
  • 数量;
  • 走线方向;
  • 分布密度;

都会影响最终的受力均匀性。


为什么要尽可能均匀?

理想状态下:

$$ F(x,y)\approx constant $$

也就是振膜不同位置受到的单位面积驱动力尽可能接近。

如果某个区域:

$$ F_1\gg F_2 $$

那么振膜就会出现:

1
2
3
4
5
6
7
8
区域 A:
↑↑↑↑

区域 B:
↑

区域 C:
↑↑↑

不同区域加速度不同。

最终就会产生:

  • 局部弯曲;
  • 模态;
  • 相位差;
  • 波前变化。

因此平板耳机中的 Trace 设计,本质上也是:

振膜机械结构设计的一部分。


Trace 宽度与间距

Trace 太窄:

  • 有效导体面积降低;
  • 电阻增加;
  • 发热增加。

Trace 太宽:

  • 振膜有效面积被大量金属覆盖;
  • 运动质量增加;
  • 线路之间的空间减少。

因此需要在:

$$ R $$

与:

$$ M $$

之间平衡。

同样,Trace 间距也影响:

  • 驱动力密度;
  • 振膜质量分布;
  • 局部刚性;
  • 电流分布。

因此不能简单地认为:

“Trace 越多越好。”

真正需要的是:

让电气、机械和磁场分布同时达到合理状态。


Trace 的阻抗

平板耳机经常具有较低的直流阻抗。

原因之一就是其导体线路需要覆盖很大的振膜面积,而为了降低运动质量,导体又不能无限增厚。

因此:

$$ R_e $$

可能较低。

根据:

$$ P=I^2R $$

在相同输出功率下:

$$ I=\sqrt{\frac{P}{R}} $$

当:

$$ R\downarrow $$

则:

$$ I\uparrow $$

这就是为什么很多平板耳机虽然并不一定需要极高的电压,却需要耳放具备较好的电流输出能力。

因此平板耳机常见的驱动特点是:低阻抗、高电流需求。

当然,具体型号仍然取决于其 Trace 设计、灵敏度和磁路结构,不能只根据“平板”这一类别判断驱动难度。


磁路

平板振膜与传统动圈最大的区别之一,是磁场必须覆盖整个振膜区域。

因此磁路设计会直接决定:

$$ B(x,y) $$

是否均匀。

如果磁场分布不均:

1
2
3
4
5
6
7
左侧:

B ↑↑↑↑

右侧:

B ↑↑

即使 Trace 完全均匀:

$$ F=BIL $$

仍然会因为 $B$ 不同而产生不同驱动力。

因此:Trace 均匀只是第一步,磁场同样需要均匀。


单面磁路

最简单的平板结构可以在振膜一侧放置磁铁:

1
2
3
4
5
磁铁
████████████

────────────
振膜 + Trace

这种结构的优点是:

  • 结构简单;
  • 重量较低;
  • 磁铁数量较少;
  • 成本相对较低。

但缺点是:振膜两侧的磁场分布并不完全对称。

因此在设计过程中需要仔细优化磁铁间距、磁场方向以及磁通路径。


双面 Push-Pull 磁路

更典型的高性能平板结构是Push-Pull 双面磁路。

结构可以简化为:

1
2
3
4
5
6
N S N S N

──────────
   振膜

S N S N S

振膜位于两排磁体之间,这样做是为了让振膜两侧形成更加对称的磁场。

理想情况下:

$$ B_{front}\approx B_{rear} $$

从而使振膜在向前和向后运动时都能够获得较为一致的驱动力。


Push-Pull 为什么能够降低失真?

假设单面磁路中:

$$ B(x) $$

随着振膜位移 $x$ 变化明显。

那么:

$$ F(x)=B(x)IL $$

就会产生较强的位移相关非线性。

而对称 Push-Pull 磁路的目标是让:

$$ B(+x)\approx B(-x) $$

于是正向和反向运动时的驱动力更加对称。这能够降低部分偶次非线性成分,并改善整体驱动线性。

因此双面磁路的重要价值是提高振膜工作区域内的磁场均匀性与对称性。


双面磁路的代价

但双面磁路也会带来明显代价。

需要:

  • 更多磁体;
  • 更复杂的磁路;
  • 更大的结构厚度;
  • 更高重量;
  • 更高制造成本。

因此平板耳机通常比结构相近的动圈耳机更重。


振膜形状

平板振膜看起来通常是一张平面薄膜,但“平”并不意味着几何结构可以忽略。

振膜的:

  • 长宽比;
  • 边界;
  • 张力;
  • 加强结构;
  • 导体分布;

都会影响其机械模态。

因此平板振膜实际上仍然是一个复杂的二维振动系统。


张力

很多平板振膜依靠预张力保持稳定。可以简单理解为:

1
2
3
4
5
6
7
8
9
固定边界

┌────────────┐
│            │
│    振膜     │
│            │
└────────────┘

←────张力────→

如果张力增加:

$$ T\uparrow $$

振膜抵抗局部形变的能力通常会提高。

因此:

  • 模态频率改变;
  • 振膜更加稳定;
  • 某些低频大位移问题得到控制。

但张力过高也会增加机械约束,并改变低频顺性。

所以平板振膜不是简单地“越松越好”或“越紧越好”,而需要精确控制张力。


矩形与椭圆结构

振膜的边界形状会影响模态分布。

例如矩形振膜:

1
2
3
4
5
┌──────────────┐
│              │
│              │
│              │
└──────────────┘

其不同方向的模态可能存在较明显的规律。

而改变为:

1
2
3
4
5
    ╭────────╮
  ╭─          ─╮
 ╰─            ─╯
  ╰─          ─╯
    ╰────────╯

可以改变模态之间的关系。

因此振膜形状不仅影响外观,还可以用于:

  • 调整第一模态;
  • 分散共振;
  • 改变高频响应;
  • 优化波前。

为什么平板振膜不是越大越好?

平板振膜可以做得很大,但大振膜同样会面临:

$$ D\uparrow \Rightarrow 更多模态 $$

因为振膜尺寸增加以后:

  • 不同位置之间的传播距离增加;
  • 模态数量增加;
  • 高频下更容易产生相位差。

因此:

大面积面驱动解决了“驱动力集中”的问题,却没有消除有限尺寸振膜本身的波动问题。

这也是为什么平板仍然需要:

  • 合理的振膜尺寸;
  • 高刚性/低质量材料;
  • 合理张力;
  • 合理 Trace;
  • 磁场均匀性;

共同控制高频响应。


静电

基本原理与最大改变

前面的平板单元已经完成了一次重要改变:把动圈的点驱动变成了面驱动。

但即使是平板耳机,振膜仍然需要携带金属 Trace 和导体线路。这些导体虽然已经比传统音圈轻得多,但仍然属于运动系统的一部分。

于是问题自然变成:如果连振膜上的导体都尽可能去掉,只让振膜本身运动,会怎样?

这就是静电单元(Electrostatic)的基本思想。

它不再依靠:

$$ F=BIL $$

产生机械驱动力。

而是直接利用电场产生的静电力。

因此,从换能方式来看:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
动圈:

电流
 ↓
磁场 × 音圈
 ↓
机械力
 ↓
振膜


平板:

电流
 ↓
磁场 × Trace
 ↓
面分布机械力
 ↓
振膜


静电:

电压
 ↓
电场
 ↓
静电力
 ↓
振膜

这是静电单元相对于前两种结构最大的改变。


基本结构

一个典型的静电耳机由三层组成:

1
2
3
4
5
6
7
8
定子(Stator)
════════════════
        ↓
振膜(Diaphragm)
────────────────
        ↓
定子(Stator)
════════════════

真正运动的只有中间那层极薄的振膜,两侧定子本身并不运动。

为了让声音能够通过,定子通常具有大量开孔:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
════════════════
○ ○ ○ ○ ○ ○ ○ ○
════════════════

────────────────
      振膜
────────────────

════════════════
○ ○ ○ ○ ○ ○ ○ ○
════════════════

因此定子同时承担两个作用:

  1. 建立电场;
  2. 让声波能够穿过。

静电振膜为什么可以如此轻?

静电单元与动圈、平板最大的区别之一,是振膜不需要携带传统意义上的驱动导体。

它通常只需要:

  • 一层极薄的聚合物薄膜;
  • 表面一层极薄的导电层。

其中真正承担机械支撑作用的是聚合物薄膜。

导电层主要用于:

  • 保持电荷;
  • 与外部电场发生作用。

因此它对运动质量的增加非常有限。

于是可以得到:

$$ M_{moving} = M_{diaphragm} + M_{conductive\ layer} $$

而导电层极薄,所以:

$$ M_{moving}\approx M_{diaphragm} $$

这使静电振膜能够达到非常低的单位面积质量。


质量为什么如此重要?

前面已经知道:

$$ a=\frac{F}{m} $$

当驱动力 $F$ 相同的时候:

$$ m\downarrow \Rightarrow a\uparrow $$

所以振膜越轻,就越容易快速响应输入信号。

这并不意味着“轻”自动等于“声音更好”,但它确实降低了运动系统的惯性。

因此静电单元特别容易实现:

  • 较高的瞬态响应;
  • 较低的运动储能;
  • 很好的高频延伸;
  • 较小的机械惯性。

其核心并不是所谓的“静电音色”。

而是极低的运动质量 + 大面积均匀驱动。


静电力从哪里来?

对于理想平行板结构,单位面积上的静电压力可以近似写成:

$$ p= \frac{1}{2}\varepsilon E^2 $$

其中:

  • $\varepsilon$:介质介电常数;
  • $E$:电场强度。

而:

$$ E\approx\frac{V}{d} $$

其中:

  • $V$:两电极之间的电压;
  • $d$:间距。

于是:

$$ p \approx \frac{1}{2} \varepsilon \left( \frac{V}{d} \right)^2 $$

这个公式非常重要,因为它直接说明:

静电驱动力与电压平方相关,并且会随着电极间距减小而快速增强。

这也是为什么静电单元需要:

  • 很小的振膜质量;
  • 很小而且稳定的电极间距;
  • 很高的工作电压。

为什么采用Push-Pull结构?

如果只在振膜一侧建立电场:

1
2
3
4
5
定子
████████
   ↓↓↓
振膜
────────

振膜受到的力容易产生明显的不对称性;现代静电耳机通常采用Push-Pull(推挽)结构。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
       定子
════════════════
        ↓

       振膜
────────────────

        ↑
════════════════
       定子

两侧定子分别施加相反极性的音频电压。

例如:

1
2
左定子: +V
右定子: -V

振膜受到的电场作用方向发生变化,于是:

1
2
3
4
5
6
7
+V / -V
   ↓
振膜向左

-V / +V
   ↓
振膜向右

这样可以让正、负半周期的驱动力更加对称。


为什么 Push-Pull 能够提高线性?

静电力本身与电场平方有关:

$$ F\propto E^2 $$

需要注意,这个平方律结论是在恒压驱动条件下得出的。现代静电耳机普遍采用恒电荷偏置(振膜经大电阻充电,音频信号周期内电荷近似不变),此时驱动力与信号电压近似线性,平方律非线性大幅缓解。不过振膜位移仍会改变两侧间隙、影响电场分布,残余的非线性由推挽结构进一步处理。

如果只采用单侧驱动,振膜位置变化会明显影响电场分布,因此容易产生非线性。而在对称 Push-Pull 结构中,两侧电场共同作用。

理想情况下:

$$ F_{left}(x) + F_{right}(x) $$

能够形成更加对称的总驱动力。因此可以降低部分偶次非线性,并改善整体线性度。

所以Push-Pull 的意义不是简单增加驱动力,而是让驱动力更加对称。


偏置电压(Bias)

静电振膜需要先保持一个稳定的静电荷,因此系统需要一个直流偏置:

$$ V_{bias} $$

同时再叠加音频信号:

$$ V_{audio}(t) $$

可以简化为:

1
2
3
4
5
6
7
固定偏置
   +
交流音频
   ↓
定子电场
   ↓
振膜运动

偏置电压的作用,是让振膜处于一个稳定的静电工作状态。

静电耳机通常需要数百伏量级的偏置电压。需要特别注意:高电压不等于高功率。

因为静电耳机的振膜与定子之间主要是电容性负载。

理想电容的电流满足:

$$ I=C\frac{dV}{dt} $$

因此在静态情况下并不存在像传统电阻负载那样持续的大电流。

所以:

$$ 高电压 \neq 大功耗 $$

这也是静电耳机需要专用高压驱动器,而不能简单用普通耳放直接驱动的原因。


为什么静电的驱动力更加均匀?

平板已经实现面驱动,但平板的驱动力来自大量离散的 Trace:

1
2
3
↑ ↑ ↑ ↑ ↑ ↑
↑ ↑ ↑ ↑ ↑ ↑
↑ ↑ ↑ ↑ ↑ ↑

因此它仍然是由一个个导体区域提供驱动力。

静电单元则不同。只要电场能够在整个振膜区域内保持较好的均匀性:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
↓↓↓↓↓↓↓↓↓↓↓↓
↓↓↓↓↓↓↓↓↓↓↓↓
↓↓↓↓↓↓↓↓↓↓↓↓

────────────────
      振膜
────────────────

↑↑↑↑↑↑↑↑↑↑↑↑
↑↑↑↑↑↑↑↑↑↑↑↑
↑↑↑↑↑↑↑↑↑↑↑↑

那么整个振膜都会处于近似连续的电场中。

于是理想状态下:

$$ F(x,y)\approx constant $$

这比平板的离散 Trace 驱动更加接近理想的均匀面驱动。

因此,从:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
动圈
 ↓
局部驱动

平板
 ↓
离散分布驱动

静电
 ↓
连续电场驱动

可以看到换能器一直在朝着更均匀的驱动力分布发展。


并非完美

静电单元虽然在:

  • 运动质量;
  • 驱动力均匀性;
  • 高频响应;
  • 低失真潜力;

等方面具有非常明显的优势,但它并不是一个在所有频段都更理想的换能器。

静电耳机的阿喀琉斯之踵,就是低频。

这并不是某一个品牌或者某一个型号的设计缺陷,而是静电换能原理本身受到多重约束的结果。


低频为什么需要更大的位移?

首先需要明确,低频并不等于需要更大的加速度。

对于正弦信号:

$$ x(t)=X\sin(2\pi ft) $$

其速度:

$$ v(t)=2\pi fX $$

加速度:

$$ a(t)=-(2\pi f)^2X $$

如果希望在不同频率下产生相同的声压,振膜所需要的体积位移是一个非常重要的因素。

对于近似活塞式振膜:

$$ U=S v $$

其中:

  • $U$:体积速度;
  • $S$:有效振膜面积;
  • $v$:振膜速度。

位移需求与频率的关系取决于声学边界条件,这里不能简单套用单一模型:

  • 在密封耦合腔中,声压正比于体积位移($p=\rho c^2\Delta V/V$),维持恒定声压所需的位移近似与频率无关;
  • 但静电耳机普遍采用开放式结构,振膜正反两面辐射的声波反相,在远场发生偶极子声短路,且频率越低、抵消越彻底。自由场中要补偿这种抵消,位移需求会随频率降低以 $X\propto 1/f^2$ 的速度急剧攀升。

也就是说,频率越低,如果希望维持相同的声压,振膜就需要大得多的位移。

由此可以看清静电低频的真正瓶颈是三重的:

  1. 偶极子抵消:前后声波短路,低频辐射效率骤降;
  2. 行程上限:定子间隙小,振膜可用位移有限,低频大声压下容易触及机械限位、失真骤增;
  3. 密封泄漏:耳罩佩戴密封不严时低频压力无法建立,响应进一步滚降。

这恰好与静电单元的结构特点发生了冲突。因为静电振膜通常:

  • 极薄;
  • 极轻;
  • 工作间隙很小;
  • 张力较高;
  • 两侧存在固定定子。

它天然适合小位移、高精度运动,而不是大位移、低频高声压运动。


定子间距限制了最大位移

这是静电低频问题中最直接的限制。

静电结构通常是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
定子
══════════════
       ↑
       │ d
       ↓
振膜
──────────────
       ↑
       │ d
       ↓
══════════════
定子

振膜必须始终保持在两个定子之间,因此 $ |x|<d $ 是最基本的几何约束。

而实际工作中不可能让 $ |x|\rightarrow d $

因为一旦振膜距离定子过近,就可能产生:

  • 接触;
  • 电弧;
  • 局部放电;
  • 非线性急剧增加。

所以实际允许的最大位移:$ X_{max}\ll d $

这意味着:

静电单元的最大线性位移从结构上就是有限的。

而低频恰恰最需要大位移,这就形成了一个非常直接的矛盾。


为什么不能简单地把定子间距做大?

乍看之下,解决方法非常简单:把定子离振膜远一点。

$$ d\uparrow \Rightarrow X_{max}\uparrow $$

似乎就可以解决低频问题。

但问题在于静电压力:

$$ p= \frac{1}{2}\varepsilon \left( \frac{V}{d} \right)^2 $$

当:

$$ d\uparrow $$

如果电压 $V$ 不变:

$$ p\downarrow $$

而且是:

$$ p\propto\frac{1}{d^2} $$

也就是说:

为了获得更大的振膜位移而增大间距,会同时显著降低静电驱动力。

如果想维持原来的电场强度:

$$ E=\frac{V}{d} $$

就必须同时提高 $ V $

即:

$$ d\uparrow \Rightarrow V\uparrow $$

而电压越高,又会带来:

  • 绝缘要求提高;
  • 空气击穿风险增加;
  • 电弧风险增加;
  • 驱动器设计更加困难。

所以这里形成了一个无法轻易绕开的三角矛盾:

1
2
3
4
5
6
7
8
9
增大定子间距
    ↓
最大位移 ↑
    ↓
但电场强度 ↓
    ↓
需要更高电压
    ↓
绝缘 / 击穿 / 驱动难度 ↑

因此:

静电单元无法简单通过“加大间距”获得无限大的低频位移。


振膜张力又限制了低频位移

静电振膜通常需要保持一定的机械张力。

原因很简单:

1
2
3
4
5
6
7
没有足够张力:

振膜容易产生不规则形变
        ↓
模态增加
        ↓
稳定性下降

因此振膜通常需要预张紧,但是张力本身又会提高机械恢复力。

简单理解:

$$ F_{restoring}\propto kx $$

其中 $k$ 可以理解为等效机械刚度。

当振膜张力提高:

$$ T\uparrow \Rightarrow k\uparrow $$

于是想让振膜产生较大的低频位移,就需要更大的驱动力。

而静电驱动力受到:

$$ V,\ d,\ A $$

等参数限制。

因此静电振膜必须在:

$$ \boxed{ 低质量 \leftrightarrow 高张力 \leftrightarrow 大位移 } $$

之间进行折中。


低频还受到空气负载限制

振膜并不是在真空中运动,它需要推动空气。

因此低频输出还受到:

  • 前腔;
  • 后腔;
  • 耳垫;
  • 耳道;
  • 泄漏;

等因素影响。


为什么低频失真会迅速上升?

当静电单元试图提高低频声压时,通常需要:

$$ X\uparrow $$

也就是提高振膜位移。

但随着:$ x\rightarrow d $

振膜与定子之间的电场分布会越来越明显地偏离理想的小位移条件。

于是:$ F(x) $ 不再是简单的线性关系。

最终表现为:$ THD\uparrow $

因此:

1
2
3
4
5
6
7
8
9
低频声压 ↑
     ↓
振膜位移 ↑
     ↓
接近定子
     ↓
电场非线性 ↑
     ↓
失真 ↑

所以静电单元的低频问题不仅仅是“声音不够大”。更准确地说是:

当它被要求在低频产生很大的声压时,需要让极薄振膜进行较大的位移,而这正是它最不擅长的工作状态。


为什么加大振膜面积可以改善低频?

如果增加有效振膜面积:$ S\uparrow $

那么在相同振膜速度下:$ U=Sv $

因此:

$$ S\uparrow \Rightarrow U\uparrow $$

可以在较小位移下产生更大的体积速度。这确实是静电耳机改善低频能力的重要办法之一。也就是说:

静电真正适合的低频解决方案不是无限增加位移,而是增加有效振膜面积。


但振膜面积也不能无限增加

因为 $ S\uparrow $ 同时意味着:

  • 振膜尺寸增加;
  • 定子尺寸增加;
  • 电极面积增加;
  • 结构重量增加;
  • 模态数量增加;
  • 机械张力控制更加困难;
  • 声学负载更加复杂。

更大的振膜还会产生新的问题:

1
2
3
4
5
6
7
振膜面积 ↑
   ↓
传播距离 ↑
   ↓
模态数量 ↑
   ↓
高频控制难度 ↑

增加面积只是把“大位移问题”转化为“大面积工程问题”。

它能够改善低频,但无法让静电获得无限大的低频动态能力。


为什么静电低频很难达到顶级水平?

把前面的限制全部叠加起来:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
静电低频
   │
   ├── 定子间距限制
   │
   ├── 最大位移有限
   │
   ├── 振膜张力限制
   │
   ├── 电场强度限制
   │
   ├── 高压 / 击穿限制
   │
   ├── 空气负载
   │
   ├── 耳垫泄漏
   │
   ├── 腔体声学阻抗
   │
   └── 大振幅非线性

因此静电单元在低频区域面临一个非常典型的工程矛盾:

$$ \boxed{ 低频声压\uparrow \Rightarrow 位移\uparrow \Rightarrow 非线性\uparrow } $$

如果想降低位移:$ S\uparrow $

那么又会导致:

$$ 面积\uparrow \Rightarrow 结构复杂度\uparrow $$

如果想增加驱动力:$ V\uparrow $

又会导致:

$$ 绝缘要求\uparrow + 击穿风险\uparrow $$

如果想增加定子间距:$ d\uparrow $

又会导致:

$$ E=\frac{V}{d}\downarrow $$

必须进一步提高电压。

所以这些参数并不是可以独立优化的。


静电的频段优势实际上非常明确

因此,如果把静电单元的优势和弱点按照频率划分,就会得到一个非常清晰的结果:

频段静电单元的主要特点
低频位移受限,大动态困难
中频极低质量 + 均匀驱动,优势明显
高频极低质量 + 小位移,优势最明显

虽然设计优秀、密封良好的静电耳机完全可以拥有:

  • 很好的低频延伸;
  • 很低的低频失真;
  • 很准确的低频响应。

但问题依旧存在:

当要求进入极高声压、大动态、极低失真的低频区域时,静电结构很难像优秀的大动态动圈或其它大位移换能器那样拥有充足的位移余量。


动铁

原理及名称内涵

前面的三种换能器,虽然工作原理不同,但都存在一个共同特点:振膜本身就是主要的受力对象。

而动铁(Balanced Armature,BA)采取了完全不同的思路:

不直接让整个振膜参与电磁转换,而是先让一个极小的衔铁运动,再通过驱动杆推动振膜。

因此可以将其简化为:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
电信号
  ↓
固定线圈
  ↓
磁场变化
  ↓
衔铁摆动
  ↓
Drive Rod
  ↓
振膜
  ↓
空气

这也是动铁与动圈最重要的结构区别。


为什么叫 Balanced Armature?

Balanced Armature 中的 Armature 指的是衔铁

而 Balanced 并不是“频响更加平衡”,而是指衔铁在静态磁路中处于近似磁力平衡的位置。

典型结构可以简化为:

1
2
3
4
5
6
7
8
9
        N
        │
        ↓
   ┌─────────┐
   │ Armature│
   └─────────┘
        ↑
        │
        S

衔铁位于两个磁极之间。

静止状态下:

$$ F_L\approx F_R $$

因此:

$$ F_{net}\approx0 $$

衔铁不会自行向某一侧偏移。

当线圈通入交流信号以后,线圈产生附加磁场:

$$ B_{coil}(t) $$

使左右两侧的磁通发生变化:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
静止:

左磁通 ≈ 右磁通
       ↓
     平衡

通电:

左磁通 ↑
右磁通 ↓
       ↓
  衔铁向左运动

随着电流方向改变:

$$ I(t)\rightarrow-I(t) $$

磁通不平衡的方向也随之反转,于是衔铁不断进行微小摆动。


源于助听器

动铁真正重要的地方,并不是“声音一定比动圈好”,而是:

它在极小体积和极低功耗下,可以获得非常高的电声转换效率。

这项技术最早的重要应用之一就是助听器。

助听器与普通耳机的设计目标非常不同。

普通高保真耳机往往关注:

  • 低失真;
  • 宽频带;
  • 大动态;
  • 低噪声;
  • 频率响应。

而助听器首先面对的是:

极小的体积 + 极低的功耗 + 足够的声压。

因此:

$$ Efficiency \gg 极限低失真 $$

在这样的应用场景中,动铁的优势非常明显。


固定线圈与运动衔铁

动圈的音圈本身就是运动系统的一部分:

1
2
3
4
5
磁路
 ↓
音圈运动
 ↓
振膜

而动铁则是线圈基本固定不动:

1
2
3
4
5
6
7
磁路
 ↓
固定线圈
 ↓
衔铁运动
 ↓
振膜

真正运动的是极小的衔铁。

因此运动系统中不需要携带一个完整的音圈,这也是动铁能够实现极小体积和高效率的重要原因。


为什么衔铁可以产生很大的驱动力?

衔铁位于高磁通密度的小型磁隙区域,线圈只需要产生很小的磁场变化,就可以显著改变衔铁两侧的磁通。

因此,动铁并不是简单地依靠传统音圈形式来推动振膜,而是利用磁路磁阻变化所产生的电磁力矩。

当衔铁发生微小偏转时,左右磁路的磁阻发生变化:

$$ \mathcal{R}_L \neq \mathcal{R}_R $$

磁通会更加倾向于磁阻较低的一侧,于是产生恢复力和驱动力,使衔铁围绕平衡位置运动。

这实际上是一种高磁通密度 + 极小机械位移的电磁转换结构。


为什么动铁的运动幅度这么小?

动铁衔铁的摆动通常非常有限,典型量级是:$ X\sim几十\ \mu m $

这与大尺寸动圈振膜的运动相比非常小。

但它并不需要通过大位移来获得高效率,因为动铁的目标不是让整个振膜大幅度运动。

而是通过极小的机械运动,把能量高效率地传递给一个小型振膜和声学负载。

因此它的工作逻辑与动圈明显不同:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
动圈:

较大机械位移
      ↓
较大空气位移

动铁:

极小衔铁位移
      ↓
驱动小型振膜
      ↓
通过声学负载放大/整形

驱动杆

衔铁本身通常不会直接推动空气。

它通过:**Drive Rod(驱动杆)**连接到振膜:

1
2
3
4
5
6
7
8
9
线圈
 ↓
衔铁
 ↓
Drive Rod
 ↓
振膜
 ↓
空气

因此 Drive Rod 实际上是整个机械系统中的一个关键接口,它需要同时满足:

  • 足够高的刚性;
  • 足够低的质量;
  • 合理的机械阻尼;
  • 精确的连接。

如果驱动杆自身发生明显弯曲:

$$ F\rightarrow Drive\ Rod\ deformation $$

而不是:

$$ F\rightarrow Diaphragm $$

那么输入信号就会被机械结构重新过滤。

因此最终频率响应和失真并不只由磁路决定,还取决于:

$$ 磁路+衔铁+Drive\ Rod+振膜 $$

组成的完整机械系统。


为什么动铁效率极高?

动铁最重要的优势可以从运动质量理解。

动铁的主要电磁运动部分只是:

$$ M_{armature} \ll M_{voice\ coil} $$

同时衔铁又处于高磁通密度区域。

因此:

$$ \frac{F}{M} $$

可以做到非常高。

这使动铁具有:

  • 极高灵敏度;
  • 极低功耗;
  • 极小体积。

这也是它非常适合便携设备和助听器的原因。


缺陷

动铁最大的优势:

$$ \boxed{极小体积 + 极高效率} $$

恰好也是它最大的限制来源,因为为了获得极高效率,动铁牺牲了振膜面积和最大位移。

所以动铁并不是一个“缩小版的动圈”,它实际上是完全不同的工程取舍。


最大问题:空气位移有限

低频重放最终需要的是足够的空气位移。

动铁的典型问题是:

$$ S\downarrow $$

同时:

$$ X_{max}\downarrow $$

因此最大空气位移:

$$ V_{air}\propto SX_{max} $$

也会受到限制。

这就是为什么单动铁系统通常很难自然地获得:

  • 很深的低频;
  • 很高的低频声压;
  • 很大的低频动态。

需要注意,这并不意味着动铁“不能做低频”。

而是在相同体积条件下,它能够推动的空气体积通常远小于大尺寸动圈。


动铁为什么经常需要声学导管?

动铁的振膜面积很小,因此它通常不会像头戴式动圈那样直接向耳朵大面积辐射声音,而是通过一个小型声学出口连接:Sound Tube(声管)。

1
2
3
4
5
6
7
8
9
BA振膜
   ↓
声学出口
   ↓
Sound Tube
   ↓
阻尼器
   ↓
耳道

这意味着动铁的声音很大程度上是“单元 + 导管”共同产生的。

导管本身具有:

  • 声学质量;
  • 声学阻尼;
  • 声学顺性;

因此可以构成前面介绍过的声学网络。

例如:

$$ Z_a = R_a + jX_a $$

导管中的空气质量可以表现为:

$$ M_a $$

而腔体则可以表现为:

$$ C_a $$

再加入阻尼:

$$ R_a $$

就形成类似:

$$ RLC $$

的声学滤波网络。

因此一个 BA 单元最终的频率响应并不是 $ Driver\ Response $ 这么简单,而更接近 $ Driver+Tube+Damping+Cavity $ 共同决定。

这也是为什么不同品牌即使使用相似的 BA 单元,最终声音仍然可以完全不同。


为什么动铁失真通常更值得注意?

动铁的机械结构非常小,而且:

  • 衔铁运动幅度有限;
  • 磁路间隙非常小;
  • 驱动杆与振膜存在机械连接;
  • 声学出口又非常狭窄。

因此它的非线性可能来自多个环节:

1
2
3
4
5
6
7
8
9
电磁系统
   ↓
衔铁
   ↓
机械连接
   ↓
振膜
   ↓
声学导管

尤其当振膜和衔铁逐渐接近机械极限时,$ F(x) $ 可能明显偏离理想线性关系。

因此动铁虽然 $ Efficiency\uparrow $ ,但并不意味着:$ THD\downarrow $

这也是为什么不能简单使用:“运动质量低 = 失真低”这样的逻辑。


为什么现代 IEM 很少只用一个动铁?

如果单个 BA $ S\downarrow $ ,那么最直接的解决方式就是:$ N_{BA}\uparrow $ ,也就是增加多个动铁单元。

例如:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
低频 BA
   │
   ├────→ 低频
   │
中频 BA
   │
   ├────→ 中频
   │
高频 BA
   │
   └────→ 高频

再利用:

  • 电子分频;
  • 声学分频;
  • 导管;
  • 阻尼器;

将不同单元限制在各自擅长的频段。

因此多 BA 并不是简单地“堆单元”,而是把一个大问题拆成多个小问题。

例如:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
低频:
需要空气位移
↓
使用较大振膜/动圈

中频:
需要效率与体积
↓
使用BA

高频:
需要低质量与快速响应
↓
使用BA / 静电 / MEMS

这就是现代混合 IEM(Hybrid)产生的基本逻辑。


换能器对比

到这里可以重新理解四种主要换能器。

它们并不是简单的:$ A>B>C>D $ ,而是在不同物理量上分别占据优势。

指标动圈 Dynamic平板 Planar静电 Electrostatic动铁 BA
驱动力洛伦兹力洛伦兹力静电力电磁力
驱动方式局部面分布近似连续面驱动局部衔铁驱动
运动质量中等较低极低极低
振膜面积较大较大较大很小
最大空气位移高高中等较低
灵敏度中等~高较低~中等中等很高
高频潜力良好优秀极优秀优秀
低频潜力优秀优秀良好但大动态受限一般
驱动要求普通耳放电流要求较高专用高压很低
体积中等~大中等~大大极小
多单元组合较少见较少见较少见非常适合
制造复杂度较低较高很高中等

这张表真正想表达的不是“排名”,而是每一种换能器都在优化不同的物理量。

关键物理量总结

物理量 / 指标物理意义主要决定因素对耳机性能的主要影响
运动质量 $M$振膜及附属运动部件的等效质量振膜、音圈、驱动结构$M$ 越低,惯性越小,高频与瞬态响应潜力越高
驱动力 $F$驱动系统施加在振膜上的机械力磁场/电场强度、音圈、驱动结构决定振膜能够获得多大的加速度与位移
驱动力均匀性驱动力在振膜表面的空间分布是否均匀磁路、电极、导体布局越均匀越容易维持活塞运动,降低 Break-up 与局部模态
振膜面积 $S$有效推动空气的面积振膜尺寸、结构形状面积越大,单位位移能够产生的空气位移越大
最大位移 $X_{max}$振膜能够保持正常工作的最大位移悬挂、磁路、结构间隙、驱动方式决定低频大动态下的空气位移能力
空气位移 $U$振膜推动的空气体积变化量$S$、振膜速度 $v$低频声压能力的核心物理量之一,近似满足 $U=Sv$
频率响应不同频率最终产生的声压换能器、腔体、阻尼、耳垫/耳塞、耳道直接决定最终频谱,是最重要的耳机测量指标之一
阻抗 $Z$耳机对输入电信号表现出的电气负载音圈电阻、电感、机械谐振、反电动势决定不同频率下的电压/电流需求以及耳放与耳机的耦合
灵敏度给定电压或功率下能够产生的声压换能效率、阻抗、驱动结构决定耳机是否容易达到目标声压,但不直接代表失真或音质
谐振频率 $f_0$机械/声学系统最容易储存和交换能量的频率振膜质量、悬挂刚度、声学负载影响低频响应、阻抗峰以及系统的时间响应
Q 值谐振系统的阻尼程度质量、刚度、机械/声学阻尼$Q$ 越高,谐振越尖锐,能量储存和振铃通常越明显
THD非基波成分相对于基波的比例磁路、电机、悬挂、振膜、声学负载衡量系统非线性失真,尤其需要结合不同声压与频率观察
时间响应 / IR / CSD系统对瞬态信号以及残余能量的响应振膜模态、阻尼、腔体、声学结构反映振铃、衰减和能量储存特性
声学阻抗空气负载对振膜运动形成的阻碍前腔、后腔、导管、Vent、耳道改变振膜实际运动状态,并直接参与最终频率响应的形成
声学容积 / 腔体共振腔体中空气的弹性与质量效应腔体体积、开孔、导管形成或改变低频与中高频的共振、衰减和峰谷
佩戴耦合耳机与耳廓、耳道之间的实际声学耦合耳垫、耳塞套、佩戴位置、耳道几何使同一副耳机在不同人耳上产生不同的实际频率响应
驱动效率输入电能转化为机械/声学输出的效率电机结构、阻抗、振膜、声学负载决定功耗与最大输出能力,但不是独立的音质指标

核心结论

从物理本质上看,耳机是一套完整的电—机械—声学耦合系统:电信号经过磁场或电场转换为振膜运动,再通过振膜推动空气,最终经过腔体、导管、阻尼、耳垫或耳塞套以及耳道形成到达鼓膜的声压。因此,耳机的最终声音并不是换能器单独决定的,而是整个系统共同作用的结果。

对于换能器而言,核心问题始终围绕运动质量、驱动力、振膜面积、最大位移和驱动力均匀性展开。降低运动质量有利于高频和瞬态响应,而较大的振膜面积与位移则有利于低频空气位移;但这些目标之间存在天然的工程折中。因此,动圈、平板、静电和动铁并不存在绝对的优劣,它们只是针对不同物理约束所形成的不同解决方案。

最终评价耳机时,与其关注“采用什么单元”,不如观察它实际实现了什么:频率响应决定最终频谱,阻抗和灵敏度决定驱动需求,THD反映非线性失真,时间响应反映系统的能量储存与衰减,而声学负载和佩戴耦合则进一步决定最终到达鼓膜的声音。

耳机设计本质上不是追求某一个参数的极致,而是在运动质量、驱动力、位移、线性度、声学负载和人体耦合之间进行整体优化。换能器的技术类型只是实现这一目标的手段,最终仍应回到实际测量结果,而不是技术标签本身。

参考资料:

1.Floyd E. Toole, Sound Reproduction: The Acoustics and Psychoacoustics of Loudspeakers and Rooms, 3rd Edition, Focal Press, 2017

2.Sean Olive, Todd Welti 等, Harman 耳机目标曲线系列论文(AES, 2013–2018)

3.IEC 60318-4 / ITU-T P.57 系列(耳模拟器与耦合器标准)

4.John Borwick (ed.), Loudspeaker and Headphone Handbook, 3rd Edition, Focal Press, 2001

耳放

耳放并不是"把声音变大"的黑盒子,而是 DAC 输出与耳机之间的桥梁。

为什么 DAC 不能直推

DAC 的线路输出面向的是几千欧甚至几万欧的高阻抗线路输入,完全不为耳机(16–600 Ω)设计,直接驱动低阻负载会面临:

  • 输出阻抗失配与阻尼恶化:DAC 线路输出阻抗通常在 100 Ω 左右,导致阻尼系数仅 0.16–6。

  • 非线性加载与电流削波:低阻抗负载会拉低输出级工作点,使运放/缓冲器偏离线性区。DAC 线路输出设计输出电流通常仅数 mA,过载时输出级进入限流区,产生削波失真,大动态瞬态被压缩。

  • 热保护与稳定性风险:许多解码器输出级未针对低阻负载设计热保护,长时间驱动耳机会导致芯片过热、保护电路触发;同时耳机音圈呈感性,与线路输出级的容性补偿网络相互作用,可能引发振荡或自激,存在损坏设备的风险。

因此,耳放存在的根本原因不是 DAC “没有放大功能”,而是 DAC 的线路输出级通常围绕低失真电压源设计,而耳机需要的是一个能够直接处理低阻负载的功率输出级。

线路输出的核心任务是提供准确的电压;耳机输出的核心任务则是把这个电压可靠地转换成负载需要的电压和电流。


耳放的任务

“推响”其实可以还原成一个非常具体的问题:耳放能否在不削波、不达到电流极限的情况下,把耳机驱动到目标声压。

“推好”则还多了一层含义:在达到目标声压以后,耳放是否仍然保持足够低的 THD、IMD、噪声、串扰和输出阻抗,并且在复杂负载和瞬态条件下稳定工作。

因此可以把它们概括为:

1
2
3
4
5
6
7
推响
 ↓
达到所需电压 / 电流 / 功率

推好
 ↓
在这些输出条件下仍保持足够好的线性、噪声和稳定性

线性

一个理想的线性耳放可以写成:

$$ V_{out}(t)=G\cdot V_{in}(t) $$

它不应该凭空改变输入信号,只应该按照一个稳定比例复制它,并根据负载提供必要的电流。

实际耳放则必须同时面对:

  • 最大输出电压;
  • 最大输出电流;
  • 输出阻抗;
  • 噪声;
  • 频率响应;
  • 线性度;
  • 稳定性。

失真

耳放的“声音变化”首先应当在电路层面寻找对应的物理量。常见问题包括:

现象物理本质典型表现
THD非线性产生谐波谐波分量增加
IMD多频信号互相调制产生原信号不存在的频率
Clipping输出摆幅超过线性范围波形削顶、大量高次谐波
噪声电路自身产生随机/周期扰动底噪、嗡声
输出阻抗效应负载与输出阻抗形成分压频响变化
串扰左右声道耦合声道分离下降
振荡/振铃反馈环路稳定性不足高频异常、过冲
压摆率限制输出变化速度超过内部能力大信号瞬态失真

因此“耳放声音好不好”首先应该转化成:在实际负载和实际电平下,它是否保持了足够好的线性与稳定性。


削波

输入灵敏度

输入灵敏度定义为:使耳放达到最大不失真输出所需的最小输入电压。

输入灵敏度实际上把三个量联系起来:

$$ V_{out,max}=G_vV_{in,max} $$

假设耳放最大线性输出为 6 Vrms,输入为 1 Vrms,增益为 20 dB(即 10 倍),那么理论输出为 10 Vrms,但电路只能线性输出 6 Vrms,因此实际输出会进入削波,即放大器已经失去继续线性摆幅的能力。


从数字电平到耳机声压

一套合理的耳放需求计算应该考虑到音乐动态、耳机负载、目标听音电平三个变量:

1
2
3
4
5
6
7
8
9
数字峰值
 ↓
DAC 满幅输出
 ↓
耳放增益 / 衰减
 ↓
耳机实际电压
 ↓
目标 SPL

耳机需求最终落在模拟电压和电流上,但输入给 DAC 的首先是数字音频。音乐并不一定长期处于 0 dBFS,而且不同唱片的平均响度、峰值结构、动态范围可能完全不同。

Roon Volume Leveling

Roon 的 Volume Leveling 功能依据 EBU R128 标准对音频响度进行分析,并将不同曲目之间的播放电平统一校准至 -23 LUFS。以下是相关核心概念:

  • Track Gain(曲目增益):以单曲为单位计算的响度修正值,用于平衡不同曲目之间的音量差异;
  • Album Gain(专辑增益):基于整张专辑的整体响度关系计算的修正值,保留专辑内部的动态对比;
  • LUFS(Loudness Units Full Scale):一种采用 K-weighting 滤波器并经过时间积分处理的响度计量单位;
  • True Peak(真实峰值):通过插值算法重建后估算的实际信号峰值,单位为 dBTP(decibels True Peak),用于防止模拟转换后的削波失真;
  • Dynamic Range(动态范围):用于量化音乐动态变化程度的信息指标,反映最响与最轻段落之间的差异。

LU 和 dB 在响度差值上等价:

$$ 1 LU=1 dB $$

但 LUFS 并不是简单的 RMS dBFS,因为它包含频率计权和时间积分。

LUFS≠平均 dBFS

例如两首音乐都可能有接近 -14 LUFS 的 Integrated Loudness,但它们的采样峰值完全不同。

因为:

$$ LUFS\neq dBFS_{peak} $$

甚至也不能简单写成:

$$ -14LUFS=-14dBFS $$

LUFS 是“人听起来有多响”的统计量,而 dBFS peak 则是数字波形的电平量。

超过 0 dBTP

普通 peak 只观察采样点,True Peak 则试图估计采样点之间的重建波形峰值。

因此即使所有采样点都没有超过 0 dBFS,经过 DAC 的重建滤波后,连续模拟波形仍可能出现:

$$ Peak_{true}>0dBFS $$

也就是所谓的 inter-sample peak。

因此超过 0 dBTP 并不是说“文件里存在大于满幅的二进制数字”,而是说采样点之间的重建波形可能超过数字满幅参考。

当信号超出芯片的满量程上限,超出部分会被硬切,削波失真已在转换瞬间产生。

因此必须在 DAC 之前的数字域进行衰减,把波形峰值压回安全范围,DAC 才能正确还原原始信号。后级模拟衰减位于 DAC 之后,此时削波失真已经生成,它只能把已经失真的声音整体调小,如同把拍糊的照片缩小——失真不会消失,只是变轻了,无法挽回。

估算峰值余量

可以用一个非常直观的量表示平均响度与峰值之间的距离:

$$ PLR=dBTP-LUFS_{integrated} $$

例如:

音乐类型典型 Integrated LUFS典型 dBTP粗略峰值余量
大动态古典-22-220 dB
爵士现场-18-315 dB
流行/摇滚-12-210 dB
强压缩电子-9-18 dB

这些只是帮助理解系统余量的经验范围,具体录音差异很大。

DAC 真实输出

假设 DAC 在 0 dBFS 时最大输出为 2 Vrms,而当前数字峰值为 -6 dBTP,则对应电压大约为:

$$ V_{DAC}=2\times10^{-6/20}\approx1.00V_{RMS} $$

因此数字域的峰值余量最终会变成模拟域的电压余量。


耳机负载

耳机一章中已经提过,灵敏度和阻抗与频率有关,但为了让耳放需求计算器能够直接使用厂商参数,我们暂时采用厂商标称的阻抗和灵敏度。

这只是估算模型,不代表全频段真实需求。


安全音量

世界卫生组织的安全聆听建议强调,长期暴露在较高声压下会增加听力损伤风险。

https://www.who.int/zh/news-room/questions-and-answers/item/deafness-and-hearing-loss-safe-listening

声音强度(分贝)每周(7天)安全听力时间特定强度声音类型示例
10无限正常呼吸
30无限轻声耳语
40无限图书馆
60无限正常对话
8040小时门铃
8512小时30分钟繁忙交通(车内)
904小时大声对话
951小时15分钟摩托车
10020分钟电吹风
1058分钟5米处的汽车喇叭声
1102.5分钟在耳边大叫
12012秒站在警笛附近
130<1秒手提钻
1400秒飞机起飞
1500秒鞭炮

对于系统工程计算,可以把 90 dB SPL 左右视为一个不宜长期依赖的高工作点;对 HiFi 日常聆听而言,70–80 dB SPL 通常更适合作为长期目标,而不是把 90 dB 当作日常默认音量。

人耳等响曲线

人耳对不同频率的敏感度并不相同。Fletcher-Munson 等响曲线(后经 ISO 226 修订)描述了这一现象:

  • 在较低声压下(如 40-50 dB SPL),人耳对 1-5 kHz 中频最为敏感,对低频(< 200 Hz)和高频(> 10 kHz)的灵敏度显著下降。这意味着在低音量听音时,音乐的低频和高频成分会感觉"缺失",整体听感偏薄、偏暗。
  • 随着声压升高(> 80 dB SPL),频率灵敏度差异逐渐减小,各频段的感知响度趋于平坦。
  • 在极高声压下(> 100 dB SPL),等响曲线几乎平坦,但此时已接近痛阈。

等响效应对耳放系统的实际意义在于:

  • 低音量听音时,如果系统没有足够的动态余量来支持适当提高整体声压,低频和高频的感知会明显不足;
  • 响度补偿(Loudness Compensation) 的原理就是根据听音声压自动提升低频和高频,但其前提是系统知道当前的听音声压–这在耳机系统中通常难以精确获知;
  • 不同用户偏好的听音声压不同,因此同一套系统在不同人耳中可能呈现完全不同的频谱平衡。

“声音变大了"并不等于"所有频率听起来同比变大。”

这属于人耳的生理特性,而不是耳放"推力变大以后改变了声音"。

在后面的计算中,推荐把听音声压暂时分成三个仅用于系统设计的示例档位:

档位目标平均 SPL用途
初烧75 dB SPL长时间、较舒适的常规听音
中烧85 dB SPL较充分的动态与细节试听
老烧90 dB SPL较高声压的短时间试听

这三个数字不是"应该听多响"的建议,而是为了计算耳放余量而设置的示例工作点。实际听音还应考虑节目动态、持续时间、耳机佩戴方式以及个人听力。

计算模型中不考虑个人听力衰减,如听损严重可以将目标 SPL 作相应提高;但依旧建议不超过 90 dB SPL ,否则更应该考虑的是何时烧助听器。


耳放需求计算器

耳放输出需求计算器

根据听音电平、音乐动态和耳机参数,估算耳放所需的电压、电流、功率与增益。

音乐动态

直接输入用于耳放峰值需求估算的动态余量。它不是严格定义的 Crest Factor。

听音电平

所需峰值 SPL = 目标平均 SPL + 动态余量

耳机

系统增益

“总音量衰减”包含数字音量衰减和模拟音量衰减

计算结果

动态余量 — dB
所需峰值 SPL — dB SPL
耳机所需电压 — Vrms
耳机所需电流 — mArms
耳机所需功率 — mW
考虑输出阻抗后的耳放电压 — Vrms
理论所需耳放增益 — dB

这是理想电阻模型下的估算。真实耳机阻抗随频率变化,音乐峰值也具有时间尺度,因此实际耳放选型还应检查最大电压、电流、功率以及保护/失真余量。

从计算器看推力

通过计算,可以得到一些结论。

需求各异

不同的音乐动态、耳机负载、目标听音电平,可能导致天差地别的结果,因此不能简单参考他人对耳放产品的评价。

并非难推

在合理的长期平均 SPL 与有限峰值余量下,即使是被烧友认为难驱动的耳机,实际所需功率也至多落在几百 mW 数量级,因此无需过度关注厂商宣传的功率数值。

真正需要注意的仅有极少数低阻低敏耳机的电流需求,峰值可能超过 50 mA ;对于其他大部分耳机,电压和电流都不是瓶颈。

增益为负

如果在计算器中把音量衰减设置为 0 dB,你会发现绝大多数情况,达到目标声压所需要的耳放增益是负数,这非常重要。它意味着在当前 DAC 输出、耳机灵敏度和目标 SPL 下:

$$ V_{HP} < V_{DAC} $$

也就是说系统根本不需要进一步提高电压,反而需要降低电压,同时提供耳机所需的电流。

在系统层面,耳放真正需要完成的是衰减 + 缓冲 + 电流驱动,而不是传统意义上的放大电压。

音量控制

音量衰减的位置

音量衰减究竟位于信号链的什么位置,会直接决定整个系统的噪声、增益结构和调节范围。

最常见的模拟结构之一是:

1
2
3
4
5
6
7
8
9
DAC
 ↓
音量控制
 ↓
电压增益
 ↓
输出级
 ↓
耳机

这种方式的优点是:衰减器位于主要增益级之前,可以降低后级输入信号,同时减少后级对高增益输入的压力。

另一种方式则是:

1
2
3
4
5
6
7
8
9
DAC
 ↓
电压增益
 ↓
音量控制
 ↓
输出级
 ↓
耳机

此时前面的增益级已经把信号放大,再通过衰减器降低输出。如果增益级自身噪声较高,这种结构可能会浪费更多动态范围。

现代系统还可以直接在数字域控制音量:

1
2
3
4
5
6
7
DSP / 数字音量
 ↓
DAC
 ↓
固定模拟增益
 ↓
耳机

这时数字域的衰减与模拟增益必须一起考虑,而不能只看“数字音量减了多少 dB”。

电阻分压器

最简单的衰减网络是:

1
2
3
4
5
VIN ── R1 ──┬── VOUT
            │
            R2
            │
           GND

输出为:

$$ V_{out}=V_{in}\frac{R_2}{R_1+R_2} $$

衰减量为:

$$ A_{dB}=20\log_{10}\frac{R_2}{R_1+R_2} $$

这种结构非常简单,而且本身完全可以做到极低失真。但它有一个容易忽略的特性:音量控制器同时也是一个阻抗网络。

后级看到的源阻抗会受到 $R_1$、$R_2$ 以及音量位置影响;如果后级输入阻抗很低,或者线缆电容很大,就可能形成额外的 RC 极点。

电位器

电位器本质上仍然是一个连续可调的电阻分压器。

1
2
3
4
5
6
7
VIN ───────┐
           │
        电阻轨
           │← 滑动端
           ├──── VOUT
           │
          GND

优点很明确:

  • 连续可调;
  • 操作直观;
  • 成本低;
  • 结构简单。

但它也具有机械元件无法完全避免的问题:

  • 左右声道电阻误差;
  • 滑动触点接触噪声;
  • 磨损;
  • 阻值随位置变化;
  • 极低音量时的通道平衡问题。

其中最值得关注的是低端通道跟踪误差。

当电位器已经接近静音端时,只需要很小的电阻比例误差,就可能造成明显的左右声道差异。

例如左声道实际衰减为 -50 dB,右声道为 -53 dB,那么虽然绝对差值只有 3 dB,但此时声像已经明显偏向一侧。

继电器电阻阵列

继电器电阻阵列通过切换精密电阻实现离散衰减:

1
2
3
4
5
0 dB
-1 dB
-2 dB
-3 dB
...

或者使用二进制权重:

1
2
3
4
5
1 dB
2 dB
4 dB
8 dB
16 dB

通过组合可以得到很多精确档位。它的优势是:

  • 电阻匹配高(使用 0.1% 精密电阻,声道间匹配可达 ±0.05 dB);
  • 左右声道一致性好(同一信号路径使用相同阻值的电阻对);
  • 接触电阻稳定(继电器触点电阻通常 < 50 mΩ,远低于电位器的接触噪声),不存在滑动触点磨损造成的长期漂移;
  • 可以实现精确的步进;
  • 长期稳定性优于碳膜电位器。

因此继电器电阻阵列是目前理论最佳衰减方案,但代价则是:

  • 成本高(每个档位需要一组继电器 + 精密电阻);
  • 体积大;
  • 有继电器动作声音(“咔嗒"声);
  • 控制复杂(需要 MCU 驱动继电器矩阵)。

数字音量

数字音量本质上是对采样值乘以一个系数:

$$ x[n]\rightarrow ax[n] $$

例如:

$$ A=-20dB $$

对应:

$$ a=10^{-20/20}=0.1 $$

即振幅变为原来的 10%。

数字衰减并不是简单的“把 bit 切掉”。如果内部使用 32-bit 或 64-bit 浮点进行运算,那么 -30 dB、-40 dB 甚至更大的数字衰减都可以保持极低的量化误差(64-bit float 下量化误差在 −250dB 量级,本质上无失真)和完美的声道平衡。它真正的代价不在失真,而在信噪比:信号每衰减多少 dB,就相对 DAC 固定的模拟噪声底下沉多少 dB。继电器电阻阵列的优势恰在于模拟域衰减能同步压低前级噪声,在低音量下保住系统的有效动态范围。

真正需要关注的是:

  • 工作位深(32-bit float 远优于 16-bit 整数);
  • dither(在低位深输出时添加抖动以消除量化失真);
  • DAC 有效动态范围(DAC 本身的 SNR 通常在 110-130 dB);
  • 后续模拟增益(数字衰减后是否需要更多模拟增益来补偿);
  • 最终信噪比(数字衰减 + 模拟增益后的系统 SNR 是否足够)。

因此不能简单制定一个“数字音量低于 -30 dB 就一定损失音质”的绝对规则。

三种音量控制方案的本质区别

方案本质优点主要问题
电阻分压被动衰减简单、低失真阻抗随参数变化
电位器连续可变分压成本低、操作直观跟踪、磨损、低端平衡
继电器阵列精密离散衰减精度高、一致性好成本、体积、步进
数字音量数字乘法灵活、无机械误差需关注工作位深与模拟噪声

所以真正应该问的问题不是“模拟好还是数字好”,而是:

音量控制的衰减发生在哪里、采用什么实现、工作时的电平和噪声关系是什么。

增益过高

既然真正需要的是衰减,现代耳放是不是存在增益过高的问题?答案在很多系统中确实是:存在。

但这不是说所有高增益耳放都设计错误,而是因为现代数字音源的输出电平与几十年前已经完全不同。

历史原因

早期模拟音源的线路电平可能明显低于今天常见的 2 Vrms / 4 Vrms,同时部分耳机灵敏度也低得多,于是系统需要:

1
2
3
4
5
较小的源电平
 ↓
较高模拟增益
 ↓
耳机

在这种历史条件下,高增益是合理的。

但今天:

1
2
3
4
5
6
7
8
数字满幅
 ↓
DAC
 ↓
RCA ≈ 2 Vrms
XLR ≈ 4 Vrms
 ↓
耳放

已经可以轻易提供大量耳机所需要的电压,因此过去“必须大幅增益”的前提已经显著减弱。

碳膜电位器

碳膜电位器由于便宜、成熟、容易制造、连续调节直观,曾长期成为消费电子和 HiFi 设备的常见选择。但问题在于,碳膜电位器的物理特性决定了它只能在中间位置(约10~2点位置)工作得像个音量控制。

这导致 HiFi 耳放设计形成了一种围绕它的操作习惯:希望正常听音时旋钮位于中间 12 点方向附近。

如果假设 12 点附近约对应 -20 dB,那么为了让正常听音刚好落在这里,设计师就可能反过来提高前级增益:

1
2
3
4
5
6
7
希望旋钮在 12 点
 ↓
要求正常听音约 -20 dB
 ↓
增加模拟增益
 ↓
提高最大输出功率

这种设计逻辑本身并不违反电路原理,但它会产生历史性的副作用:用电位器的机械工作区域反过来决定系统增益。

在现代设备中,这套逻辑已经越来越不合理,原因正如前文计算结论,实际听音场景的需求各异,未必所有情况都能使电位器工作在这一区间。

推力战争

更主要的原因来自市场。

假设耳放最大摆幅为 4 Vrms,在 32 Ω 下:

$$ P=\frac{4^2}{32}=0.5W $$

如果通过提高增益和电源电压,让最大摆幅变成 8 Vrms,那么规格表会变成:

$$ P=\frac{8^2}{32}=2W $$

功率直接增加四倍。HiFi 厂商以此作为宣传和比较的指标,甚至开始“科普”用 120 dB SPL 计算耳放功率,于是很容易形成一种“推力战争”:

1
2
3
4
5
6
7
更高输出电压
 ↓
更高最大功率
 ↓
参数表更漂亮
 ↓
宣传“更强驱动力”

这与响度战争的逻辑非常相似:更大的数值更容易吸引注意力,但不一定对应真实使用需求。

最大输出

增益和最大输出必须分开理解。一个非常重要的概念是:

$$ V_{max}\neq G $$

增益 $G$ 只描述输入和输出的比例;最大输出 $V_{max}$ 更多由:

  • 电源电压;
  • 输出级拓扑;
  • 器件摆幅能力;
  • 输出电流能力;
  • 热设计;
  • 保护限制;

共同决定。

因此:把增益做大,不等于把输出级做强。

过高增益的问题

1.信噪比可能劣化

假设输入级产生等效噪声:$ V_n $

经过增益 $G$ 后:

$$ V_{n,out}=GV_n $$

如果输出端再通过音量控制衰减 $A$,那么最终噪声取决于它位于音量控制器之前还是之后。

因此不能简单写成“衰减越大,声音越差。”

正确的分析必须画出噪声的来源位置。

1
2
3
4
5
6
7
8
9
输入噪声
 ↓
增益
 ↓
音量衰减

输出级噪声
 ↓
不会被前面的衰减降低

这就是为什么同样 -40 dB 的音量设置,在不同耳放中可能得到完全不同的底噪表现。

2.动态范围的实际利用率降低

假设耳放最大线性输出:

$$ V_{max}=6V_{RMS} $$

输出噪声为 10 μV,则理论动态范围:

$$ DR=20\log_{10}\frac{6}{10\times10^{-6}} \approx115.6dB $$

但如果正常听音只使用 0.1 Vrms,那么从当前实际信号电平向噪声底看:

$$ DR_{use}=20\log_{10}\frac{0.1}{10\times10^{-6}} =80dB $$

耳放并没有真的变差 35.6 dB,但系统并没有充分利用原本的输出动态范围。

这就是为什么“最大 SNR”与“实际听音 SNR”是两个不同概念。

3.电位器调节范围受限

如果正常听音长期需要:$ -50dB $ ,那么整个电位器大部分行程实际上都被浪费了。

而在普通电位器的最下端,通道跟踪误差往往更明显,所以问题会进一步放大。

4.可能影响后级工作条件

某些音量控制网络并不是简单的“理想乘法器”,其源阻抗会随位置变化。

如果后级存在:

  • 输入偏置电流;
  • 高输入电容;
  • 复杂反馈网络;
  • 低阻输入;

那么极端衰减位置可能改变实际工作条件。因此:

过高增益的问题不是“衰减数字太大”本身,而是高增益迫使整个系统长期处于不理想的电平与阻抗工作区域。

增益切换

现代耳放常见两种完全不同的增益切换方案。

Pre-Gain

Pre-Gain 本质是输入端的额外衰减:

1
2
3
4
5
6
7
DAC
 ↓
Pre-Gain
 ↓
固定模拟增益
 ↓
输出

例如:

Pre-Gain输入线性比例
0 dB1
-10 dB0.316
-20 dB0.1
-30 dB0.0316

这种设计对传统电位器特别有意义:通过先降低输入电平,让电位器不必长期工作在最低端。

反馈改变闭环增益

另一种方案直接改变反馈网络,例如改变 $R_f$ 或 $R_g$:

$$ G=1+\frac{R_f}{R_g} $$

这种方案是真正改变放大器本身的闭环增益,因此还会伴随:

  • 闭环带宽变化;
  • 环路增益变化;
  • 噪声增益变化;
  • 稳定性条件变化。

于是“换一个 Gain 档位”并不只是换一个数字,它可能实际改变了整个放大器的工作状态。


负反馈与增益

前面的内容已经说明,耳放的增益并不是一个孤立的“放大倍数”。改变增益档位,往往意味着改变放大器内部的反馈网络,从而改变闭环增益以及整个反馈环路的工作状态。要理解为什么现代耳放普遍使用负反馈,以及为什么“低反馈”“无反馈”并不能直接等同于更好的声音,就必须先从三个最基本的量开始:

开环增益、闭环增益,以及环路增益。

这三个概念构成了理解现代放大器的基础。

开环增益

一个真实放大器即使完全不接反馈,也具有一定的放大能力。假设一个放大器有两个输入:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
        V+
         │
         ▼
      差分输入
         │
         ▼
       放大器
         │
         ▼
        Vout
         ▲
         │
        V-

真正被内部放大器放大的,并不是完整的输入信号,而是两个输入之间的误差信号:

$$ V_{err}=V_+-V_- $$

于是可以定义开环增益:

$$ A=\frac{V_{out}}{V_{err}} $$

其中:

  • $A$ 为开环增益(Open-loop Gain);
  • $V_{err}$ 为差分输入误差;
  • $V_{out}$ 为输出电压。

例如,一个放大器在某个频率下具有:

$$ A=100000 $$

那么只需要:

$$ V_{err}=10\mu V $$

理论上就可以产生:

$$ V_{out}=1V $$

这也说明了一个非常重要的事实:

高增益并不意味着输入信号本身很大,而意味着放大器对输入与反馈之间极小的误差非常敏感。

现代运放或者高性能耳放的开环增益通常非常高,但这种增益并不是稳定不变的常数。

晶体管的跨导、结温、偏置电流、负载、电源电压以及频率都会影响开环增益:

$$ A=A(f,T,I,V_{rail},Z_{load},...) $$

例如同一只晶体管在 25°C 和 80°C 时,其工作点并不会完全一致;随着频率升高,晶体管内部电容和放大级之间的时间延迟也会使增益逐渐下降。

因此,如果直接依靠开环增益设定最终放大倍数:

1
2
3
4
5
6
7
输入
 ↓
晶体管本身的参数
 ↓
开环放大
 ↓
输出

那么最终增益就会非常依赖器件本身。

这会导致:

  • 温度变化引起增益变化;
  • 器件个体差异引起增益变化;
  • 老化导致工作点变化;
  • 负载变化影响增益;
  • 频率升高后增益下降;
  • 器件非线性直接进入输出。

工程师真正希望得到的却是一个稳定、可预测的系统,于是就有了反馈。


闭环增益

加入负反馈以后,输出的一部分会被送回输入端,与原始输入信号进行比较。

最简单的模型可以表示为:

1
2
3
4
5
6
7
                 ┌──────────────┐
                 │              │
Vin ────→ (+) ──→│   放大器 A   ├────→ Vout
          ↑      │              │       │
          │      └──────────────┘       │
          │                              │
          └──────── β ←──────────────────┘

反馈网络从输出中取出一部分:

$$ V_f=\beta V_{out} $$

于是放大器真正看到的误差信号变成:

$$ V_{err}=V_{in}-V_f $$

所以:

$$ V_{err}=V_{in}-\beta V_{out} $$

而放大器本身满足:

$$ V_{out}=A V_{err} $$

代入:

$$ V_{out}=A(V_{in}-\beta V_{out}) $$

整理:

$$ V_{out}+A\beta V_{out}=AV_{in} $$

因此:

$$ V_{out}(1+A\beta)=AV_{in} $$

最终得到闭环增益:

$$ \boxed{G=\frac{V_{out}}{V_{in}}=\frac{A}{1+A\beta}} $$

这个公式是理解负反馈的核心。

当:$ A\beta\gg1 $

那么:$ 1+A\beta\approx A\beta $

于是:

$$ G\approx\frac{A}{A\beta} $$

即:

$$ \boxed{G\approx\frac{1}{\beta}} $$

这意味着:

只要开环增益足够高,最终闭环增益就不再主要由晶体管本身决定,而主要由反馈网络决定。

这是一件非常重要的工程变化。

假设一个放大器的开环增益因为温度变化,从 $ A=100000 $ 下降到 $ A=50000 $

如果:$ \beta=0.1 $

那么:

$$ G_1=\frac{100000}{1+10000}\approx9.999 $$

而:

$$ G_2=\frac{50000}{1+5000}\approx9.998 $$

虽然开环增益下降了一半,但闭环增益几乎没有变化。

这就是反馈的第一个核心价值:

把一个高度依赖有源器件自身参数的放大器,变成一个更主要由外部反馈网络决定的系统。


环路增益

上面的公式中出现了:

$$ A\beta $$

它非常重要,因此单独定义:

$$ \boxed{T=A\beta} $$

称为环路增益(Loop Gain)。

环路增益描述的是:一个误差信号绕反馈环路走一圈以后,会被系统放大多少。

例如:

$$ T=99 $$

那么:

$$ 1+T=100 $$

闭环误差相对于开环状态的理论抑制程度为:

$$ 20\log_{10}(1+T) = 20\log_{10}(100) = 40dB $$

也就是说,原本存在的某些误差,在理想条件下可以被反馈压低约 40 dB。

因此:

1
2
3
4
5
6
7
开环非线性
     ↓
反馈检测误差
     ↓
生成反向修正
     ↓
输出误差下降

这就是为什么负反馈能够显著降低失真。

但需要注意:

环路增益并不是一个固定数字,而是一个随频率变化的函数。

更严格地写:

$$ T(f)=A(f)\beta(f) $$

在低频区域,开环增益通常很高,因此:

$$ |T(f)|\gg1 $$

反馈很深。

随着频率升高:

1
2
3
4
5
6
7
频率 ↑
 ↓
开环增益 A ↓
 ↓
环路增益 Aβ ↓
 ↓
反馈深度 ↓

所以一个放大器在 1 kHz 时可能具有极深的反馈,但到了几 MHz 时,反馈深度可能已经大幅下降。

这也是后面讨论带宽、GBW、相位裕度和稳定性时必须牢牢记住的一条主线:

反馈不是“有”或者“没有”,而是一个随频率变化的系统。


零反馈

既然负反馈拥有这么多优势,那么为什么仍然存在“Zero Feedback”“No Global Feedback”之类的耳放设计?

首先需要明确:没有全局负反馈,不等于电路内部完全不存在反馈。

一个实际的晶体管放大器几乎不可能完全脱离反馈。

例如:

  • 发射极电阻会形成发射极退化;
  • 源极电阻会形成源极退化;
  • 电流镜本身包含反馈关系;
  • 恒流源需要反馈维持稳定;
  • 偏置电路需要反馈;
  • 稳压电路几乎必然使用反馈;
  • 温度补偿电路也经常通过反馈稳定工作点。

因此,HiFi 产品中所谓“零反馈”

通常更准确的理解是:没有从最终输出端回到输入端的全局负反馈。

而不是“整个电路里连一点反馈都没有。”

为什么完全没有反馈很少见?因为实际晶体管的参数变化太大。

例如 BJT 的:

$$ \beta_{BJT} $$

并不是一个精确恒定的数字。

同一型号晶体管,其电流增益可能存在很大的个体差异;同时:

$$ V_{BE} $$

会随温度变化,典型温度系数约为:

$$ -2mV/^\circ C $$

如果一个放大器完全依赖这些器件参数来决定最终工作状态,那么:

1
2
3
4
5
6
7
温度
 ↓
晶体管参数变化
 ↓
工作点变化
 ↓
增益 / 失真 / 输出阻抗变化

整个系统就很难获得稳定、可重复的性能。

因此工程设计中的真正问题通常不是:

1
有反馈 vs 无反馈

而是:

1
2
3
4
5
反馈放在哪里?
反馈有多深?
反馈覆盖哪些级?
反馈在多高频率下仍然有效?
反馈环路是否稳定?

全局反馈和局部反馈

假设反馈网络从耳放最终输出端一直回到最前面的差分输入级:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
输入
 ↓
输入级
 ↓
电压增益级
 ↓
驱动级
 ↓
输出级
 ↓
耳机
 ↑
 └────────── 全局反馈

这属于:

Global / Overall Negative Feedback

也就是通常所说的全局负反馈。

它的特点是反馈覆盖整个放大器。因此,输出级、驱动级、增益级中的一部分误差,都可能被包含在反馈环路之内。

例如输出级产生一定失真:

$$ D_{output} $$

那么只要这个误差能够被反馈网络检测到,整个环路就有机会进行修正。

而局部反馈则只覆盖其中一部分:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
输入
 ↓
级 1
 ↓
 ┌─────────┐
 │ 局部反馈 │
 └─────────┘
 ↓
级 2
 ↓
级 3

例如:

1
2
3
4
5
晶体管
 ↓
发射极电阻
 ↓
局部退化

发射极电阻产生的局部反馈可以降低晶体管的有效跨导变化,使器件工作更加线性。

因此,一个放大器完全可能同时存在:

1
2
3
4
5
6
7
8
9
局部反馈
+
级间反馈
+
偏置反馈
+
电源反馈
+
全局负反馈

最终真正值得讨论的是:反馈覆盖了什么,以及每一级本身的线性和动态性能如何。

减少全局反馈确实可能降低某些反馈相关的要求,也可能让某些局部非线性直接保留在输出中;但与此同时,它也会失去反馈原本能够提供的失真校正、输出阻抗降低和增益稳定能力。

因此:

反馈数量本身不是性能指标。

真正应该观察的是:

$$ THD,\quad IMD,\quad R_{out},\quad BW,\quad Noise,\quad Stability $$

以及这些指标在实际负载和实际输出电平下的表现。


负反馈的益处

负反馈最有意思的一点,是它并不是只改善一个参数。

在理想条件下,提高环路增益可以同时带来:

1
2
3
4
5
6
7
低失真
   ↓
低输出阻抗
   ↓
更宽闭环带宽
   ↓
更稳定的增益

乍看之下,这几个指标完全是不同的问题。

实际上,它们背后存在同一个数学关系:

$$ 1+A\beta $$

也就是反馈深度。


降低失真

假设一个放大器在没有全局反馈时存在非线性,其开环失真为:$ D_{OL} $

理想情况下,加入负反馈以后:

$$ D_{CL}\approx \frac{D_{OL}}{1+A\beta} $$

例如:

$$ D_{OL}=1\% $$$$ A\beta=99 $$

则:

$$ D_{CL}\approx\frac{1\%}{100}=0.01\% $$

也就是说:

$$ 1\% \rightarrow 0.01\% $$

改善了:

$$ 40dB $$

这并不是因为晶体管突然变得更加线性,而是因为反馈持续监测输出误差,并努力把输出拉回目标值。

可以把过程理解成:

1
2
3
4
5
6
7
8
9
输入
 ↓
放大器产生误差
 ↓
反馈检测误差
 ↓
误差被反向注入
 ↓
输出误差减小

因此负反馈本质上是一种误差校正机制。

但这个公式存在一个很重要的前提:

放大器必须仍然处于反馈可以控制的工作区域。

如果输出已经削波:

1
2
3
          ______
         /
────────/

那么继续增加输入信号并不会让输出按照比例增长。

此时放大器已经进入严重非线性状态。

同样,当放大器进入压摆率限制以后,内部某些节点已经无法快速跟随输入,开环增益会显著下降。

于是 $ A\downarrow $

导致:$ A\beta\downarrow $

反馈深度下降。

因此负反馈不能把已经严重失控的放大器“变成线性的”。

这也是为什么:

一个优秀的反馈放大器仍然必须拥有足够的电源余量、输出能力和压摆率。


扩大闭环带宽

负反馈还有一个容易被忽略的作用:

它可以用开环增益换取更宽的闭环带宽。

假设一个简化的一阶放大器,其开环增益在低频时很高。

当反馈深度为 $ 1+A\beta $ 时,闭环带宽近似扩大相同倍数:

$$ f_{CL} \approx f_{OL}(1+A\beta) $$

例如一个放大器开环带宽只有 $ f_{OL}=100kHz $

而 $ A\beta=99 $

那么理论闭环带宽可以达到:

$$ 100kHz\times100 = 10MHz $$

实际电路当然会比这个理想模型复杂得多,但它说明了一个基本规律:

1
2
3
4
5
6
7
开环:
高增益 + 窄带宽

      ↓ 负反馈

闭环:
低增益 + 宽带宽

因此现代放大器往往不会直接把一个“低失真的高增益级”作为最终输出,而是使用高开环增益+反馈网络把最终性能重新定义出来。


增益带宽积

对于典型的电压反馈放大器,可以用一个非常直观的近似来描述这种关系:

$$ \boxed{GBW\approx G\times BW} $$

其中:

  • $G$:闭环电压增益;
  • $BW$:闭环带宽;
  • GBW:Gain-Bandwidth Product,增益带宽积。

假设一个运放:

$$ GBW=100MHz $$

当闭环增益为:

$$ G=10 $$

那么小信号带宽大约为:

$$ BW\approx \frac{100MHz}{10} = 10MHz $$

如果闭环增益下降到:

$$ G=2 $$

则:

$$ BW\approx \frac{100MHz}{2}=50MHz $$

因此:

1
2
3
4
5
闭环增益降低
      ↓
反馈网络要求的噪声增益降低
      ↓
闭环带宽提高

这也解释了前面“低增益”为什么不仅仅意味着“输出更小”。

在很多电压反馈电路里:

较低的闭环增益意味着更宽的小信号带宽。

不过这里必须避免一个常见误解:“带宽越大,声音就一定越好。”

耳放真正需要的是:

1
2
3
4
5
20Hz~20kHz:
足够平坦

20kHz以上:
稳定、无异常峰值

如果为了获得极高带宽而牺牲稳定性,相位裕度下降,那么就可能出现:

1
2
3
4
5
高频过冲
   ↓
  振铃
   ↓
甚至振荡

因此真正的工程目标不是无限提高带宽,而是:

在足够的音频带宽、足够的环路增益和足够的稳定性之间取得平衡。


降低输出阻抗

对于一个理想电压源:

$$ R_{out}=0 $$

无论负载改变多少,输出电压理论上都不会变化。

但真实放大器输出级都有内部阻抗。

假设开环输出阻抗为:

$$ R_{out,OL} $$

加入电压负反馈以后,可以近似得到:

$$ R_{out,CL} \approx \frac{R_{out,OL}}{1+A\beta} $$

假设:

$$ R_{out,OL}=10\Omega $$$$ A\beta=99 $$

那么:

$$ R_{out,CL} \approx \frac{10}{100} = 0.1\Omega $$

于是:

1
2
3
4
5
10 Ω
 ↓
负反馈
 ↓
0.1 Ω

输出级就从一个比较差的电压源,变成了一个更加理想的低阻抗电压源。

对于耳放来说,这一点尤其重要。因为动圈耳机阻抗曲线不平直,输出阻抗也会参与电压分配。

例如一只标称 $ 32\Omega $ 的耳机,可能在中频附近接近 $ 32\Omega $

但在低频机械共振处升高到 $ 100\Omega $ 甚至更高。

如果耳放输出阻抗为 $ R_{out}=10\Omega $

那么中频处:$ \frac{32}{32+10} = 0.762 $

而共振峰处:$ \frac{100}{100+10} = 0.909 $

因此相对于中频:

$$ 20\log_{10} \frac{0.909}{0.762} \approx1.53dB $$

也就是说10 Ω 的输出阻抗本身就可能让这副耳机的频响发生约 1.5 dB 的变化。

如果:$ R_{out}=0.1\Omega $

那么:$ \frac{32}{32.1} \approx0.997 $

以及:$ \frac{100}{100.1} \approx0.999 $

两者几乎没有区别。

因此降低 $R_{out}$ 不只是为了“推力更大”,更重要的是:

让耳放对耳机负载变化不那么敏感。

这也是为什么低输出阻抗通常是现代固态耳放的主要设计目标之一。


阻尼系数

耳放领域还经常使用:

$$ \boxed{ DF=\frac{Z_{HP}}{R_{out}} } $$

定义阻尼系数Damping Factor,DF

输出阻抗越低,阻尼系数通常越高,但阻尼系数不一定越高越好。

因为阻尼系数只是一个比值,它没有直接描述:

  • 耳机机械阻尼;
  • 悬边阻尼;
  • 腔体阻尼;
  • 振膜质量;
  • 音圈参数;
  • 机械共振;
  • 声学负载。

对动圈系统来说,耳机振膜的运动本身就存在复杂的机械和声学阻尼。

因此耳放的输出阻抗只是整个阻尼系统中的一个环节。

尤其对于平板、静电等结构,不能直接套用传统动圈领域的“阻尼系数”概念。

更合理的思路应该是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
输出阻抗
 ↓
耳机实际端电压
 ↓
耳机电流
 ↓
机电耦合
 ↓
机械运动
 ↓
声学输出

最终还是要回到耳机自身的电气—机械系统,而阻尼系数只是反馈设计在这一系统耦合层面的一个可量化指标。


保护电路

前面讨论了耳放怎样把交流信号放大并送入耳机。

但一个理想的音频放大器并不应该只满足 $ AC $ 信号准确。

它还必须保证没有音乐信号的时候,耳机端不要存在明显的直流电压。

这就是所谓 DC Offset,直流偏移。


直流偏移

理想状态下:

$$ V_{DC}=0 $$

也就是说:

1
2
3
4
5
输入:
无信号

输出:
0 V DC

但真实放大器很难做到绝对为零。

原因包括:

  • 输入晶体管失配;
  • 运放输入失调电压;
  • 输入偏置电流;
  • 电阻误差;
  • 电源不对称;
  • 温度漂移;
  • 反馈网络误差。

因此实际输出可能存在:

$$ V_{DC}=1mV $$

或者:

$$ 5mV $$

甚至更大的偏移。

对于高阻耳机,这可能不一定构成明显问题。

但对于低阻耳机,尤其是:

$$ 16\Omega $$

甚至更低的负载,就需要认真考虑。


耳机与直流电流

假设耳放输出存在:

$$ V_{DC}=100mV $$

接一个:

$$ R=16\Omega $$

的耳机。

那么直流电流:

$$ I_{DC} = \frac{V_{DC}}{R} = \frac{0.1}{16} = 6.25mA $$

对应的直流功率:

$$ P_{DC} = \frac{V^2}{R} = \frac{0.1^2}{16} = 0.625mW $$

0.625 mW 看起来并不大。

但问题不只是功率。

直流电流会让音圈长期处于一个偏置状态,使其工作点偏离零点附近。

更严重的是:

DC Offset 往往不是正常工作状态,而是故障或异常状态的表现。

例如:

1
2
3
4
5
6
7
运放损坏
↓
晶体管击穿
↓
反馈环路失效
↓
输出突然出现数伏 DC

这时情况就完全不同了。

如果:

$$ V_{DC}=5V $$

对于:

$$ R=16\Omega $$

那么:

$$ I_{DC} = \frac{5}{16} = 312.5mA $$

这是非常危险的故障状态。

因此优秀耳放通常不会只依赖放大器本身的低 DC Offset,而会增加:

1
2
3
4
5
6
7
DC 检测
 ↓
比较器
 ↓
继电器控制
 ↓
异常时断开耳机

形成保护链路:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
耳放输出
   │
   ├── 正常 AC
   │
   ↓
 DC 检测
   │
   ├── 正常 → 继电器接通
   │
   └── 异常 → 继电器断开

因此:

耳放的 DC Offset 不只是一个测量指标,也是一个安全指标。


直流耦合

一种典型设计是:

1
2
3
4
5
6
7
输入
 ↓
放大
 ↓
输出级
 ↓
耳机

中间没有输出耦合电容。这种结构称为Direct Coupling,直流耦合。

它的优势非常直接:

  • 信号路径简单;
  • 不需要大容量输出电容;
  • 低频不会因为耦合电容形成高通;
  • 输出阻抗可以做得很低;
  • 可以获得非常平坦的低频响应。

但它的代价同样明确:

输出端的 DC Offset 必须被严格控制。

因此直流耦合往往需要:

  • 精密匹配;
  • DC Servo;
  • 对称电路;
  • 温度补偿;
  • DC 检测;
  • 输出继电器保护。

直流伺服

为了在不影响音频信号的情况下消除直流偏移,很多耳放会加入:

DC Servo,直流伺服。

基本思想是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
输出
 ↓
低通滤波
 ↓
提取 DC
 ↓
误差放大器
 ↓
反向修正
 ↓
放大器输入/反馈节点

也就是只检测输出中的极低频 / DC 分量,然后利用另一个反馈环路把它抵消。

可以写成:

$$ V_{DC,out}\rightarrow0 $$

但这个伺服环路本身也必须进行稳定性设计。

如果伺服环路太快,可能与音频反馈环路发生不必要的耦合;如果太慢,启动后需要较长时间才能消除偏移。

因此工程上通常让 DC Servo 的截止频率远低于音频频段。


电容耦合

另一种传统方法是使用输出耦合电容:

1
2
3
4
5
6
7
放大器
  │
  │
  C
  │
  ↓
耳机

电容可以阻止直流通过。

对于纯电阻负载:

1
2
3
4
5
6
7
放大器
  │
  C
  │
  R
  │
 GND

它实际上构成一个一阶高通滤波器。

截止频率:

$$ \boxed{ f_c=\frac{1}{2\pi RC} } $$

例如:

$$ R=16\Omega $$$$ C=220\mu F $$

那么:

$$ f_c = \frac{1} {2\pi\times16\times220\times10^{-6}} $$

约为:

$$ 45Hz $$

这意味着 20 Hz 附近已经不再完全平坦。

如果希望低频截止点下降到:

$$ f_c=5Hz $$

那么所需电容:

$$ C=\frac{1}{2\pi Rf_c} $$

对于:

$$ R=16\Omega $$

得到:

$$ C\approx2mF $$

也就是数千微法级别。

这就会带来:

  • 电容体积增大;
  • ESR;
  • ESL;
  • 漏电流;
  • 电容非理想;
  • 成本增加。

因此对于现代高性能固态耳放,尤其是低阻耳放,直接耦合 + DC Servo + 继电器保护通常比单纯依赖输出耦合电容更有吸引力。


输出耦合的取舍

可以把两种结构简单对比:

方案主要优势主要代价
直流耦合低频响应好、输出阻抗低、信号路径简单必须严格控制 DC Offset
电容耦合天然隔离 DC,电路保护简单需要大容量电容,形成高通
直流伺服可以兼顾直流耦合和低 Offset电路更复杂,需要额外稳定性设计

因此,输出是否采用耦合电容,不应该被简单理解成“高级”和“低级”的区别,而是 DC 管理方式不同。

对于耳放这种直接连接人体佩戴设备的输出级,真正需要关注的是:

$$ DC\ Offset + Protection + Low\ Frequency\ Response + Output\ Impedance + Reliability $$

也就是说音频性能与故障安全必须同时考虑。


稳定性

前面已经看到,负反馈可以降低失真、降低输出阻抗并扩大闭环带宽。但这些结论都有一个前提:

反馈环路必须在整个工作频率范围内保持稳定。

如果把放大器看成一个简单的“输入 → 放大 → 输出”系统,那么反馈似乎非常简单:

1
2
3
4
5
6
7
8
9
输入
 ↓
放大器
 ↓
输出
 ↓
取一部分
 ↓
反馈回输入

然而真实放大器内部存在多个晶体管级、寄生电容、补偿电容以及不同的信号传播延迟。于是当频率升高时,反馈信号不再与输入信号保持简单的比例关系,而会产生越来越明显的相位延迟。

当相位延迟达到危险程度时,本来应该抵消误差的负反馈,就可能逐渐变成正反馈。

因此,负反馈设计真正困难的地方,不是“有没有反馈”,而是如何让反馈在需要的频率范围内既足够深,又保持稳定。


振荡

为什么负反馈可能振荡?

首先建立一个最简单的模型,假设一个放大器的开环传递函数包含两个极点:

$$ A(f)= \frac{A_0} {(1+jf/f_1)(1+jf/f_2)} $$

低频时:

$$ f\ll f_1,f_2 $$

因此两个极点的影响都很小,开环增益接近 $ A_0 $

但随着频率上升,第一个极点开始产生衰减和相位延迟。

再继续提高频率,第二个极点也开始产生作用。

于是:

1
2
3
4
5
6
7
频率 ↑
 ↓
极点逐渐进入工作区
 ↓
增益下降
 ↓
相位滞后增加

一个简单的一阶极点最多贡献约 $ -90^\circ $ 的相位延迟。

两个极点则可能最终产生接近 $ -180^\circ $ 的相位延迟。

而反馈系统最危险的条件正是:

$$ |A\beta|=1 $$

同时:

$$ \angle A\beta\approx-180^\circ $$

此时反馈信号经历一圈以后:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
原本应该:

负反馈
 ↓
抵消误差

实际变成:

相位反转
 ↓
与输入同相
 ↓
加强误差

于是系统可能出现:

1
2
3
4
5
过冲
 ↓
振铃
 ↓
持续振荡

这就是放大器为什么不能无限追求“开环增益越大越好、带宽越宽越好、反馈越深越好。”

这些指标必须作为一个完整的反馈系统一起设计。


相位裕度

为了描述距离振荡条件还有多远,工程上使用Phase Margin,PM,相位裕度。

首先找到环路增益下降到 $ |A\beta|=1 $ ,也就是 $ 0dB $ 的频率。

设这个频率为 $ f_{0dB} $

那么相位裕度定义为:

$$ \boxed{PM=180^\circ+\angle(A\beta)} $$

这里的 $\angle(A\beta)$ 通常为负值。

例如:

$$ \angle(A\beta)=-120^\circ $$

那么:

$$ PM=180^\circ-120^\circ=60^\circ $$

如果:

$$ \angle(A\beta)=-150^\circ $$

则:

$$ PM=30^\circ $$

显然,后者离 $ -180^\circ $ 更近,因此稳定余量更小。

常见的工程经验可以粗略理解为:

相位裕度一般表现
> 60°稳定余量较大,过冲和振铃通常较小
45°~60°通常可以获得较好的瞬态响应
30°~45°过冲、振铃开始明显
< 30°稳定性风险明显增加

这些数字不是绝对的设计标准。

一个放大器究竟应该设计成 $ 45^\circ $ 还是 $ 60^\circ $ ,需要结合具体拓扑、负载以及瞬态响应要求决定。

因此相位裕度真正表达的是:

当反馈环路已经没有多少增益以后,它距离“反馈变成正反馈”还有多远。


增益裕度

除了相位裕度,另一个常见指标是Gain Margin,GM,增益裕度。

它关注的是:

当环路相位已经达到 $-180^\circ$ 时,环路增益距离 0 dB 还有多少余量。

如果相位达到 $ -180^\circ $ ,但此时 $ |A\beta|=0.1 $ ,那么系统距离振荡条件还有很大的增益余量。

如果此时 $ |A\beta|=0.9 $ ,那么情况已经非常危险。

而如果 $ |A\beta|>1 $ ,理论上系统已经满足了振荡的必要条件。

因此:

1
2
3
4
5
相位裕度:
关注“还差多少相位”

增益裕度:
关注“还差多少增益”

二者共同描述反馈环路的稳定余量。


补偿

为什么需要补偿?

如果一个放大器拥有非常高的开环增益,那么它天然会产生:多个极点+多个相位延迟

如果完全不处理,那么环路可能在某个频率突然进入 $ |A\beta|=1 $

而这时相位已经非常接近 $ -180^\circ $

因此工程师需要主动设计:

  • 主极点;
  • 次极点;
  • 零点;
  • 补偿电容;
  • 输出隔离网络;

让环路的频率响应变得可预测。

这就是Frequency Compensation,频率补偿。

它的核心目标并不是让放大器“更快”,而是:

让开环增益和相位随着频率变化的方式满足稳定性要求。


最经典的方法之一是:

Miller Compensation,米勒补偿。

简化结构可以表示:

1
2
3
4
        Cc
     ┌──||──┐
     │      │
输入 → 增益级 → 输出

跨接在高增益级的输入和输出之间。

由于米勒效应,这个电容在输入端看到的等效电容会被放大,从而形成一个较低频率的主极点。

于是系统可以被人为设计成:

1
2
3
4
5
6
7
8
9
第一个主极点
 ↓
开环增益开始下降
 ↓
0 dB交越发生得更早
 ↓
后面的极点还没有产生太大相位延迟
 ↓
获得稳定的相位裕度

这种方式非常有效,但它有代价。

补偿电容越大,通常意味着:

  • 开环带宽降低;
  • 压摆率下降;
  • 高频响应变慢。

因为内部节点需要给补偿电容充放电:

$$ I=C\frac{dV}{dt} $$

所以:

$$ SR\approx\frac{I}{C} $$

如果:

$$ C\uparrow $$

而最大充电电流不变:

$$ SR\downarrow $$

于是可以看到一个非常典型的工程折中:

1
2
3
4
5
补偿更强
 ↓
稳定性更容易保证
 ↓
但压摆率和速度下降

因此稳定性与速度从来不是完全独立的。


极点与零点

更复杂的放大器不会只有两个极点,实际系统可能存在:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
晶体管结电容
+
内部节点电容
+
补偿电容
+
负载电容
+
PCB寄生电容
+
耳机线缆电容

每一个都可能改变环路的极点位置,而电阻与电容组合还可能产生零点。

因此补偿设计本质上是在调整 $ A(s)\beta(s) $ 的极点和零点分布。

目标是让:

1
2
3
4
5
6
7
8
9
|Aβ|
 ↓
平稳下降

同时:

相位
 ↓
尽可能不要过早接近 -180°

容性负载

耳放输出端通常连接:

  • 耳机;
  • 耳机线;
  • 接头;
  • 测试仪器;
  • 甚至某些特殊转接设备。

这些都会带来一定的寄生电容。

假设输出端有 $ C_L $

而前级输出等效存在 $ R_{out} $

那么会形成一个额外极点:

$$ \boxed{f_p=\frac{1}{2\pi R_{out}C_L}} $$

例如:

$$ R_{out}=10\Omega $$$$ C_L=10nF $$

则:

$$ f_p=\frac{1}{2\pi\times10\times10^{-8}}\approx1.59MHz $$

如果放大器的环路交越频率本来就在 MHz 级,这个极点就不能忽略。

于是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
纯电阻负载
 ↓
相位裕度正常

换成强容性负载
 ↓
增加额外极点
 ↓
相位进一步滞后
 ↓
PM下降
 ↓
过冲 / 振铃
 ↓
严重时振荡

因此真正严谨的耳放稳定性测试不能只测 $ 32\Omega $ 纯电阻。

还应该考虑:

  • 容性负载;
  • 感性负载;
  • 不同阻抗;
  • 不同输出电平;
  • 不同频率。

这也是耳放与一般“在电阻假负载下测一个 THD 数字”的区别之一。


瞬态互调失真

负反馈的另一个争议来自一个很经典的问题:

如果负反馈这么好,为什么历史上曾经有人认为“大环负反馈”会让声音变差?

这个问题最终会把我们带到:

Transient Intermodulation Distortion,TIM,瞬态互调失真。

理解 TIM 的关键不是接受或者否定某一种“声音观点”,而是分析:

1
2
3
4
5
6
7
反馈
+
开环带宽
+
压摆率
+
大信号

之间到底发生了什么。


TIM 争议之源

理想情况下,负反馈可以持续修正误差。

但现实中的反馈放大器存在一个限制:

反馈本身也需要放大器具有足够的速度。

假设输入信号突然发生快速变化:

1
2
3
4
5
6
        输入
         │
─────────┐
         │
         │    快速变化
         └────────

放大器内部首先需要让各个节点发生变化。

如果内部补偿电容需要充电:

$$ I=C\frac{dV}{dt} $$

那么:

$$ \frac{dV}{dt}=\frac{I}{C} $$

存在最大值。

也就是说,放大器存在一个最大变化速度:

$$ SR $$

如果输入要求的:

$$ \left|\frac{dV}{dt}\right|>SR $$

放大器就无法继续线性跟踪。于是:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
快速输入
 ↓
内部节点跟不上
 ↓
进入压摆率限制
 ↓
开环工作状态改变
 ↓
环路增益下降
 ↓
反馈校正能力下降
 ↓
输出误差增加

因此历史上所谓的 TIM 问题,真正值得讨论的是:

放大器是否具有足够的大信号速度,使反馈环路能够及时修正误差。

而不是简单地:“负反馈越多,TIM 越严重。”


压摆率

压摆率(Slew Rate)定义为:

$$ \boxed{SR=\max\left|\frac{dV_{out}}{dt}\right|} $$

单位通常为:

$$ V/\mu s $$

它描述的是输出电压最快可以变化多快。

对于正弦波:

$$ V(t)=V_p\sin(2\pi ft) $$

求导:

$$ \frac{dV}{dt}=2\pi fV_p\cos(2\pi ft) $$

因此最大变化速度:

$$ \boxed{SR_{min}=2\pi fV_p} $$

例如:

$$ f=20kHz $$$$ V_p=10V $$

那么:

$$ SR_{min}=2\pi\times20000\times10 $$

得到:

$$ SR_{min} \approx1.26V/\mu s $$

所以如果一个耳放拥有:

$$ SR=20V/\mu s $$

对于这个正弦信号来说已经拥有很大的理论余量。


输出电压与压摆率要求

从:

$$ SR=2\pi fV_p $$

可以直接看出:

$$ SR\propto f $$

并且:

$$ SR\propto V_p $$

因此:

1
2
3
4
5
6
7
频率越高
 ↓
SR需求越高

输出电压越高
 ↓
SR需求也越高

这意味着:

高电压输出的耳放,对压摆率的要求会显著高于低电压耳放。

例如同样是 $ 20kHz $ ,如果输出峰值只有 $ 1V $

则:

$$ SR_{min}\approx0.126V/\mu s $$

而如果峰值达到 $ 10V $

则:

$$ SR_{min}\approx1.26V/\mu s $$

两者相差:

$$ 10\times $$

这就是为什么不能只看“音频频率最高只有 20 kHz”来判断速度要求。


真实音乐≠正弦波

上面的计算只是最简单的情况。

真实音乐不是一个单一正弦波。它可能同时包含:

1
2
3
4
5
低频大振幅
+
中频主体
+
高频瞬态

例如一次鼓击可能同时存在:

  • 大幅度低频能量;
  • 中频主体;
  • 高频瞬态;
  • 多个高频谐波。

多个正弦分量叠加后:

$$ x(t)=\sum_i A_i\sin(2\pi f_i t+\phi_i) $$

其变化率则是:

$$ \frac{dx}{dt}=\sum_i 2\pi f_iA_i \cos(2\pi f_i t+\phi_i) $$

不同频率分量在某些时刻可能同向叠加,使瞬时变化率明显增加。

因此一个只根据 $ 20kHz $ 单一正弦波计算出的“刚好够用”的压摆率,并不能代表真实音乐下的最佳设计。


压摆率限制

可以把理想正弦波想象成:

1
2
3
       /\
      /  \
─────/    \─────

如果输出级因为内部电流能力不足而发生 Slew Rate Limiting,则高频大信号会逐渐变成:

1
2
3
      /────
     /
────/

原本平滑的波形变成了近似线性的斜坡。

这种失真并不是普通的小信号频响滚降,因为此时放大器的非线性取决于信号幅度。

这会产生大量新的频率分量,因此压摆率不足最终会体现在:

  • THD 上升;
  • IMD 上升;
  • 高频大信号失真;
  • 瞬态波形失真;
  • 反馈校正能力下降。

压摆率与带宽

这是耳放讨论中非常容易混淆的一点。

Bandwidth 和 Slew Rate 描述的是两个不同的问题。

小信号带宽描述的是:一个很小的信号,在频率升高以后,增益什么时候开始下降。

例如:

$ BW=100kHz $ 意味着小信号情况下,频率到达约 100 kHz 时开始进入规定的衰减范围。

而 Slew Rate 描述一个大幅度信号的电压变化速度是否超过内部最大速度。

因此完全可能出现:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
小信号:

20 kHz
 ↓
完全线性


大信号:

20 kHz
 +
很高电压
 ↓
进入 Slew Rate Limiting

所以,“这台耳放带宽很高”不能证明它在大信号下拥有足够的压摆率。

反过来也一样,Slew Rate 很高,也不能证明小信号环路一定稳定。

这两个参数必须分开。


TIM 的真相

更合理的工程判断应该是:

1
2
3
4
5
6
7
8
9
深度负反馈
      ↓
要求较高的开环速度
      ↓
必须拥有足够的 GBW 和 Slew Rate
      ↓
同时做好频率补偿
      ↓
保持稳定

只要:

  • 开环带宽足够;
  • 压摆率足够;
  • 补偿合理;
  • 相位裕度充足;

那么深度负反馈本身并不会自动制造 TIM。

因此:

TIM 更应该被理解为“反馈环路与放大器大信号速度之间的失配问题”,而不是负反馈这个概念本身的问题。

这也是现代高性能放大器为什么可以同时实现:

1
2
3
4
5
6
7
深度反馈
+
极低 THD
+
很高带宽
+
很高 Slew Rate

的原因。


瞬态测量

到这里自然会产生一个值得讨论的问题:现有耳放测量能否完整反映瞬态能力?

一个比较直观的方式是方波测试:方波的理论上升时间为零,因此需要无穷大的压摆率。实际放大器会将方波的上升沿斜化:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
输入方波:

     ┌────────┐
     │        │
─────┘        └─────

输出(受压摆率限制):

     ╱────────┐
    ╱         │
────┘         └─────
     ↑
  上升时间 tr

上升时间与压摆率的关系(对于大信号阶跃):

$$ t_r\approx\frac{\Delta V}{SR} $$

其中 $\Delta V$ 为输出电压阶跃幅度。

例如,$SR=20V/\mu s$,$\Delta V=2V$:

$$ t_r=\frac{2}{20}=0.1\mu s $$

这个上升时间对于 20 kHz 音频信号(周期 50 μs)来说已经足够快。但如果压摆率只有 $2V/\mu s$:

$$ t_r=\frac{2}{2}=1\mu s $$

此时上升时间达到信号周期的 2%,对于复杂音乐信号中的瞬态成分可能产生可闻影响。


实际上,耳放瞬态性能的测量不能靠单一指标完成,但多种测试可以从不同角度共同观察。

例如:

测试主要观察
1 kHz THD+N基本线性度与噪声
高频 THD高频非线性
高输出电平 THD大信号非线性
IMD多频同时作用时的非线性
Multitone更接近复杂频谱
方波响应带宽、相位、过冲、振铃
大信号方波Slew Rate 与大信号能力
不同负载输出级负载适应能力
容性负载环路稳定性
热稳定性长时间工作状态

其中 Multitone 特别有价值。

常见 1 kHz THD 测量只是在问:“放大器面对一个非常简单的正弦波时表现如何?”

而音乐显然包含几十甚至上百个不同频率成分,当这些频率同时进入非线性放大器时,它们之间会相互调制,产生 IMD。

因此多音测量比单音 THD 更接近复杂音乐的频谱条件,但它仍然不能完全等价于真实音乐。

真实音乐还具有:

  • 动态变化;
  • 包络变化;
  • 瞬态;
  • 非平稳频谱;
  • 不同幅度分布;
  • 不同相位关系。

所以最合理的观点仍然是:

不存在一个简单的“瞬态指标”可以独立证明耳放的瞬态性能。


电压反馈与电流反馈

前面讲的负反馈并不是只有一种实现方式。

在模拟放大器中,可以根据反馈变量和误差检测方式,把常见结构分为:

  • Voltage Feedback,VFA;
  • Current Feedback,CFA。

两者的名字容易让人产生误解。

它们不是“一个反馈电压,一个不反馈电压。”

真正的区别在于:

反馈环路内部采用什么变量进行误差控制,以及输入级如何实现这个环路。


电压反馈

电压反馈是最常见的反馈拓扑,传统运放几乎都采用这种结构。

典型电路:

1
2
3
4
5
6
7
8
        R1
Vin ──/\/\──┬──(-)
            │       \  开环增益 A
           R2       >──── Vout
            │       /
           GND  ──(+)
                │
               GND

反馈电压取自输出端,通过分压网络 $R_1$、$R_2$ 产生反馈信号,与输入信号进行电压比较。

闭环增益:

$$ G_{CL}=\frac{A}{1+A\beta}=\frac{R_1+R_2}{R_1} $$

其中 $\beta=R_1/(R_1+R_2)$ 为反馈系数。

特点:

  • 高开环增益 $A$(通常 $10^5\sim10^6$);
  • 反馈深度 $1+A\beta$ 大,闭环增益精度高;
  • 带宽受增益带宽积(GBW)约束:$f_{-3dB}\approx GBW/G_{CL}$;
  • 补偿电容位于信号主通路上,限制了压摆率:$SR\approx I_{tail}/C_{comp}$;
  • 电源抑制能力较好。

VFA 的 GBW

VFA 最重要的特点之一,是闭环增益与带宽之间通常存在明显的 GBW 关系:

$$ G\times BW\approx GBW $$

例如:

$$ GBW=100MHz $$

那么 $ G=10 $ 时:

$$ BW\approx10MHz $$

如果:

$$ G=2 $$

则:

$$ BW\approx50MHz $$

因此:

1
2
3
4
5
6
7
闭环增益 ↑
 ↓
闭环带宽 ↓

闭环增益 ↓
 ↓
闭环带宽 ↑

这也是为什么改变 VFA 的闭环增益,通常会同时改变其小信号频率响应。


电流反馈

电流反馈放大器(Current Feedback Amplifier)采用不同的反馈机制:反馈信号是电流而非电压。

典型电路:

1
2
3
4
5
6
7
8
Vin ──────(+)
              \  缓冲器
               >────┬── Vout
              /     │
        (-)───      Rg
              │      │
              └──────┘
              反馈电流

输入级是一个单位增益缓冲器(而非差分对),反相输入端是低阻抗节点。反馈电流从输出端通过 $R_g$ 流入反相输入端。

闭环增益:

$$ G_{CL}=1+\frac{R_f}{R_g} $$

其中 $R_f$ 为反馈电阻,$R_g$ 为增益设定电阻。

关键区别在于:

  • 压摆率不受补偿电容限制:CFA 的补偿电容不位于信号主通路上,因此压摆率由输入级缓冲器的驱动能力决定,可以非常高(典型 $500\sim3000V/\mu s$);
  • 带宽受 $R_f$ 控制而非增益:改变 $R_g$ 调整增益时,带宽基本不变(只要 $R_f$ 保持不变),不像 VFA 那样受 GBW 约束;
  • 反相输入端阻抗低:反馈节点是低阻抗的电流求和点,对寄生电容不敏感。
特性电压反馈(VFA)电流反馈(CFA)
反馈信号电压电流
输入级差分对单位增益缓冲器
压摆率受 $C_{comp}$ 限制由缓冲器驱动能力决定
带宽与增益关系$GBW$ 守恒,增益↑则带宽↓带宽主要受 $R_f$ 控制
增益精度高(依赖 $A$ 的大小)较低(依赖 $R_f$ 和缓冲器特性)
典型压摆率$10\sim50V/\mu s$$500\sim3000V/\mu s$

但这并不意味着电流反馈天然"更有声音"或"更高级”。CFA 的增益精度通常不如 VFA,且对反馈电阻的寄生参数更敏感。


为什么 CFA 可以拥有很高的 Slew Rate?

传统 VFA 常常需要用 Miller 补偿电容稳定多级高增益放大器。

而 CFA 的内部结构可以采用不同的补偿方式,使主要信号路径不完全受传统米勒补偿机制限制。

因此某些 CFA 可以实现非常高的 $ SR $ ,例如 $ 100V/\mu s $ 甚至 $ 1000V/\mu s $ 级别。

但这并不意味着所有 CFA 都一定具有如此高的速度。

具体能力仍然取决于:

  • 内部架构;
  • 偏置电流;
  • 输出级;
  • 补偿;
  • 反馈电阻;
  • 负载。

因此:

“CFA 很快”是架构倾向,而不是每一个 CFA 的绝对性能。


CFA 通常对反馈网络中的电阻值和寄生参数更加敏感

原因在于其带宽往往强烈依赖反馈电阻 $ R_f $ 以及反馈节点的寄生电容。

因此:

1
2
3
4
5
6
7
反馈电阻变化
 ↓
反馈电流变化
 ↓
内部工作条件变化
 ↓
带宽 / 稳定性变化

如果 PCB 布线不合理:

1
2
3
4
5
反馈节点
+
寄生电容
+
走线电感

就可能显著改变高频响应。因此 CFA 的“高速度”伴随着更高的高频设计要求。


VFA 与 CFA 对比

特性电压反馈 VFA电流反馈 CFA
主要反馈变量电压电流
常见输入结构差分输入级缓冲器/低阻反馈节点
增益与带宽通常具有明确 GBW 关系带宽更多取决于反馈网络
压摆率通常受内部电流与补偿影响可实现非常高的压摆率
反馈电阻敏感性通常相对较低通常更高
高频设计难度相对成熟对反馈网络和寄生参数更敏感
典型应用通用精密音频运放高速、宽带放大器

因此:

VFA 与 CFA 是两种工程架构,而不是两种“声音等级”。

并不存在绝对优劣,真正应该观察的还是:

  • 实际增益;
  • THD;
  • IMD;
  • 噪声;
  • 输出阻抗;
  • 带宽;
  • Slew Rate;
  • 稳定性;
  • 实际负载性能。

放大类别

A 类

最严格的定义是:输出晶体管始终处于导通状态。

1
2
3
4
5
6
7
8
9
          +V
           │
         晶体管
           │
           ├──── OUT
           │
         恒流源
           │
          -V

优点:

  • 不存在传统意义上的交越截止;
  • 电路概念简单;
  • 在设计良好时可以获得良好的线性。

缺点:

  • 静态功耗高;
  • 发热大;
  • 效率低;
  • 大功率实现非常困难。

例如理想单端 A 类:

$$ P_{DC}=V_{rail}I_Q $$

即使没有音乐,电路也会持续消耗功率,静态功耗很高,因此大功率 A 类必须付出巨大的散热代价。


推挽 A 类

通过上下两个器件分别承担正负方向的电流,可以降低维持 A 类所需的静态电流。

1
2
3
4
5
6
7
8
9
          +V
           │
         上管
           │
           ├──── OUT
           │
         下管
           │
          -V

相比单端 A 类,同样的输出能力可以减少静态耗散。


高偏置 AB 类

AB 类通过设置一定静态偏置,让输出器件在小信号范围内保持导通。

因此:

1
2
3
4
5
6
7
小信号
  ↓
可能处于 Class A
  ↓
大信号
  ↓
进入 Class AB

这就是为什么很多所谓"Class A 耳放"实际是高偏置 AB 类,在一定输出功率范围内处于 A 类工作状态。

不能只看产品宣传,需要看:

  • 静态功耗;
  • 偏置电流;
  • 输出级拓扑;
  • A 类输出功率范围;
  • 超过该范围后是否进入 AB。

大型“Class A”功放很多实际上属于 complementary Class A / high-bias AB 的灰色区域。


B 类

B 类的输出器件在信号的半个周期内导通,另外半个周期截止。

1
2
3
4
5
6
7
8
9
          +V
           │
         上管(正半周导通)
           │
           ├──── OUT
           │
         下管(负半周导通)
           │
          -V

效率理论上最高可达 78.5%($\pi/4$),但存在严重的交越失真–在信号过零点附近,两个器件都处于截止状态,输出出现"死区"。

因此纯 B 类在音频放大器中几乎不使用,AB 类正是为了解决交越失真而引入的折中方案。


D 类

D 类不是"数字放大器",而是一种高频开关功率放大方式。

其基本思路:

1
2
3
4
5
6
7
8
9
模拟输入
   ↓
PWM / 调制
   ↓
高速开关(MOSFET)
   ↓
LC滤波
   ↓
模拟输出

理想情况下:

$$ P_{loss}\ll P_{out} $$

因此效率可以远高于 A 类和传统 AB 类。

对于耳放:

  • D 类可以显著提高效率(典型 > 90%);
  • 开关噪声与 EMI 需要控制;
  • 输出滤波器与负载相互作用需要设计;
  • 现代 D 类并不等于"音质差"。

因此 Class A、AB、D 本质上是在解决:

线性度、效率、散热、输出能力与实现复杂度之间的工程折中。


单端与平衡

前面已经讨论了耳放输出级的工作方式。现在再进一步看一个 HiFi 产品中极其常见的词Balanced,平衡。

“平衡”在发烧圈中经常被直接等同于:

  • 更大的推力;
  • 更好的声音;
  • 更大的声场;
  • 更低的失真;
  • 更高级的接口。

但从电路角度看,“平衡”首先只是描述信号究竟以什么形式从一个电路传递到另一个电路。

因此判断平衡系统,不能只看耳放上有没有 XLR ,而应该看:

整个信号链到底是不是差分工作的,以及输出端究竟采用了什么拓扑。


单端

最简单的单端耳放,每个声道都只有:

1
2
3
信号
+
参考地

例如左声道:

1
2
L Signal ───────────→ L+
L Ground ───────────→ GND

右声道:

1
2
R Signal ───────────→ R+
R Ground ───────────→ GND

因此整个系统可以表示成:

1
2
3
4
5
6
7
8
9
         左声道
L Signal ───────────────→ 耳机
L Ground ──────────────┐
                       │
                       ├── 公共参考路径
                       │
R Ground ──────────────┘
R Signal ───────────────→ 耳机
         右声道

单端最大的特点就是:信号电压是相对于一个公共参考点定义的。

因此如果这个公共参考点发生变化,那么信号本身也会受到影响。


平衡

平衡传输的核心不是“两个信号线”,而是用两个相反极性的信号共同表示一个差分信号。

即:

$$ V_{diff}=V_+-V_- $$

假设:

$$ V_+=+V $$$$ V_-=-V $$

那么:

$$ V_{diff} = (+V)-(-V) = 2V $$

因此负载看到的差分电压是:

$$ \boxed{2V} $$

而不是:

$$ V $$

这就是平衡输出常见的一个实际优势:在供电条件相同的情况下,完整差分输出可以获得更大的差分电压摆幅。

例如单端输出:

$$ V_{SE}=2V_{peak} $$

若采用真正的差分结构,并且正负两侧分别达到:

$$ +2V_{peak} $$

与:

$$ -2V_{peak} $$

那么负载两端看到:

$$ V_{diff}=4V_{peak} $$

电压幅度增加了一倍。

对于纯电阻负载:

$$ P=\frac{V^2}{R} $$

因此理论功率可以增加到:

$$ 4\times $$

这也是为什么很多平衡耳放在同一电源电压下,可以提供明显高于单端输出的最大功率。


差分传输与共模抑制

假设有一个外部噪声 $ V_n $ 同时耦合到正负两条信号线上:

1
2
3
4
5
6
7
真正信号:

L+ = +V
L- = -V

外界噪声:
+Vn

那么:

$$ V_+=V+V_n $$$$ V_-=-V+V_n $$

差分接收端得到:

$$ V_{diff} = (V+V_n)-(-V+V_n) $$

于是:

$$ V_{diff}=2V $$

噪声:

$$ V_n $$

被抵消了。这就是Common Mode Rejection,共模抑制。

实际电路中的抑制能力用CMRR,Common Mode Rejection Ratio描述。

理想差分电路:

$$ CMRR\rightarrow\infty $$

实际系统则受到:

  • 电阻匹配;
  • 晶体管匹配;
  • PCB;
  • 电源;
  • 输入级结构;

的限制。

因此真正的平衡系统通常同时具有差分信号+共模抑制这才是它在长距离模拟传输中真正有价值的地方。


区分平衡输出与输入

平衡耳机输出与平衡线路输入不是一回事,这是 HiFi 中非常容易混淆的两个概念。

在线路传输中,平衡通常最重要的价值是提高抗共模干扰能力。

而在耳机输出中,因为耳机本身已经非常靠近耳放,线缆又很短,因此“抗外部干扰”通常不是唯一重点。

耳机平衡输出更常见的收益是:

  1. 左右声道完全独立的正负输出;
  2. 避免公共耳机地回流;
  3. 更大的差分电压摆幅;
  4. 更低的公共路径串扰。

所以耳机平衡输出和 XLR 线路平衡传输虽然都叫 balanced,但它们解决的问题并不完全相同。


XLR≠全平衡

假设一台耳放:

1
2
3
4
5
6
7
8
9
XLR 输入
 ↓
差分 → 单端
 ↓
单端放大
 ↓
单端 → 差分
 ↓
XLR 输出

那么接口层面:

1
XLR → XLR

看上去是平衡系统。

但内部真正的放大过程却是:

1
2
3
4
5
6
7
差分
 ↓
单端
 ↓
单端放大
 ↓
差分

它并不是完整的:

1
2
3
4
L+
L-
R+
R-

全差分放大。因此接口是平衡的,不等于内部拓扑是全差分的。

同样地,看到一个 4 针 XLR 耳机接口,也不能仅凭接口判断里面用了多少个独立放大器。

真正应该追踪的是:

1
2
3
4
5
6
7
8
9
输入
 ↓
差分结构?
 ↓
独立 L/R?
 ↓
独立正/负输出级?
 ↓
最终耳机

串扰的来源

一个优秀耳放的串扰需要从整个电路观察。

典型来源包括:

1. 公共地阻抗

假设左右声道共用一段有限阻抗的地线。

左声道输出电流 $ I_L $ ,流过公共阻抗 $ Z_{shared} $

根据欧姆定律,会产生:

$$ V_{shared}=I_LZ_{shared} $$

这个电压会出现在右声道的参考节点上,于是右声道实际看到的信号变成:

$$ V_R'=V_R+V_{shared} $$

这就是一种典型的 Common Impedance Coupling,共阻抗耦合。

可以用一个更直观的图理解:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
左声道电流
   │
   ▼
┌─────────┐
│ 公共阻抗 │
└─────────┘
   │
   ▼
公共地电压变化
   │
   ├──────→ 左声道参考
   │
   └──────→ 右声道参考
                ↓
               串扰

因此串扰并不一定来自“信号线靠得太近”。它还可能来自:

  • 公共地回路;
  • 电源共阻抗;
  • 输出级共享电源;
  • PCB 走线耦合;
  • 电磁耦合;
  • 变压器磁耦合;
  • 输入级共用偏置节点。

2. 电源共阻抗

两个声道共享电源供电时,一个声道的大电流变化可能使电源节点发生微小波动:

1
2
3
4
5
6
7
L大电流
 ↓
电源压降
 ↓
R声道供电节点变化
 ↓
串扰

3. PCB 电磁耦合

两条高速变化信号线平行走线时,会通过寄生电容和寄生电感发生耦合。

4. 输出级公共回路

尤其对于低阻耳机,输出电流较大,因此公共回路中的微小阻抗也可能产生较明显的交叉影响。

所以,降低串扰不是简单地“把左右声道分开”,而是降低整个系统中两条信号路径之间的共享阻抗和电磁耦合。

这也是为什么优秀耳放的 PCB 布局、电源设计与地线结构非常重要。


电路拓扑

集成运放

运算放大器把:

  • 差分输入;
  • 高增益级;
  • 补偿;
  • 输出级;
  • 偏置

集成到一个芯片中。

优势:

  • 参数一致性高(芯片内部器件在同一块硅片上制造,匹配性好);
  • 成本低;
  • 设计简单;
  • 体积小;
  • 可以获得很好的测量性能。

缺点:

  • 电源电压有限(通常 ±5V ~ ±18V);
  • 输出电流有限(通常 20-50 mA,某些高输出型可达 100-200 mA);
  • 稳定性受负载影响(容性负载可能导致振荡);
  • 设计自由度有限(拓扑、偏置、补偿均由芯片决定)。

但现代音频运放已经可以达到极高性能。例如某些高性能运放的 THD+N 在 1 kHz、2 Vrms 条件下可以达到 -120 dB 以下。

因此,“集成 < 分立 “不是技术规律。


分立设计

分立耳放使用:

1
2
3
4
晶体管(BJT、JFET、MOSFET)
电阻
电容
二极管

等器件自行构建放大器。

优势:

  • 拓扑自由(可以选择任何放大结构);
  • 可以使用更高电压(不受芯片内部击穿电压限制);
  • 可以并联大量输出器件(提高电流能力);
  • 可以针对特定负载设计(如低阻耳机需要大电流,可以专门设计输出级);
  • 方便采用特殊反馈结构(如电流反馈、局部反馈)。

分立设计最大的优势之一就是设计自由度:可以自由选择低环路增益、电流反馈、差分、Class A、Class S、新型器件以及特殊拓扑。

但分立设计的自由度伴随着参数离散性与环境敏感性:

  • 参数离散(同一型号晶体管的 hFE 可能变化 2-3 倍);
  • 温漂($V_{BE}$ 温度系数约 -2 mV/°C);
  • 匹配误差(除非使用单片对管或手工配对);
  • 非线性(尤其是 JFET 和 MOSFET 的跨导随工作点变化);
  • PCB 寄生(走线电阻、电容、电感);
  • 偏置漂移(温度变化导致工作点移动)。

因此,分立设计是一个高方差选项:精心调试的优秀分立耳放可以超越集成方案,但粗制滥造的分立耳放可能连一颗普通运放都不如。


晶体管

晶体管(BJT、MOSFET、JFET)是现代耳放的绝对主流。其优势源于半导体物理特性:

特性物理基础工程价值
高电流能力功率 BJT 的集电极电流可达数安培;功率 MOSFET 的 $I_D$ 可达数十安培直接驱动低阻负载,提供数百 mA 至数 A 的峰值电流
低输出阻抗现代功率 MOSFET 的 $R_{DS(on)}$ 可低至 $<10,\text{mΩ}$;BJT 在深度负反馈下亦可实现极低输出阻抗配合电压负反馈,输出阻抗可降至 $<0.1,\Omega$,显著降低对耳机频响的干扰
高跨导BJT 的 $g_m=I_C/V_T$,在毫安级偏置下可达数十 mS容易构建高开环增益,实现深度负反馈与低失真
快速开关硅基载流子迁移率高,结电容小,$f_T$ 可达数百 MHz适合宽带放大与高压摆率设计
小体积与低成本硅工艺成熟,封装多样易于实现多声道、高密度量产

无论前端采用集成运放还是分立输入级,最终驱动耳机的几乎总是晶体管输出级。集成运放内部的输出级也是晶体管;分立设计只是将这一过程从芯片内部搬到了 PCB 上。


电子管

电子管基于真空中的热电子发射与电场控制,其电气特性与晶体管存在系统性差异:

参数典型值与晶体管对比
工作电压100–400 V远高于晶体管(通常 5–50 V)
输出阻抗数百 Ω 至数 kΩ晶体管可低至 mΩ 级(配合反馈)
输出电流通常 < 100 mA功率晶体管可达数 A
非线性特征以偶次谐波为主,THD 通常 0.1%–5%晶体管在深度负反馈下可达 0.001% 以下
输入阻抗极高(栅极电流 < 1 nA)与 JFET 类似,但驱动能力远弱于晶体管

电子管的高输出阻抗与低电流能力决定了它无法直接驱动低阻耳机。工程上通常采用三种方案:

1.输出变压器耦合(传统方案)

1
2
3
4
5
电子管
  ↓
输出变压器(阻抗比 100:1 或更高)
  ↓
低阻耳机(16–300 Ω)

变压器将高电压/低电流转换为低电压/高电流,但引入了磁芯非线性、频响限制、磁饱和与相移。

2.OTL(Output Transformerless)

通过多管并联或阴极跟随器降低输出阻抗,通常仍需输出电容隔离直流,且驱动低阻耳机时效率极低。

3.OCL(Output Capacitorless)

采用正负高压电源与直流耦合,省去输出电容,但对直流偏移控制要求极为苛刻。


电子管耳放的工程定位

电子管耳放通常不是追求最低 THD 或最宽带宽的工具,而是在特定约束下的合理选择:

  • 高阻耳机(300 Ω、600 Ω):电子管的高电压摆幅可在高阻负载上产生足够功率。
  • 静电耳机:需要数百伏驱动电压,电子管的高工作电压天然匹配。
  • 特定的非线性频谱:电子管的转移特性 $I_P=f(V_{GK})$ 呈近似二次函数,产生的谐波以偶次为主,频谱分布与晶体管的尖锐奇次谐波不同。

但需明确:

电子管的"温暖感"并非来自超越物理的神秘属性,而是来自其特定的非线性失真频谱、输出变压器的频响塑形、以及较高输出阻抗与耳机阻抗曲线相互作用产生的电压分配变化。 这些效应全部可以通过 THD 频谱分析、频响测量和输出阻抗测量进行量化。


拓扑选择

将上述选项置于统一的决策框架下:

拓扑最佳适用场景主要限制关键决策因素
集成运放中低功率、便携设备、成本敏感型产品电流/电压受限、容性负载敏感、设计自由度低一致性、成本、开发周期、小信号线性度
分立晶体管低阻大电流、高功率、特殊拓扑需求、极致性能追求参数离散、温漂、调试复杂、面积大输出电流、散热、负载适应性、设计自由度
电子管高阻耳机、静电耳机、特定谐波结构需求、高电压摆幅高输出阻抗、低电流、高电压需求、维护成本输出阻抗匹配、电压摆幅、非线性频谱、可靠性
混合设计结合不同器件优势,如电子管前级 + 晶体管后级复杂度增加、接口匹配、电源需求多样前级线性度与音色、后级驱动能力、整体稳定性

最终,拓扑选择应基于以下决策链:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
目标耳机阻抗 Z 与灵敏度 S
      ↓
所需最大电压 V_max = f(Z, S, SPL_target)
      ↓
所需最大电流 I_max = V_max / Z_min
      ↓
电源电压与散热约束
      ↓
线性度(THD/IMD)与带宽指标
      ↓
成本、体积与可靠性约束
      ↓
拓扑决策

电路拓扑是手段,不是目的。集成运放、分立晶体管或电子管,都只是实现特定电气规格的路径。真正重要的是:在目标负载和实际工作条件下,耳放能否以足够的电压、电流、线性度和稳定性驱动耳机,同时把噪声、失真和输出阻抗控制在可验证的范围内。


电源

耳放输出的电能最终都来自电源。

因此可以把耳放看成:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
AC / DC输入
     ↓
整流 / 开关电源
     ↓
储能电容
     ↓
稳压
     ↓
放大器
     ↓
耳机

线性电源

典型结构:

1
2
3
4
5
6
7
8
9
变压器
 ↓
整流(全桥 / 桥式)
 ↓
大容量电容滤波
 ↓
线性稳压器(如 LM317/337、78xx/79xx)
 ↓
放大器

优点:

  • 结构直观
  • 开关噪声较少
  • 容易获得低纹波(典型 < 1 mV)
  • EMI 低

缺点:

  • 效率低(通常 30-50%)
  • 发热大(多余能量以热量形式耗散)
  • 变压器体积较大
  • 重量重

开关电源

典型结构:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
AC
 ↓
整流
 ↓
高频开关(几十 kHz ~ 几 MHz)
 ↓
高频变压器
 ↓
整流 / 滤波
 ↓
稳压

优点:

  • 高效率(通常 > 85%)
  • 体积小
  • 轻
  • 可以方便地产生多组电压

缺点:

  • 高频开关噪声(典型 50-200 mV 纹波,频率在几十 kHz 到几 MHz)
  • EMI
  • PCB 布局要求高

然而,“线性电源"不等于"低噪声”,“开关电源"也不等于"高噪声”。

最终应该看实际:

  • 输出噪声
  • PSRR
  • 纹波
  • 负载瞬态
  • EMI
  • 接地设计

电源抑制比

电源抑制比(Power Supply Rejection Ratio)描述的是放大器抑制电源扰动进入输出的能力。

定义可以简化为:

$$ PSRR=20\log_{10} \frac{V_{supply,ripple}}{V_{out,ripple}} $$

如果:

$$ PSRR=80dB $$

则电压抑制倍数:

$$ 10^{80/20}=10000 $$

输入纹波:

$$ 100mV $$

理论上经过理想化 PSRR 后:

$$ V_{out,ripple} \approx \frac{100mV}{10000} =10\mu V $$

真实电路还会受到频率、负载和布局影响。PSRR 通常随频率升高而下降–许多放大器在低频时 PSRR 很高(> 80 dB),但在高频时可能降至 20-40 dB,恰好是开关电源纹波所在的频率范围。

因此,电源纹波是否重要,不能只看电源本身的纹波,而要看放大器如何拒绝它。


储能电容

整流后的电源会在负载变化时产生电压波动。

电容满足:

$$ I=C\frac{dV}{dt} $$

因此:

$$ \Delta V\approx\frac{I\Delta t}{C} $$

例如在相同电流和时间窗口下:

$$ C\uparrow \Rightarrow \Delta V\downarrow $$

但"电容越大越好"同样是错误的。

还要考虑:

  • ESR(等效串联电阻):高频时电容表现为电阻,ESR 越高纹波越大
  • ESL(等效串联电感):极高频时电容表现为电感,失去滤波能力
  • 稳压器稳定性:某些稳压器对输入/输出电容的 ESR 有要求,过大或过小都可能导致振荡
  • 浪涌电流:大容量电容上电瞬间会产生很大的充电电流,可能冲击整流器和保险丝
  • 整流器能力:整流二极管的峰值电流和热容量
  • 变压器容量:变压器的绕组电阻和磁芯能力
  • PCB 回路面积:大电容与整流器之间的走线面积影响 EMI

接地与地线结构

电路中的 GND 并不是绝对的“零电压”,而是一个参考节点。真实的地线存在电阻和寄生电感,因此只要有电流流过,就会产生:

$$ V=IZ $$

这意味着地线本身也可能成为噪声和串扰的来源。


公共地阻抗

假设左右声道共用一段地线:

1
2
3
左声道 ──┐
        ├── 公共地阻抗 ── GND
右声道 ──┘

左声道输出电流流过公共阻抗后会产生:

$$ V_{shared}=I_LZ_{shared} $$

这个电压又会进入右声道的参考点,形成共阻抗耦合,表现为串扰。

因此,降低串扰的关键之一,是减少左右声道以及大小信号回路之间共享的地阻抗。

低阻耳机需要更大的输出电流,因此对地线结构尤其敏感。


星形接地

常见的解决方法是星形接地:

1
2
3
4
5
6
7
8
9
左声道 ————┐
右声道 ————┤
输入级 ————┤
控制电路 ——┤
          ▼
       星形节点
          │
          ▼
         电源

核心不是“画成一颗星”,而是让不同回路沿各自路径回流,避免大电流经过小信号地。

1
2
3
4
5
输出级大电流
      ↓
功率地
      ↓
星形节点

而:

1
2
3
4
5
输入级小信号
      ↓
信号地
      ↓
星形节点

这样可以减少电源、输出级对输入级的污染。


模拟地与数字地

包含 DAC、DSP、USB、MCU 的设备中,还需要控制数字回流电流。常见结构是:

1
2
3
4
5
6
7
8
9
数字电路
   │
  DGND
   │
设计好的连接点
   │
  AGND
   │
模拟电路

数字地和模拟地并不是必须完全隔离,而是要避免高速数字回流经过敏感的模拟地路径。


地环路

多个设备连接后还可能形成:

1
2
3
4
5
6
7
8
设备A
 │
信号线
 │
设备B
 │
地线
 └────→ 回到设备A

如果两个设备存在地电位差,就可能产生环流:

$$ I_{loop} $$

并在地线阻抗上形成:

$$ V_{noise}=I_{loop}Z_g $$

典型表现就是 50/100Hz 及其谐波的嗡声。

平衡传输可以提高对共模干扰的抑制能力,但不能代替合理的接地设计。


机壳地与保护地

还需要区分:

1
2
3
4
5
Signal Ground
Power Ground
Digital Ground
Chassis Ground
Protective Earth

它们承担的任务不同:

  • 信号地:作为音频信号参考;
  • 功率地:承担输出级和电源的大电流回流;
  • 数字地:承担数字电路回流;
  • 机壳地:主要负责屏蔽;
  • 保护地:主要负责安全。

因此不能简单理解成:“所有地必须完全相连”或“所有地必须完全隔离”。

真正的目标是:

让不同性质的电流沿合理的低阻抗路径流动,同时避免大电流和高频噪声进入小信号参考。


接地设计

接地设计最终解决的不是“声音好不好”,而是:

1
2
3
4
5
6
7
地阻抗
 ↓
回流路径
 ↓
共阻抗耦合
 ↓
串扰 / 噪声 / 地环路

因此判断耳放的接地设计时,真正应该关注的是:

公共回流阻抗、星形或分区接地、数字/模拟地的处理、机壳与保护地的关系,以及 PCB 上实际的电流回路。


电源周边

关于 HiFi 插排、电源线、地盒等产品,必须先问:

它究竟改变了系统中的哪个物理量?

电源线

一根电源线在电路中的角色可以用以下模型描述:

1
2
3
4
5
6
电网 ─── 电源线阻抗 ─── 设备电源输入
         │
         ├── 导体电阻(mΩ 级)
         ├── 导体电感(μH 级)
         ├── 屏蔽层对共模噪声的衰减
         └── 屏蔽层接地路径

定量分析:

  • 导体电阻:1.5 mm2 铜线、1.5 m 长度,电阻约 16 mΩ。设备电源变压器初级绕组电阻通常在 1-10 Ω,因此电源线电阻仅为后者的 0.2-1.6%。对于直流压降和 50 Hz 基波而言,这个差异完全可以忽略。
  • 导体电感:典型电源线电感约 0.5-1 μH/m,在 100 kHz(开关电源纹波频率)处阻抗约 0.3-0.6 Ω,在 1 MHz 处约 3-6 Ω。这意味着电源线对高频共模噪声确实有一定阻抗–但这个阻抗主要影响的是噪声从设备向外辐射(EMI),而非噪声从电网进入设备。
  • 屏蔽:带屏蔽层的电源线可以衰减外部电磁场对线内导体的耦合。在电磁环境复杂的场合(如靠近大功率开关设备),屏蔽电源线可能降低共模噪声注入。但对于普通家庭环境,这种影响通常在设备自身的 PSRR 和滤波能力范围之内。

因此,电源线能改变的物理量主要是高频共模噪声的耦合路径和屏蔽效果,而非导体材质带来的"声音改善”。

插排

插排的核心功能是分配电源和提供过载保护。其等效电路为:

1
2
3
4
电网 ─── 插排内部走线 ─── 设备1
         │
         ├── 设备2
         └── 设备3

如果插排具有良好的滤波功能(如共模扼流圈、X/Y 电容),其共模插入损耗在 100 kHz-30 MHz 范围内可能达到 20-40 dB,这确实可以降低电源线上的共模噪声。

但需要区分:

  • 滤波型插排:内部有共模扼流圈和旁路电容,可以衰减差模和共模噪声。对于开关电源产生的高频噪声有一定抑制作用。
  • 无滤波插排:只是简单的铜排分配,其影响仅限于接触电阻(通常 < 5 mΩ)和内部走线电感,可以忽略。

更重要的是,即使滤波型插排降低了电源线上的共模噪声,如果设备自身的电源已经有足够的 PSRR 和滤波,最终到达音频电路的噪声改善可能远低于可闻阈值。

地盒

地盒的原理是提供一个低阻抗的接地参考点,降低设备之间的地电位差。其等效模型为:

1
2
3
4
5
设备A机壳地 ──┐
            ├── 地盒(低阻抗节点)
设备B机壳地 ──┘
            │
         大地参考

在接地设计不良的系统中,设备之间的地电位差可能通过信号线屏蔽层耦合到信号通路中,产生"地环路噪声”(通常为 50/100 Hz 及其谐波)。地盒通过提供一个低阻抗的共同接地点,可以降低这个电位差。

但在接地设计良好的系统中:

  • 设备内部已有星形接地或单点接地设计
  • 信号线屏蔽层在正确的一端接地
  • 电源线已有保护地连接

额外的地盒可能引入新的接地回路,反而增加噪声。

“电源周边配件更贵,所以声音更好”不是工程解释。真正的问题是它改变了什么物理量,以及这种改变是否已经超出原设备自身的抑制能力。在做任何外部电源附件的决策之前,应该先确认设备自身的电源设计是否存在可测量的不足。


分体与一体

DAC 与耳放的物理关系有两种基本形态:分体式与一体式。发烧文化中常将分体等同于“高端”,将一体等同于“妥协”或“入门”,但这种判断混淆了工程拓扑与审美等级。从物理角度,两种结构是在隔离性与连续性之间做出的不同权衡,各自拥有不可替代的优势与不可回避的代价。

分体的工程优势

分体的核心价值不在于“仪式感”,而在于它通过独立的机箱、独立的电源与独立的空间,切断了某些在单一体内部无法根除的物理耦合路径。

1.电源隔离:阻抗耦合的物理切断

DAC 芯片(尤其是 Delta-Sigma 架构)内部存在 MHz 级的数字开关时钟,电源电流呈脉冲式抽取。即使经过 LDO,电源轨上仍会残留纹波。LDO 的电源抑制比(PSRR)随频率升高而急剧下降:

频率典型 LDO PSRR
100 Hz80–100 dB
10 kHz60–80 dB
100 kHz40–60 dB
1 MHz20–40 dB

大功率耳放(尤其是 Class A 或高偏置 AB)的静态电流可达安培级,其电流脉冲通过共享电源内阻 $R_{source}$ 产生压降 $\Delta V = I \cdot R_{source}$。若 DAC 与耳放共享同一组整流滤波电容,耳放的电流调制将直接叠加在 DAC 供电节点上。当该调制频率落在 LDO 的高频 PSRR 薄弱区时,将穿透至 DAC 模拟输出级。

分体使用完全独立的变压器、整流桥与滤波网络,从物理上切断了电源阻抗耦合路径。两套电源之间仅通过市电电网间接关联,其耦合阻抗从毫欧级 PCB 铜箔跃升至欧姆级建筑配线,噪声电流被大幅衰减。

2.热隔离:时钟稳定性的物理保障

晶体振荡器的频率温度系数典型为 $\pm 10\text{–}20,\text{ppm}/^\circ\text{C}$。一个 22.5792 MHz 的音频晶振,温升 $5^\circ\text{C}$ 可导致约 $1\text{–}2,\text{kHz}$ 的频偏。虽然现代 DAC 普遍采用异步采样率转换或 PLL 来抑制输入抖动,但本地晶振的短期稳定性(Allan 方差)仍影响输出时钟的相位噪声。

大功率耳放的静态热耗散不可忽略:

  • 单端 Class A,±15 V 供电,$I_Q = 1,\text{A}$:$P_{static} = 30,\text{W}$
  • 推挽 Class A,±25 V,$I_Q = 0.5,\text{A}$:$P_{static} = 25,\text{W}$
  • 高偏置 AB,双声道:$P_{static} = 10\text{–}20,\text{W}$

这些热量通过机箱金属传导与空气对流,可在一体机箱内部建立 $5\text{–}15^\circ\text{C}$ 的温度梯度。若 DAC 晶振与耳放散热器处于同一热场,其频率漂移将转化为输出时钟的相位抖动。

分体将大热源与热敏感元件物理分离至不同机箱,切断了热传导路径。即使置于同一桌面,空气对流导致的温升也远小于金属机箱的直接传导。

3. 电磁隔离:大电流环场的空间衰减

耳放输出级驱动低阻耳机时,峰值电流可达数百毫安甚至安培。根据毕奥-萨伐尔定律,电流环产生的磁感应强度:

$$ B = \frac{\mu_0 I}{2\pi r} $$

在距离导线 $r = 1,\text{cm}$ 处,$I = 500,\text{mA}$ 产生的磁场约为 $10,\mu\text{T}$。DAC 的 I/V 转换级与模拟前端通常处理微伏至毫伏级信号,高阻抗节点对磁场感应敏感。感应电压:

$$ \mathcal{E} = -\frac{d\Phi_B}{dt} \propto A_{loop} \cdot \frac{dB}{dt} $$

若 DAC 的模拟走线形成 $1,\text{cm}^2$ 的环路面积,在 1 kHz 信号频率下,$10,\mu\text{T}$ 的交变磁场可感应出约 $6,\mu\text{V}$ 的噪声电压。这已接近高分辨率 DAC 的量化底限。

分体将大电流输出级与 DAC 模拟前端分离至不同机箱,磁场随距离立方衰减(远场偶极子近似;近场衰减更慢,分体带来的实际隔离收益只会更大),DAC 处的磁干扰可降低两个数量级以上。

此外,大功率环形变压器的漏磁通(典型 $10\text{–}100,\mu\text{T}$ 于表面)若紧邻 DAC 的精密参考电压源,可能引入可测量的温漂与噪声。分体允许将变压器置于远离敏感电路的独立机箱中。

4.机械振动隔离

工频变压器存在 50/100 Hz 的磁致伸缩振动,幅度虽微(亚微米级),但可通过机箱传导。对于使用精密参考电压源或机械调谐元件的高端 DAC,长期振动可能影响接触可靠性或引起微音效应(microphonics,机械应力导致的电参数变化)。分体将振动源隔离至独立机箱,消除了传导路径。

5.设计自由度的物理释放

大功率耳放与精密 DAC 在空间需求上存在根本冲突:

组件空间需求对环境的敏感度
Class A 输出级巨大散热器、大体积电源电容低
环形变压器大磁芯、重绕组、需远离敏感电路中(漏磁/振动)
DAC 晶振数平方厘米极高(温度、振动、电磁场)
I/V 转换运放数平方毫米至数平方厘米高(电源噪声、热漂移)

一体机必须在同一机箱内协调这些矛盾:散热器不能紧贴 DAC,变压器必须远离晶振,大电流走线需绕过敏感前端。这往往导致空间上的相互妥协。分体解除了这些物理约束,耳放机箱可纯粹为热设计与电源容量优化,DAC 机箱可设计为紧凑的屏蔽腔体。

6.模块化与长期演进

标准化接口(RCA/XLR)使分体系统具备模块化替换能力。当 DAC 技术演进或耳放需求改变时,无需废弃整个系统。这种灵活性降低了用户的长期拥有成本与技术锁定风险。


分体的工程代价

分体的优势建立在引入外部链路的基础上,而这条链路本身携带不可忽略的物理代价。

1.信号连续性的破坏

外部线缆与连接器破坏了信号通路的物理连续性,引入三类寄生效应:

接触电阻的非线性

RCA 或 XLR 的金属接触面并非理想导体。插针与簧片之间的实际接触面积远小于几何面积,电流通过大量微观的“接触斑点”(a-spots)传导。这些斑点的电阻不仅存在(典型值 10–50 mΩ),更重要的是具有电压依赖性与机械敏感性。当连接器因温度变化或机械振动发生微动(fretting)时,接触电阻以不可预测的方式调制,产生互调失真与噪声。

热电效应(Seebeck 效应)

连接器通常由不同金属构成(如黄铜镀金、磷青铜、镍镀层)。铜-镍结的典型塞贝克系数差约 $10\text{–}20,\mu\text{V}/^\circ\text{C}$。设备热机后,连接器内部可能存在 $1\text{–}5^\circ\text{C}$ 的温差,导致输出端出现数十 μV 的直流偏移。对于直流耦合耳放,这直接叠加到信号中。

分布参数与射频耦合

一段 1.5 m 的 RCA 线缆可建模为分布参数的 RLC 网络。在音频段其特性可忽略,但在射频段(>1 MHz)成为有效的接收天线。手机信号、WiFi 可在屏蔽层上感应出共模电流。若耳放输入级对射频整流敏感,这些射频分量可能被解调为音频带内的噪声。

2.地环路:分体的结构性缺陷

当 DAC 与耳放分别插入市电插座时,两者的机壳通过建筑保护地(PE)连接。由于建筑配线的阻抗(典型 $10\text{–}100,\text{mΩ}$)与三相不平衡电流,两地之间存在工频电位差 $V_{ground}$(通常 $1\text{–}10,\text{mV}$,恶劣环境下可达 $100,\text{mV}$ 以上)。

此时,信号线屏蔽层提供了第三条并联路径:

1
2
3
4
5
DAC机壳 ──→ PE导线A ──→ 配电箱 ──→ PE导线B ──→ 耳放机壳
   ↑                                                    │
   └────────────── 信号线屏蔽层 ────────────────────────┘
                         ↑
                    地环路完成

环路电流即使仅 $100,\mu\text{A}$,流经屏蔽层电阻(约 50 mΩ)也会产生 $5,\mu\text{V}$ 的压降,串联在音频回流路径中。对于增益 20 dB 的耳放,输出端残余为 $50,\mu\text{V}$,对应高灵敏耳机约 20–30 dB SPL 的噪声底。

XLR 平衡接口并非万能解药。真正的共模抑制依赖于接收端差分对的精确匹配与屏蔽层的正确处理(AES48 标准:Pin 1 接机壳,信号地通过内部单点连接机壳)。若耳放将 XLR Pin 1 直接接信号地,屏蔽层电流被迫流经信号地,CMRR 可能从 80 dB 骤降至 40 dB 以下。

3.线路电平标准的结构性失配

分体系统必须遵循行业标准线路电平(RCA 2 Vrms,XLR 4 Vrms),以保证跨品牌互操作性。然而,这一标准对现代耳机系统往往是过度设计,原因请见前文。

需要注意的是动态范围的隐性损失。DAC 的满幅 SNR(如 120 dB)是在 0 dBFS、2 Vrms 下标定的。当信号被衰减 30 dB 后,实际输出电平为 63 mV,而 DAC 的本底噪声与耳放的输入噪声被固定增益放大,有效系统 SNR 不再由 DAC 决定,而是由噪声底与工作电平的比值决定。


一体的工程优势

一体机的优势不在于“省钱省空间”,而在于它从根本上消除了分体所引入的机械接口、外部线缆与跨机箱接地这三类物理不连续性。

1.信号路径的极端缩短

DAC 输出至耳放输入的 PCB 走线可控制在厘米级,分布电容 <10 pF,分布电感 <10 nH,接触电阻为零(无连接器)。相比之下,分体系统的线缆电容可达 200 pF 以上,且引入了两次连接器接触。信号通路的物理连续性在一体机中达到理论最优。

2.电平匹配的自由度

一体机内部不受线路电平标准约束。设计师可将 DAC 芯片的满幅输出设定为 0.5 Vrms 甚至更低,后接固定增益耳放(如 0 dB 或 6 dB),使正常听音时音量控制处于最佳区间。这种电平匹配的自由度是一体机在系统层面的结构性优势,分体系统无法复制。

3.接地简洁性

整个系统的地平面由单一 PCB 铜层定义,数字地与模拟地通过星形或分区策略在内部解决,无需暴露于外部建筑配线的电位差之中。地环路问题在物理上被消除。

4.数字音量的前端优势

一体机可在 DAC 芯片内部或前置 DSP 中以 32-bit 浮点精度执行数字音量控制,后接固定增益模拟耳放。这消除了模拟电位器的跟踪误差、热噪声与机械磨损,实现完美的声道平衡与极低的量化失真。

5.阻抗匹配的自由度

DAC 芯片的 I/V 转换级与后级滤波器可直接针对耳放输入阻抗设计,无需驱动标准线路负载(通常要求 10 kΩ 以上输入阻抗、<1 nF 负载电容)。这允许使用更低功耗、更低噪声的输出级拓扑。


一体的工程代价

一体机的代价在于它必须在同一物理空间内解决所有耦合问题,无法通过“分箱”来回避。

1.电源共享

数字部分(USB 控制器、FPGA、显示驱动)与模拟部分共享同一市电入口。数字开关噪声可能通过电源阻抗耦合至模拟级。虽然现代设计通过独立 LDO、磁珠隔离与 PCB 分区可将此耦合抑制到极低水平,但物理上无法达到分体那种“独立变压器”的隔离度。

2.热耦合

大功率耳放的静态热耗散在封闭机箱内形成温度梯度。即使采用金属隔板与独立腔室,空气对流与机箱传导仍使 DAC 晶振暴露于热场中。对于极端热设计(如 50 W 以上 Class A),一体机可能需要强制风冷,引入额外的振动与噪声。

3.电磁耦合

大电流输出级与敏感 DAC 模拟前端被限制在同一机箱内。尽管 PCB 布局可将两者分区,但机箱内部的金属壁并非完美磁屏蔽,低频磁场(<1 kHz)可穿透铝/铜屏蔽层。布局空间受限时,大电流回流路径可能被迫靠近高阻抗模拟节点。

4.升级锁定

DAC 与耳放固化为单一产品,无法独立更换。当技术标准演进(如 USB 协议升级、新 DAC 芯片发布)或耳机需求改变时,用户通常需整体更换设备。


决策框架

物理维度分体优势分体代价一体优势一体代价
电源耦合独立电源,切断共享阻抗两套电源成本、体积单电源,内部 LDO/分区可抑制大部分耦合高频纹波可能穿透
热耦合大热源远离热敏感元件占用更多桌面空间紧凑,但需热设计温度梯度难以完全消除
电磁耦合大电流环与敏感前端物理分离外部线缆成为射频天线内部走线可控,环路面积小内部空间受限,布局困难
机械振动变压器振动不传导至 DAC—振动源与敏感元件共壳需隔振设计
信号连续性被破坏(连接器+线缆)接触电阻、热电效应、分布参数PCB 铜箔直连,最优—
地环路—暴露于建筑配线电位差内部地平面可控—
电平匹配受限于 2 Vrms/4 Vrms 标准增益冗余、衰减损失内部自由优化—
升级灵活性高(模块化)—低—

选择逻辑:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
耳放静态功耗 > 20 W 或 输出电流 > 1 A?
    ├── 是 → 分体(热与电源隔离成为硬需求)
    └── 否 → 继续判断

DAC 时钟对温度/磁场极度敏感(如外接原子钟、分立 R-2R NOS)?
    ├── 是 → 分体(电磁与热隔离优先)
    └── 否 → 继续判断

追求模块化升级或已有投资保护?
    ├── 是 → 分体
    └── 否 → 一体机(信号完整性与电平匹配更优)

分体的不可替代性体现在大功率、大热耗散、高电磁干扰场景下。当物理耦合(热传导、磁场衰减、电源阻抗隔离)无法在单一体内部通过布局与屏蔽充分解决时,分体成为工程上的必然选择。

然而,对于中等功率(<10 W)、现代高集成度 DAC 的应用场景,一体机通过优化的 PCB 分区、独立电源层与电平自由匹配,可以在信号连续性、接地简洁性与体积效率上实现更优的系统级表现。

发烧文化中“分体一定更好”的判断,混淆了“必要时的不可替代性”与“普遍时的优越性”。分体不是普遍更优的拓扑,而是在特定物理约束下的必要工程解;一体也不是“妥协”,而是在另一组约束下的最优集成。最终选择应基于可测量的物理需求,而非审美等级。


完整信号流

从 DAC 输出到耳机:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
                 模拟域
┌───────────────────────────────────────────────┐
│                                               │
│  DAC 输出                                      │
│      │                                        │
│      ▼                                        │
│  I/V / 模拟输出级                               │
│      │                                        │
│      ▼                                        │
│  输入缓冲 / 前级                                │
│      │                                        │
│      ▼                                        │
│  音量控制 / 衰减                                │
│      │                                        │
│      ▼                                        │
│  电压增益级                                    │
│      │                                        │
│      ▼                                        │
│  驱动级 / 电流增益                              │
│      │                                        │
│      ▼                                        │
│  输出级                                        │
│      │                                        │
│      ▼                                        │
│  输出阻抗                                      │
│      │                                        │
└──────┼────────────────────────────────────────┘
       ▼
     耳机
       │
       ▼
   电-机械-声学转换
       │
       ▼
      人耳

如果采用平衡结构:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
DAC
 │
 ├──────── L+
 │
 ├──────── L-
 │
 ├──────── R+
 │
 └──────── R-
        │
        ▼
   差分放大 / 输出级
        │
        ▼
   平衡耳机

而如果内部采用单端转换:

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
XLR
 │
 ▼
差分 → 单端
 │
 ▼
单端放大
 │
 ▼
单端 → 差分
 │
 ▼
XLR / 平衡耳机

那么接口是平衡的,但整个内部信号路径并不一定是全差分。

关键物理量总结

物理量 / 指标物理意义主要决定因素对耳放性能的主要影响
电压增益 $G_v$输出电压与输入电压之比反馈网络、拓扑决定最大输出与音量控制范围
最大输出电压 $V_{max}$保持线性的最大电压摆幅电源电压、输出级决定高阻耳机的驱动能力
最大输出电流 $I_{max}$保持线性的最大电流输出晶体管、偏置、电源决定低阻耳机的驱动能力
输出功率 $P$向耳机负载提供的功率$V$、$I$、负载阻抗决定大动态下的输出余量
输入灵敏度达到最大输出所需输入电平增益、最大摆幅决定系统是否需要前级增益
削波电压输出进入明显非线性的临界点电源轨、输出级决定最大无失真输出
输出阻抗 $R_{out}$耳放等效输出源阻抗输出级、反馈影响电压分配、频响和阻尼
阻尼系数 $DF$负载阻抗与输出阻抗之比$Z_{HP}/R_{out}$反映电气耦合强弱
压摆率 $SR$输出电压最大变化速率内部电流、补偿电容决定大信号瞬态能力
上升时间 $t_r$输出跟随阶跃输入的速度压摆率、带宽影响瞬态波形保真度
THD谐波失真器件非线性、反馈、偏置衡量非线性
IMD互调失真多频信号下的非线性更接近复杂音乐信号下的非线性表现
SNR信号与噪声之比噪声源、增益、带宽决定低电平信号的干净程度
输出噪声无输入时的残余输出电源、器件、布局、反馈对高灵敏耳机尤其重要
带宽放大器保持规定增益的频率范围器件、补偿、反馈决定频响与瞬态能力
增益带宽积 $GBW$增益与带宽的乘积器件、补偿反映放大器的速度能力
相位裕度 $PM$反馈环路距离不稳定状态的余量环路补偿、负载决定稳定性与振铃倾向
增益裕度 $GM$相位达到 -180° 时增益的余量环路补偿决定稳定性
PSRR电源扰动被抑制的能力拓扑、反馈、稳压决定电源纹波是否进入输出
CMRR共模信号被抑制的能力器件匹配、拓扑决定平衡结构的串扰抑制
串扰一个声道进入另一个声道的程度接地、供电、PCB、拓扑影响声道分离
静态功耗无信号时消耗的功率偏置、Class A 工作点决定发热和效率
效率输出功率 / 输入电功率Class A/AB/D 等拓扑决定散热与体积
衰减量音量控制降低的电平电位器、继电器、数字 DSP决定实际工作电平和调节范围
电压余量当前输出距离削波的余量增益、输入电平、电源决定动态峰值是否削波
电流余量当前负载电流距离极限的余量输出级、电源、负载决定低阻大动态能力

核心结论

耳放的本质是DAC与耳机之间的电气接口,其任务不是“增加音质”,而是将模拟电压以足够低的噪声、失真和输出阻抗转换为耳机所需的电压与电流。所谓“推响”可还原为能否在不削波、不限流的前提下提供足够的最大输出电压与电流;对绝大多数耳机,85–90 dB SPL长期平均声压仅需数百毫瓦,真正需警惕的是极少数低阻低敏耳机的峰值电流需求。“推好”则要求在此前提下保持低THD/IMD、低输出阻抗,并在复杂负载与瞬态下稳定工作。

负反馈是用开环增益换取线性度、带宽与低输出阻抗的工程工具,所谓“零反馈”通常仅缺全局反馈,电路内部几乎必然存在局部反馈。历史上对瞬态互调失真(TIM)的争议,实质是放大器压摆率与开环带宽不足以支持反馈环路及时修正大信号误差,而非负反馈概念本身的缺陷。压摆率描述的是输出电压变化的速度极限,与小信号带宽独立;真实音乐多频叠加后的瞬时斜率可能远超单频理论值,不足时波形被斜化,反馈暂时失效,THD与IMD急剧上升。

集成运放、分立晶体管与电子管之间不存在绝对的音质等级,它们是在一致性、电流能力、电压摆幅与设计自由度之间的工程选择。电子管在静电耳放中的常见性源于高压匹配,而非晶体管无法胜任。电源的任务是提供稳定、低噪声、低阻抗的能量,线性电源与开关电源无绝对的“音质等级”,关键看纹波频谱、PSRR与接地设计。分体与一体同样不存在普遍的优劣:分体在大功率、大热耗散与高电磁干扰场景下具有不可替代的隔离优势;一体则在信号路径连续性、电平匹配自由度与接地简洁性上更优。最终,耳放的评价应回归一组可验证的物理指标——增益结构、最大输出能力、压摆率、输出阻抗、THD/IMD、噪声、带宽与稳定性——而非任何发烧标签或拓扑审美。

参考资料:

1.Jason Stoddard, The Most Abused Audio Terms: “Class A”

https://www.head-fi.org/threads/schiit-happened-the-story-of-the-worlds-most-improbable-start-up.701900/page-7224#post-17354025

2.Jason Stoddard, The Most Abused Audio Terms, Part 2: Balanced

https://www.head-fi.org/threads/schiit-happened-the-story-of-the-worlds-most-improbable-start-up.701900/page-7786#post-17518152

3.Jason Stoddard, The Most Abused Audio Terms, Part 3: Discrete

https://www.head-fi.org/threads/schiit-happened-the-story-of-the-worlds-most-improbable-start-up.701900/page-7997#post-17603364

4.Jason Stoddard, The Most Abused Audio Terms, Part 4: Feedback

https://www.head-fi.org/threads/schiit-happened-the-story-of-the-worlds-most-improbable-start-up.701900/page-9040#post-17911208

5.Jason Stoddard, The Most Abused Audio Terms, Part 5: Gain

https://www.head-fi.org/threads/schiit-happened-the-story-of-the-worlds-most-improbable-start-up.701900/page-10356#post-18185665

6.Roon Labs, Volume Leveling / Audio Analysis

https://help.roonlabs.com/portal/en/kb/articles/faq-what-s-volume-leveling

7.Roon Labs, Dynamic Range

https://help.roonlabs.com/portal/en/kb/articles/dynamic-range

8.Apple Support, Sound Check

https://support.apple.com/en-us/109331

9.Matt Otten, TIM (Transient Intermodulation Distortion) Analysis

https://www.mattott.com/audio/tim-distortion

10.Walt Jung, Op Amp Applications Handbook, Analog Devices, 2005

11.Bob Cordell, Designing Audio Power Amplifiers, 2nd Edition, 2019

12.Douglas Self, Small Signal Audio Design, 3rd Edition, 2020

13.Douglas Self, Audio Power Amplifier Design, 6th Edition, 2013

14.ISO 226:2003, Acoustics - Normal equal-loudness-level contours

脑放

「脑放」是全文信号链的最后一个环节,也是最诚实的环节:前面所有章节讨论的客观性能,最终都要经过人脑这个非线性、带预期、可被暗示的感知系统。理解脑放,是理解一切发烧争论的前提。

听觉是一种推断,不是录音

感知并非对物理世界的直接复制。大脑会根据先验、上下文与期望,对听觉输入做实时重构:

  • 掩蔽效应:强音遮蔽频率邻近的弱音(同时掩蔽)与时间相邻的弱音(时域掩蔽);
  • 听觉补全:被噪声短暂掩蔽的声音会被大脑"脑补"出来(听觉连续性效应);
  • 期望调制:当听者知道自己在听"贵"的设备时,主观愉悦度与"细节感"评分会显著上升——即使设备根本没换。

安慰剂效应不是贬义词,是实验事实

盲听实验中反复出现的结果是:当价格、品牌、外观被隐藏之后,“一耳朵差距"在统计上消失;反之,同一台设备贴上不同标签,听者能稳定地"听出"差异。神经科学中著名的葡萄酒定价实验(同一款酒标注不同价格时,fMRI 显示奖赏中枢的激活程度不同)在音频领域有完全同构的现象。

承认脑放的存在并不丢人——它是感知系统的固有特性,对所有人都成立,包括老烧,也包括笔者。

ABX 与双盲测试:方法论要点

要验证"到底能不能听出区别”,唯一可信的方法是受控盲听:

  1. 随机双盲:设备身份对听者与主试同时隐藏;
  2. 电平匹配:匹配到 0.1dB 以内——电平差 0.2dB 就足以稳定产生"更好听"的偏好;
  3. 快速切换:听觉回声记忆只有几秒,漫长的 A/B 间隔会让精细比较失效;
  4. 统计功效:16 次 ABX 试验答对 12 次以上(p<0.05)才算通过。样本量不足时,“听不出"不代表无差异,“听得出"也可能只是运气;
  5. 训练效应:经过训练的听音员能稳定检出普通人听不出的失真——所以"你听不出是因为木耳"与"我能听出所以差异存在"都不构成证据,数据才是。

关键 JND(最小可觉差)参考值

维度大致阈值说明
频率辨差中频约 0.2%–0.5%随频率与声压级变化
电平辨差约 0.2–1dB中频、宽带信号下更敏感
谐波失真约 0.1%–1%低阶偶次更宽容,高阶奇次更刺耳,依节目类型差异大
群延迟低频约 1.5–3ms,高频更宽松频响峰谷远比群延迟更容易被听出
时钟抖动纯音约 10ns 量级,音乐节目高出 1–2 个数量级现代设备远在阈值之下

脑放的核心教训:人不是测量仪器。要评价设备,用仪器;要评价听感,用盲听。把两者混为一谈,正是一切玄学的起点。

解构烧友语言

辨析科学 HiFi

批判发烧文化

展望未来

解放思想,实事求是,团结一致向前看!

Licensed under CC BY-NC-SA 4.0
comments powered by Disqus