从神经音频 Codec 到音频语言模型
过去几年,音频人工智能的叙事发生了一个容易被忽略的变化:研究对象表面上仍然是声音,真正被优化的目标却已经从“压缩后听起来像不像”,逐步转向“声音能否成为语言模型容易学习、稳定预测并支持理解与生成的 token”。
本文以 250 篇主题化筛选论文和 20 篇技术里程碑论文为证据库,重点精读了其中与神经音频 codec、离散 token、音乐生成和音频基础模型关系最密切的工作,并把它们与一项高采样率钢琴音频实验 SR-BFT(Sample-Rate Band-Factorized Tokenizer)的锁定结果交叉分析。最终得到的认识不是“某个新模型又超过了某个基线”,而是:音频重建、感知质量、语义可用性、token 可预测性和物理频带保真是彼此相关、却不能互相替代的目标。 SR-BFT 恰好暴露了把这些目标混为一谈会造成什么后果。
第一条主线:Codec 从压缩器变成了模型接口
1. Waveform 时代解决“怎样生成”,Codec 时代解决“怎样表示”
WaveNet 证明了原始波形可以被神经生成模型直接建模,但逐采样点自回归的计算代价很高。随后 Jukebox 用三级 VQ-VAE 把 44.1 kHz 音乐压缩到不同时间尺度的离散代码,再用层级 Transformer 处理分钟级结构。它也很早就遇到了后来反复出现的问题:码本塌缩、长序列和不同抽象层之间的信息分配。
SoundStream 把卷积编码器、RVQ、生成式解码器和感知/对抗损失整合成端到端 codec,并通过 quantizer dropout 让同一模型支持 3—18 kb/s 的可变码率。EnCodec 进一步覆盖 24 kHz 单声道和 48 kHz 立体声,并用语言模型熵编码降低约 20%—30% 的传输带宽。
这一时期的主问题仍然是率失真、主观音质、延迟和实时性。然而 EnCodec 已经显露出高采样率的系统代价:24 kHz 模型产生每秒 75 个 latent frame,48 kHz 模型增加到每秒 150 个;48 kHz 非流式版本还引入约 1 秒初始延迟。论文报告其 CPU 熵编码实时因子低于 1(即仍快于实时),但这项额外处理并非没有计算代价。如果只提高采样率而保持类似的下采样结构,token 序列与计算成本可能同时增长。
2. AudioLM 之后,压缩率不再是唯一目标
AudioLM 把低帧率语义 token 与 SoundStream 声学 token 结合:前者负责长期语言或音乐结构,后者负责音色和局部细节。MusicGen 则展示了如何通过 codebook delay/interleaving pattern,用单个 Transformer 建模 EnCodec 的多路 RVQ token。
从这里开始,codec 不再只是传输链路中的压缩器,而成为音频语言模型的“词表与分词器”。这带来了一个根本变化:
对压缩器有利的表示,不一定对语言模型有利;重建相同声音的多个 token 序列,也会增加下一 token 预测的不确定性。
Analyzing and Mitigating Inconsistency in Discrete Audio Tokens 将这一现象称为离散表征不一致性(DRI):完全相同的音频片段,仅因为是否带上下文,就可能被编码成差异很大的 token;而且 RVQ 越深,不一致越明显。论文通过切片一致性和扰动一致性约束改善 token 稳定性,并报告了下游 VALL-E 的 WER 和说话人相似度收益。
这对跨采样率 tokenizer 很重要。即使 44.1、96 和 192 kHz 视图来自同一母版,如果基带 token 会随输入上下文、滤波边界或采样网格变化,所谓“共享基带表示”仍可能只在结构图上成立,未必在离散序列上成立。
第二条主线:音频 Tokenizer 至少有四个评价坐标
近年的比较研究共同指向一个结论:不存在一个“音频质量分数”可以代表所有用途。
| 评价坐标 | 它回答的问题 | 常见指标 | 容易出现的误判 |
|---|---|---|---|
| 信号重建 | 波形或频谱还原得多接近 | SI-SNR、LSD、MR-STFT、Mel distance | 高频能量很低时,全带指标看不见高频改善 |
| 感知质量 | 人是否认为声音自然、无明显伪影 | MUSHRA、MOS、ViSQOL、PESQ | 无听测时用代理指标推断可听性 |
| 语义与任务信息 | token 是否保留内容、说话人、音乐结构 | WER、分类准确率、检索、speaker similarity | 重建好不等于语义好,反之亦然 |
| 序列可学习性 | 语言模型是否容易稳定预测 token | perplexity、NLL、token consistency、生成重复/遗漏 | 只测 codec 重建上限,不测生成模型实际表现 |
DASB 在统一任务上比较声学、语义与混合 token,发现语义 token 通常更适合识别和生成任务,声学 codec 则更擅长保留说话人等细粒度信息;在通用音频和音乐任务中,EnCodec 的表现又可能优于其他 token。它说明“最优 tokenizer”必须带着任务限定词。
ESPnet-Codec 的结果更值得警惕:更换训练数据规模和领域会改变 SoundStream、EnCodec、DAC 的相对排名;codec 重建指标与 ASR、TTS、说话人、分离和歌声合成表现只有较弱对应关系。换句话说,离线重建榜首不是下游任务的充分条件。
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation 也发现,若只看重建,若干 codec 的 WER 接近;放进 AR+NAR 语音生成系统后,基线 codec 的 WER 却可能显著恶化。codec 的 token 分布、第一层语义信息和模型可预测性都在发挥作用。
2026 年的 LLM-Codec 更直接地把未来 token 预测和语义对齐加入 codec 训练。其消融声称,重建改善主要来自更强的 GAN/多尺度训练流程,而 perplexity 与语言建模收益来自 LLM-facing objectives;两类收益相互独立。这一结论目前仍需要跨域和更完整的消融验证,但研究方向是合理的:tokenizer 的训练目标必须包含它未来被怎样使用。
第三条主线:“可伸缩”其实包含多个不同问题
把近年的工作放在一起,可以看到至少五种互不等价的可伸缩性:
- 码率可伸缩: SoundStream、EnCodec 通过 RVQ 层数或 quantizer dropout 控制每秒发送多少 bit。
- 时间分辨率可伸缩: DualCodec 和 DiffSoundStream 把 frame rate 降到 12.5/25 Hz,用更多码本、语义条件或生成式解码器弥补信息损失。
- 语义—声学容量可伸缩: OmniCodec、UniAudio 2.0 与 EntangleCodec 分别尝试解耦、因子化或重新纠缠语义与声学信息,以统一理解和生成任务。
- 模型与数据规模可伸缩: MOSS-Audio-Tokenizer 采用 24 kHz、12.5 Hz frame rate、32 层 RVQ,在 300 万小时数据上扩展到 16 亿参数,并支持 0.125—4 kb/s。它代表“用规模换通用接口”的路线,但训练成本远超一般研究资源。
- 声道可伸缩: VCNAC 用同一模型和共享码本处理单声道、立体声与 5.1 声道,在 48 kHz、25 Hz frame rate 下显式评价 IPD/ILD 等空间线索。
SR-BFT 探索的是第六种:物理频带与输入采样率可伸缩。它不是简单地减少 RVQ 层数,而是要求基础 bitstream 能在不同采样率上共享,再按需发送 44.1→96 kHz 和 96→192 kHz 的增强频带。
这与码率可伸缩有相似形式,却有不同约束:新增 token 必须对应可解释的物理频带;同一母版的不同采样率视图必须严格配对;滤波器过渡带、相位和时间对齐都可能改变结果。现有证据库对 16—48 kHz 语音和音乐覆盖很多,对 96/192 kHz、真实扩展带以及跨采样率 token 一致性的直接证据却很少。
高采样率实验首先是数据真实性问题
在 6,978 个可读取的立体声 FLAC、471.7 小时音频中,文件夹标签并不等于文件事实:275 个文件的目录声明与文件头不一致,另有解码异常、精确重复和跨语料近重复。
更关键的是,采样率也不等于有效带宽:
- 1,014 个实际 192 kHz 文件中,只有 314 个(约 31.0%)具有 44.1—80 kHz 的扩展能量证据。
- 1,941 个实际 96 kHz 文件中,只有 161 个(约 8.3%)具有 24—40 kHz 的扩展证据。
这些扩展能量还不能自动解释为“可听音乐信息”:它可能来自乐器瞬态与高阶泛音,也可能是设备噪声、调制噪声或上采样伪影。因此研究中使用“扩展带信号保真”,而不直接使用“高解析听感更好”。
三个原生 44.1/96/192 kHz 目录还包含不同曲目、演奏和发行源,不能直接比较后宣称采样率造成差异。主实验必须从同一个 192 kHz 母版内部生成 44.1、96、192 kHz 视图;96 kHz 次级实验也只在每个母版内部构造 44.1/96 kHz 对。这个设计选择比更换模型结构更重要,因为它决定了因果比较是否成立。
SR-BFT 做对了什么,又失败在哪里
SR-BFT 把信号拆成三个离散分支:
1 | x_192 -> x_96 -> x_44 |
基础 token 服务全部采样率,E1 和 E2 是可选增强层。三档 bitstream 对应 8/12/16 kb/s,并使用同一母版共享的可逆电平归一化,避免对每个视图独立调节电平。
192 kHz 主实验:频带定向成功,全带率失真失败
在 24 首录音、72 个固定片段上:
- SR-BFT 8/12/16 kb/s 的录音级中位全带 SNR 为 9.91/9.91/10.02 dB。
- 统一 192 kHz 模型在 16 kb/s 达到 12.18 dB;SR-BFT-16 配对低 2.24 dB,95% CI 为 -2.45 至 -1.85 dB。
- 但 SR-BFT-16 在 44.1—80 kHz 的误差功率比统一模型低 6.90 dB,95% CI 为 5.74—8.07 dB。
- 与此同时,0—8 kHz 误差高 2.36 dB。
这些结果并不矛盾。全带 SNR 被能量占比最高的低频主导;扩展带即使明显改善,也可能无法抵消基带很小的退化。SR-BFT 证明了可以把有限 bit 定向分配给扩展频带,却没有证明这种分配带来更好的整体率失真。
而且三分支累计约 44.4M 参数,统一模型约 15.3M 参数。两者控制了码率、100 Hz token 时钟和骨干族,却没有做到参数量匹配。当前证据因而不能支持“计算更高效”或“模型容量更省”的主张。
96 kHz 次级实验:LSD 大幅改善,波形几乎没有改善
在 11 首独立原生 96 kHz 录音、33 个片段上,加入 E1 后:
- 全带 SNR 的配对中位差仅 -0.00002 dB,95% CI 为 -0.00034 至 0.00683 dB,Holm 校正后
p=1.0。 - 24—40 kHz LSD 改善 97.80 dB。
- 40—44.1 kHz 与 44.1—48 kHz 的波形误差功率反而分别增加 14.55 dB 和 13.82 dB。
最合理的解释是:E1 学会恢复了目标频带的幅度谱覆盖,却没有恢复相位与时间一致的残差波形。LSD 主要观察对数幅度,无法保证瞬时相位、群时延和跨频带瞬态对齐。
这一失败与 High-Fidelity Music Vocoder using Neural Audio Codecs 的观察相呼应:从 mel 频谱逼近 DAC 离散表示时,缺失相位会限制低维 token 的恢复;该工作最终依赖更高维连续 latent、包含实部/虚部的频谱判别器以及解码器微调。对高采样率增强带而言,相位问题只会更尖锐,因为目标残差能量低、对滤波边界和微小时间偏差非常敏感。
这次实验真正支持的结论
可以支持的主张有四条:
- 同源配对是必要条件。 不同采样率目录不能直接构成采样率因果实验。
- 文件头采样率不能替代有效带宽审计。 大量高采样率文件并没有明确扩展带证据。
- SR-BFT 提供了结构化的频带访问。 8/12/16 kb/s bitstream 可以按需增加物理频带,并把误差预算定向转移到 44.1—80 kHz。
- 幅度谱恢复不等于波形恢复。 LSD 必须与复数谱、分带波形误差和时间一致性指标共同报告。
当前不能支持的主张同样重要:
- 不能声称 SR-BFT 优于统一模型的全带率失真。
- 不能声称扩展频带改善具有可听优势,因为尚未执行合格的盲听实验。
- 不能声称部署更高效,因为没有熵编码后的实际码率、峰值显存和匹配实现的实时因子。
- 不能声称 token 更适合语言模型,因为跨率 token 稳定性和固定容量下游 LM 尚未完成。
- 不能把官方 DAC、EnCodec 的公开检查点差异解释为受控架构消融。
把负面结果保留下来,比换一组指标包装成“全面领先”更有研究价值。它明确指出了下一轮模型需要优化什么,而不是只说明需要更大的网络。
下一轮研究:从频带金字塔转向相位一致的可学习接口
基于文献与冻结实验,后续工作应按以下顺序推进。
1. 先修正增强层目标,而不是继续调测试集
在验证集上预注册比较:
- 时间域 L1 + 多分辨率复数 STFT;
- 幅度、相位或群时延的分离权重;
- 跨带瞬态对齐与 pre-ringing 指标;
- 线性末层与相位感知生成解码器;
- E1/E2 与相邻基带的边界一致性损失。
只有验证数据同时支持频谱和波形改善,才重新打开锁定测试。不能根据当前测试结果反向挑选最有利的损失函数。
2. 把 token 稳定性变成一等指标
借鉴 DRI 工作,应比较同一母版在不同采样率视图中的:
- base token edit distance;
- soft assignment 的 JS divergence;
- 切片边界与上下文变化下的一致性;
- 微小重采样滤波、增益和相位扰动下的稳定性;
- 各 RVQ 层的 occupancy、entropy efficiency 与增量率失真收益。
如果 base token 在 44.1/96/192 kHz 之间不稳定,SR-BFT 仍然只是三个解码路径的拼接,而不是严格共享的跨率语言模型接口。
3. 区分标称码率、熵码率和语言模型成本
SoundStream/EnCodec 已经说明 RVQ 层数只是标称码率的一部分,熵模型还能显著改变实际 bitstream。另一方面,低 frame rate 可能降低时间步数,却增加每帧 codebook 数和预测难度。因此至少需要同时报告:
- 原始 token kb/s;
- 熵编码后的实际 kb/s;
- 每秒 token 数与并行 codebook 数;
- 固定规模 Transformer 的 NLL/perplexity;
- 编解码 RTF、峰值显存和端到端延迟。
4. 做参数、计算与数据真正匹配的消融
新的统一基线需要与 SR-BFT 匹配总参数、训练音频秒数、优化步数、感受野和码率。还应增加“统一模型 + 分带损失”这一关键对照,以判断收益来自分支结构,还是仅来自对高频赋予更大权重。
5. 最后才讨论可听性
20 kHz 以上的物理重建收益不能自动转化为听感收益。应将标准带宽 codec MUSHRA 与高解析 ABX 分开,先审核播放链、换能器带宽、听力筛查、音量匹配和样本功效。听测片段与假设必须在客观结果锁定后预注册,避免只选择最容易听出差异的片段。
阅读音频 Tokenizer 论文时,我现在会先问什么
面对新的 SOTA 数字,下面这组问题比模型名称更重要:
- 输入是 16、24、44.1 还是 48 kHz?真实有效带宽是什么?
- 码率是标称 token 码率,还是熵编码后的实际码率?
- frame rate、codebook 数和 codebook size 分别是多少?
- 是声学、语义还是混合 token?是否依赖外部 SSL/ASR 教师?
- codec 训练数据与下游任务数据是否同域?
- 重建指标、主观指标与下游指标是否给出相互矛盾的结论?
- token 对切片、上下文、增益、重采样和轻微扰动是否稳定?
- 比较是否匹配了参数、训练量、采样率、声道、码率和延迟?
- 论文是经过同行评审的正式版本,还是尚未稳定的预印本?
- 作者没有完成或主动承认的实验是什么?
结语
梳理这些工作后,我不再把音频 tokenizer 看成“把波形变成整数序列”的前处理模块。它实际上决定了模型能看见什么、必须预测什么、哪些细节被视为噪声,以及生成错误会以怎样的形式返回到声音中。
SR-BFT 的首轮结果没有证明分层结构优于统一 codec,但它回答了一个更基础的问题:我们可以定向购买扩展频带,却会为此牺牲基带率失真;我们可以恢复频谱覆盖,却未必恢复相位一致的波形。这两个冲突不是实验中的尴尬细节,而是高采样率离散表征真正需要解决的科学问题。
下一步的目标不应是再寻找一个更漂亮的单一分数,而是建立一个同时尊重物理信号、听觉感知和语言模型学习规律的评价闭环。
代表性参考文献
- Zeghidour et al., SoundStream: An End-to-End Neural Audio Codec, 2021.
- Défossez et al., High Fidelity Neural Audio Compression, 2022/2023.
- Borsos et al., AudioLM: A Language Modeling Approach to Audio Generation, 2022/2023.
- Copet et al., Simple and Controllable Music Generation, 2023.
- Mousavi et al., DASB - Discrete Audio and Speech Benchmark, 2024/2026.
- Ye et al., Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model, 2024.
- Li et al., Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation, 2024.
- Shi et al., ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech, 2024.
- Liu et al., Analyzing and Mitigating Inconsistency in Discrete Audio Tokens, 2024.
- Lanzendörfer et al., High-Fidelity Music Vocoder using Neural Audio Codecs, 2025.
- Li et al., DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec, 2025.
- Yang et al., DiffSoundStream: Efficient Speech Tokenization via Diffusion Decoding, 2025.
- Grötschla et al., VCNAC: A Variable-Channel Neural Audio Codec for Mono, Stereo, and Surround Sound, 2026.
- Gong et al., MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models, 2026.
- Hu et al., OmniCodec: Low Frame Rate Universal Audio Codec with Semantic-Acoustic Disentanglement, 2026.
- Chung et al., LLM-Codec: Neural Audio Codec Meets Language Model Objectives, 2026.
- Li et al., EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement, 2026.
本文是一份个人研究笔记,不将预印本结果视为已被独立复现的事实。实验数字来自冻结评测协议;在新增种子、相位感知消融、实际熵码率和听测完成前,结论保持上述边界。