从神经音频 Codec 到音频语言模型
过去几年,音频人工智能的叙事发生了一个容易被忽略的变化:研究对象表面上仍然是声音,真正被优化的目标却已经从“压缩后听起来像不像”,逐步转向“声音能否成为语言模型容易学习、稳定预测并支持理解与生成的 token”。
本文以 250 篇主题化筛选论文和 20 篇技术里程碑论文为证据库,重点精读了其中与神经音频 codec、离散 token、音乐生成和音频基础模型关系最密切的工作,并把它们与一项高采样率钢琴音频实验 SR-BFT(Sample-Rate Band-Factorized Tokenizer)的锁定结果交叉分析。最终得到的认识不是“某个新模型又超过了某个基线”,而是:音频重建、感知质量、语义可用性、token 可预测性和物理频带保真是彼此相关、却不能互相替代的目标。 SR-BFT 恰好暴露了把这些目标混为一谈会造成什么后果。


