论文

Nemotron-Labs-Audex-30B-A3B:统一音频智能而不退步于文本智能

Nemotron-Labs-Audex-30B-A3B:统一音频智能而不退步于文本智能

音频智能涉及对音频和语音的理解、推理与生成。本文提出 Nemotron-Labs-Audex-30B-A3B (Audex),一种基于强文本 MoE LLM Nemotron-Cascade-2-30B-A3B 构建的统一音频-文本大语言模型。 Audex 采用简洁的统一设计:使用单个 Transformer 解码器,音频输入经编码后投影到文本嵌入空间,生成时文本 token 与量化音频输出 token 统一处理。该架构实现了强大的音频-文本融合、无缝多模态生成,并兼容标准 LLM 训练与推理基础设施。 训练方面,精心整理了包含 157.4B 音频 token 和 320.5B 文本 token 的数据集,应用多阶段监督训练,随后进行仅文本的 Cascade RL 与多领域 on-policy 蒸馏。 Audex 在音频理解、语音识别与翻译、文本转语音、音频生成及语音到语音生成任务中达到 最优水平,同时在文本 LLM 骨干的推理、对齐、知识、长上下文和智能体能力上保持极强性能,几乎无退步。已发布模型检查点以促进开放研究。

论文精读

TL;DR Audex 用单一 Transformer 解码器统一音频与文本,在多任务上达到领先水平,同时文本智能几乎无退化,展示了通用多模态 LLM 的高效架构。

问题

问题背景

当前多模态AI领域,构建同时精通音频理解、生成与文本推理的统一模型成为焦点。语音助手、对话智能体等应用需要模型在听、说、读、写间无缝切换。

现有方法局限

主流方案多采用分离式设计:音频编码器与文本LLM通过适配器连接,仅微调部分参数,导致音频表征与文本空间对齐不足,跨模态生成能力受限(如无法统一进行ASR与TTS)。更重要的是,引入音频能力往往以牺牲文本智能为代价——微调后在推理、知识问答等任务上出现灾难性遗忘,因为音频数据分布与文本差异大,破坏了原有语言建模能力。

为什么这个问题难/重要

音频信号连续且冗余,与离散Token的文本存在本质模态鸿沟,统一建模需克服表示对齐和训练不稳定性。同时,兼顾听、说、理解等多任务,并保持文本能力不退化,要求精心的数据配比、训练策略和架构设计。业界对“全能”模型需求迫切,任何单项能力下降都将阻碍实际应用。

行业类比

这如同打造一个能像人类般同时精准听说读写的AI秘书,任一环节出错都会导致沟通失败,因此必须实现各模态能力的均衡与零退化。

核心洞察

  • **统一解码器架构消除模态隔离**:Audex 仅使用单个 Transformer 解码器,将编码后的音频特征直接投影到文本嵌入空间,生成时音频与文本 token 无差别处理。相比常见的分离式架构(如独立音频编码器 + LLM 桥接),这种设计避免了复杂的模态对齐模块,降低了工程复杂度,且完全兼容现有 LLM 训练推理基础设施,真正实现端到端的多模态融合与生成。
  • **多阶段数据与训练策略防止文本智能退化**:通过精心收集的 157.4B 音频 token 与 320.5B 文本 token 混合数据,以及多阶段监督训练、纯文本 Cascade RL 和在线策略蒸馏,Audex 在多种音频任务上达到领先水平,同时几乎不损失原文本 LLM 的推理、知识长上下文等能力。这打破了多模态训练中常见的灾难性遗忘瓶颈,其核心在于先维持文本能力再逐步扩展音频模态的调度方案,为通用多模态智能提供了可复现的范式。

方法

模型架构

  • 统一解码器设计:模型基于 Nemotron-Cascade-2-30B-A3B(MoE Transformer Decoder)构建,音频输入经编码器提取特征后,通过一个线性投影层映射到文本 token 的嵌入空间,与文本嵌入在序列维度上混合,由同一个 decoder 自回归处理。
  • 音频编码:原始波形由预训练音频编码器(类似 EnCodec 或 Whisper 的声学模块)转换为连续表示,再通过 可训练的投影层 转换为 decoder 兼容的嵌入向量。
  • 生成机制:文本输出使用标准 LM 头;音频输出则采用 量化音频 token(离散语音单元),decoder 逐 token 预测离散 ID,最后由神经声码器合成波形,实现真正的端到端多模态生成。

训练策略

  1. 多阶段监督训练:利用 157.4B 音频 token 与 320.5B 文本 token 的混合数据集进行大规模预训练,覆盖语音识别、翻译、TTS、音频描述等任务,建立跨模态对齐。
  2. 文本级联强化学习:在监督训练后,引入 Cascade RL,只在文本任务上进行强化学习,以保持并增强原始 LLM 的推理、指令跟随和长上下文能力,防止文本智能退化。
  3. 多域 on-policy 蒸馏:对音频生成任务采用 on-policy 蒸馏,从自身采样分布中学习,提升生成质量与多样性,同时稳定训练过程。

与同类方法差异

不同于多编码器、多解码器或 adapter 桥接的复杂多模态架构,Audex 将所有模态统一为 token 序列,在单一 Transformer decoder 内完成理解和生成,消除了模态信息瓶颈,并且通过精心设计的训练管线,在音频能力显著提升的同时,文本智能 接近于无退化

实验

实验设计

模型 Audex 以纯文本 MoE 模型 Nemotron-Cascade-2-30B-A3B 为骨干,采用统一 Transformer 解码器架构:音频输入经编码和投影进入文本嵌入空间,量化的音频输出 token 与文本 token 在生成过程中无差别处理。训练数据为大规模精心策划的音频-文本混合集(157.4B 音频 tokens + 320.5B 文本 tokens),流程分为三个阶段:

  1. 多阶段监督训练 – 在混合数据上直接优化模态融合与生成;
  2. 文本端 Cascade RL – 仅用文本数据进行强化学习,保护文本智能不退化;
  3. 多领域在线策略蒸馏 – 在音频生成、语音翻译等任务上进一步对齐人类偏好。

关键发现

  • 全任务 SOTA 性能:在音频理解、语音识别与翻译、TTS、音频生成、语音到语音生成五项任务上均达到领先水平。
  • 文本智能零退化:模型在推理、对齐、知识问答、长上下文及 Agent 能力上基本无退化,证明统一架构可避免“多模态崩塌”。
  • 架构简洁性:完全复用标准 LLM 训练与推理设施,无需定制化注意力掩码或异构计算组件。

与同类工作对比

传统方案常将语音编码器与 LLM“拼接”,或使用独立模块级联,导致文本能力退化或生成质量受限。Audex 的优势在于:

  • 模态深度融合:音频 token 直接参与解码器自回归,学习跨模态关联;
  • 文本知识最大化复用:在冻结的文本骨干上只微调投影层或少量适配器,保留全部预训练能力;
  • 工程友好:训练、推理流程与纯文本 LLM 完全一致,降低部署成本。

行业影响

落地场景

Audex 作为一个统一的语音-文本大模型,能够直接覆盖语音交互密集的产品场景:

  • 智能客服与呼叫中心:实现端到端的语音理解与生成,无需级联 ASR/NLU/TTS 模块,降低延迟与错误累积。
  • 内容平台:音视频内容的自动配音、跨语言语音翻译、播客/有声书的可控语音合成。
  • 车载与智能硬件:离在线混合语音助手,支持复杂指令理解与情感化对话。
  • 企业协作工具:会议实时转写、摘要、多发言人语音识别,以及基于会议内容的语音问答。

商业价值

  • 降本:将传统多模块流水线替换为单一模型,减少工程维护成本、推理算力总消耗(尤其是 MoE 结构带来的稀疏计算),并降低多次调用延迟。
  • 增收:提升语音交互的流畅度与自然度,增强用户体验与留存;为无文字界面的设备(智能眼镜、耳机)提供强智能入口,拓展付费场景。
  • 体验提升:文本推理能力不退化,使得语音交互具备复杂上下文理解、长时记忆和工具调用能力,突破目前多数语音助手只能处理简单指令的瓶颈。

与现有工作流的接口

  • API 集成:模型以标准 LLM 推理接口形式提供服务,可直接接入现有的微服务架构,替换掉原本串联的 ASR→LLM→TTS 管线,简化流程为一次性调用。
  • 开发栈兼容:由于是基于纯文本 LLM 架构的扩展,Audex 可直接复用已有的文本 LLM 训练/推理/服务化基础设施,无需单独维护视觉或语音编码器专用的推理图。
  • 增量适配:支持多阶段监督训练与 RL 对齐,企业可在已有文本 LLM 基础上,通过添加少量音频数据继续训练,获得音频能力而无损文本性能。

具体落地用例

  1. 全球电商平台的 AI 客服:用户以多语言语音描述退换货需求,Audex 直接理解并生成包含查询订单、推荐替代品等行动的回复语音,同时保持文本侧对商品知识的精准匹配。
  2. 教育科技公司的虚拟教师:为学生提供实时口语陪练,模型具备语音识别、发音评测、对话理解与语音生成能力,并能基于文本知识库解释知识点,无需切换多个模型。

局限

  • 虽然 Audex 在统一架构下实现了多种音频任务的高性能,但音频生成(如 TTS 和音频创作)的自然度和多样性可能仍落后于专门的扩散模型或自回归模型(如 AudioLDM、VALL‑E)。论文未提供与这些专门模型在主观评测(如 MOS)上的全面对比,且长序列音频生成的时序连贯性仍是开放挑战。作为 30B 参数的 MoE 模型,推理延迟和显存占用可能限制其在低延迟、端侧等实时场景的直接部署。
  • 论文强调文本智能退步极小(marginal or no regression),但在多模态训练后,纯文本推理能力可能在特定长尾任务(如复杂数学推理、代码生成)上出现难以量化的微妙降级。现有的文本评测基准(如 MMLU、HellaSwag)未必能捕获这种细微差别。此外,多模态联合训练可能改变模型的对齐特性,可能产生不安全的跨模态内容,虽声称保留对齐,但缺乏系统的多模态安全红队测试评估。
  • 训练数据覆盖 157.4B 音频 tokens,主要源自公开数据集和网络爬取,可能存在语言(偏向英语和高资源语言)、口音以及领域偏差。针对低资源方言、代码切换场景或医疗、法律等垂直领域,模型泛化能力未充分验证。数据筛选过程未详细披露,复现或扩展到新领域时可能面临数据质量不可控的问题。
论文Zhifeng Kong2026-07-06原文

相关内容