论文

AuK 技术报告:一个用于语音生成与编辑的开源基础模型

AuK 技术报告:一个用于语音生成与编辑的开源基础模型

我们提出 AuK,一个开源基础模型,通过自然语言指令与音频上下文这一统一接口,将语音生成与语音编辑整合在一起。为支撑这一广泛能力,我们构建了约 30.3 亿条指令--音频实例,覆盖 195 万小时有效监督数据,涵盖五个任务族:语音生成、内容编辑、增强与分离、副语言编辑以及声学编辑。 模型层面,AuK 整合了三部分:用于语义条件控制的多模态大语言模型、在语音、通用音频与音乐上联合训练的 VAE(用于声学条件控制),以及一个混合 rectified-flow Transformer,其先执行双流 MMDiT 块,随后接统一的单流 DiT 块完成生成。训练先进行仅生成的预热阶段,再进行生成--编辑联合预训练。 后训练阶段采用互补策略:针对开放式编辑的人类反馈偏好优化,以及针对语音生成的基于奖励的强化学习。为降低推理成本,我们进一步通过一致性初始化与任务路由的 Decoupled DMD 对模型进行蒸馏。所得 AuK-Flash 在无需 classifier-free guidance 的情况下实现 4 步推理,在同等条件下相对完整模型取得 4.5 倍的墙钟加速。 实验表明,该模型在零样本与指令控制的语音生成以及通用指令引导编辑上取得领先性能,同时在信号级修复任务上保持竞争力。我们开源了源代码与模型权重,以支持可复现性与后续研究。

论文精读

TL;DR AuK 是开源语音基础模型,统一语音生成与编辑,支持自然语言指令和音频上下文,并通过 3.03B 监督实例与 1.95M 小时训练实现领先性能。

问题

问题背景

语音 AI 正从单一任务模型走向基础模型,业界关注如何用统一接口实现语音生成、编辑、增强等能力。

现有方法局限

  • 传统 TTS 与语音编辑系统相互独立:TTS 侧重自然度,编辑任务(如内容替换、情感转换)依赖专用模型或信号处理,难以通过自然语言指令灵活组合。
  • 现有统一模型往往覆盖任务有限,缺乏大规模指令-音频对齐数据,语义理解能力弱,编辑时容易破坏非目标属性。
  • 推理效率低:主流扩散/流匹配模型依赖无分类器引导(CFG)和多步采样,难以实时应用。

为什么难/重要

语音是高维连续信号,语义到声学的映射复杂,编辑要求精确控制局部属性同时保持全局一致性。统一指令接口需要解决任务冲突与泛化,数据构建成本极高。业界需要类似文本 LLM 的“语音指令模型”,以降低多任务开发门槛。

行业类比

如同 GPT 用文本指令统一摘要、翻译、改写,语音领域需要语音 InstructGPT,让用户用自然语言完成任意语音处理。

核心洞察

  • AuK 的核心创新在于通过自然语言指令与音频上下文统一语音生成和编辑任务,并依托约30.3亿指令-音频实例的大规模监督实现通用能力。与以往将语音生成(如 zero-shot TTS)与编辑(如音色转换、内容修改)分别建模的做法不同,AuK 以单一基础模型覆盖五类任务,且接口统一为指令驱动,这显著降低了不同语音应用间的迁移成本,并让模型在训练中学习跨任务共享的表征,从而支持零样本指令编辑和跨任务泛化,为语音领域的基础模型提供了一种可复现的开放范式。
  • AuK 在架构与训练策略上采用任务分工明确的混合设计:**MLLM** 提供语义条件、**VAE** 联合训练语音/音频/音乐提供声学先验、整流流 Transformer 先经过双流 MMDiT 再进入单流 DiT,同时后训练对编辑任务用 DPO 偏好优化、对生成任务用 GRPO 强化学习。这不同于多数语音模型仅依赖单一条件网络或统一损失的做法——它显式解耦语义与声学,并用不同优化目标分别提升开放域编辑的符合性与生成质量,验证了语音基础模型可借鉴大语言模型的后训练路线,也为后续工作提供了架构与优化分离的参考。

方法

输入与条件建模

  • 输入 统一为自然语言指令与音频上下文。指令描述生成或编辑目标,音频上下文提供参考内容、音色或声学环境。
  • MLLM 作为语义条件编码器,解析指令并输出高层语义表示,涵盖文本内容、说话人属性、情感等。
  • VAE 在语音、通用音频与音乐上联合训练,将输入音频压缩为连续潜在表征,作为声学条件,同时保证高质量重建。

生成主干与训练

  • 采用混合 rectified-flow Transformer 生成主干:先使用双流 MMDiT 块分别处理语义条件与声学条件,随后统一进入单流 DiT 块进行融合与生成。
  • 训练分阶段:先以纯生成任务 warm-up,再进入联合生成-编辑预训练,配合条件 dropout 与参考增强提升鲁棒性。
  • 后训练针对不同能力分支:编辑任务使用基于人类偏好的 DPO 与序数列表损失;生成任务使用 GRPO 强化学习,根据多种奖励信号优化。

加速与推理

  • 通过一致性初始化与任务路由的 Decoupled DMD 蒸馏得到 AuK-Flash,支持 4 步推理且无需 classifier-free guidance,速度提升 4.5 倍。
  • 推理阶段引入 prompt enhancer 进行任务路由、指令重写与音频时长估计。

与同类的统一音频生成模型相比,AuK 将生成与编辑纳入同一自然语言接口,并以双流/单流混合架构和分离的后训练策略分别优化编辑偏好与生成质量,而非仅依赖数据规模堆叠。

实验

实验设计

AuK 采用混合架构:MLLM 做语义条件,VAE 联合训练语音/通用音频/音乐做声学条件,混合整流流 Transformer 结合双流 MMDiT 与单流 DiT 块。训练分三阶段:生成预热 → 联合生成-编辑预训练 → 后训练(编辑偏好优化 + 生成强化学习)。随后用一致性初始化与任务路由 Decoupled DMD 蒸馏得到 AuK-Flash,实现 4 步推理且无需分类器引导。评估覆盖 5 类任务,使用 MMAE-Speech、SpeechEditBench、Ming-Freeform-Audio-Edit 等基准。

关键发现

模型在零样本与指令控制语音生成、通用指令编辑上取得领先性能,在信号级恢复任务上保持竞争力。发现跨话语上下文学习和跨任务/跨语言迁移等涌现能力,但也暴露了自由形式指令跟随的局限。蒸馏后 AuK-Flash 在匹配条件下墙钟速度提升 4.5×,大幅降低推理成本。

与基线对比

相比单一任务专用模型,AuK 通过统一接口和大规模指令数据,在多种编辑和生成任务间实现泛化,且无需为每个任务单独微调。其 MLLM 语义条件增强了指令理解,VAE 联合训练跨音频域提高了声学表达力。但作者也指出,在极端自由形式指令下仍存在跟随能力限制,表明通用性尚未完全覆盖所有编辑场景,提示后续可在指令消歧和组合推理上加强。

行业影响

落地场景

AuK 的开源统一语音生成/编辑能力,可快速嵌入产品:

  • 智能语音助手 / 客服: 用自然语言指令实时调整回复的语调、情绪或内容,修复口误
  • 内容平台: 播客、有声书、短视频配音的生成与后期精修,减少人工返工
  • 企业沟通: 会议纪要整理后的语音修正、多语言口音转换

商业价值

  • 降本: 蒸馏版 AuK-Flash 仅 4 步推理、无分类器引导,速度提升 4.5 倍,节省 GPU 算力与延迟成本
  • 体验提升: 统一指令接口降低非专家使用门槛,编辑任务无需重新合成整段音频
  • 增收机会: 开放权重支持私有化部署,催生定制化语音服务(如虚拟人、有声内容个性化)

与现有工作流集成

  • 开源可部署: 代码与权重在 GitHub 公开,可集成至企业 ML 平台
  • 模块化架构: MLLM 语义条件与 VAE 声学条件分离,便于替换或升级单个模块,与既有 ASR/TTS 栈协同
  • 指令式 API: 与现有语音处理 pipeline 对接,通过 prompt 完成路由和参数调整

具体用例: 电商视频团队用 AuK 生成商品介绍语音,运营用指令“语速放慢 10%,加重价格部分”完成后期修改,无需重录;在线教育平台将课程音频批量进行口音标准化和噪声抑制,节省外包录音成本。

局限

  • 论文在信号级恢复任务(如语音增强、分离、超分辨率)上仅“具有竞争力”,而非像生成与编辑任务那样“领先”。这暗示统一架构在低层声学细节重建上可能不如专门针对该任务的模型,尤其当噪声类型复杂或混响严重时。与专门语音增强模型(如 DEMUCS、CleanUNet)或盲源分离模型相比,AuK 可能缺乏针对性的归纳偏置,导致在极端声学环境下性能下降。实际部署中,对于需要高保真信号处理的场景,可能需要额外后处理或级联专用模块,从而削弱了端到端统一的优势。
  • 虽然模型支持自然语言指令编辑,但论文提及“原生自由形式指令跟随的局限”(Limits of Native Free-Form Instruction Following),暗示复杂、模糊或组合性指令可能无法被准确执行。系统依赖提示增强器(Prompt Enhancer)进行任务路由和指令改写,这可能引入额外延迟,且无法完全解决语义歧义。与专用指令 TTS 或基于 LLM 的对话系统相比,AuK 在跨域指令泛化上仍有差距,尤其当指令涉及多步推理、否定或细粒度声学属性控制时,用户可能需要采用更结构化的指令格式。
  • 推理效率方面,完整 AuK 模型需要多步流匹配与分类器自由引导(CFG),推理开销显著。虽然通过一致性初始化和 Decoupled DMD 蒸馏出 AuK-Flash 实现 4 步推理,但蒸馏可能损失生成多样性或编辑精度,且任务路由要求固定任务分布,难以应对任意混合任务。此外,训练使用了约 30.3 亿指令-音频实例和近 200 万小时有效监督,加上 MLLM 与 VAE 的联合训练,计算资源需求极高,普通研究团队复现或微调门槛较高,限制了社区的深入参与与模型迭代。
论文Ziyang Ma2026-09-08原文

相关内容