dots.tts 技术报告
我们提出 dots.tts,一个 2B 参数的连续自回归文本到语音(TTS)基础模型,在连续潜在空间中建模语音。与现有连续自回归模型相比,我们的核心创新有三点: 1. AudioVAE 多目标训练:通过多个训练目标构建语义结构化且利于预测的连续语音空间。 2. 流匹配头全历史条件:在流匹配头中使用全历史条件以保持长程一致性并减少生成过程中的漂移。 3. 免奖励自我纠正后训练:对流匹配头应用免奖励的自我纠正后训练,进一步改善鲁棒性和声学质量。 在大规模多语言语料库上训练后,dots.tts 在 Seed-TTS-Eval 上取得了平均最优性能:在 zh/en/zh-hard 测试集上分别实现了 0.94%/1.30%/6.60% 的 WER 和 81.0/77.1/79.5 的 SIM 分数。在其他基准上,dots.tts 也持续展现出开源最先进性能,表现出强大的生成稳定性、语音克隆能力和情感表现力。 为高效推理,我们进一步应用 CFG-aware MeanFlow 蒸馏,在输出流式和双流式模式下分别实现 85 ms 和 54 ms 的首包延迟,支持低延迟语音生成。为促进可复现研究和实际部署,我们在 Apache 2.0 许可证下发布训练和推理代码,以及预训练、后训练和 MeanFlow 蒸馏检查点。
论文精读
TL;DR dots.tts 是 2B 参数连续自回归 TTS 基础模型,以 AudioVAE 构建语义连续空间、全历史流匹配抑制漂移、无奖励自纠正后训练提升鲁棒性,在 Seed-TTS-Eval 达到 SOTA,并实现 85 ms 首包流式合成。
问题
语音合成的质量-效率困境
当前 TTS 领域正从单纯追求可懂度转向高表现力、低延迟的实时合成,尤其在语音助手、虚拟人、有声内容生成等场景中,对稳定的长文本生成、情感表达和极低首包延迟提出了严苛要求。
现有方法主要分为两类:离散自回归模型(如 AudioLM、VALL-E)通过矢量量化将语音离散化后交由语言模型生成,虽稳定但不可避免引入量化噪声,限制合成音质的保真度上限;连续自回归模型(如 DiTAR)虽有潜力保留更多声学细节,却普遍面临两大瓶颈:一是潜在空间语义结构不足,导致逐帧预测时误差累积和声学漂移(尤其是长序列场景);二是推理效率低下,难以满足流式场景下的低延迟需求。此外,多数模型依赖奖励模型或人类反馈进行对齐,训练流程复杂且成本高昂。
该问题的技术挑战在于:构建一个既具备语义结构化、又易于模型预测的连续潜在空间,同时保证生成过程的全历史一致性,并通过高效蒸馏实现可流式推理。业界对此高度关注,因为合成稳定性、声学保真度和首包延迟直接决定了 TTS 系统在实时交互场景中的可用性,而开源社区长期缺乏可复现的全链路最优方案。
类比 LLM 服务化中追求的首 token 延迟与长文本一致性:TTS 的流式合成同样需要在“即时响应”与“整句自然度”间取得精巧平衡,任何一处短板都会破坏用户体验。
核心洞察
- 连续自回归与流匹配结合的语音生成范式:dots.tts 在连续潜空间采用自回归建模,用流匹配头逐步生成语音,避免了离散 token 的量化损失,同时通过全历史条件(block-causal attention)保持长程一致性,与 VALL-E 等离散自回归模型相比,在 Seed-TTS-Eval 上取得最低 WER 1.30%(en)和最高 SIM 77.1,验证了连续表示在精细韵律建模上的优势。
- reward-free 自纠正后训练提升声学鲁棒性:dots.tts 对流匹配头进行自我纠正对齐,不依赖外部奖励模型,直接利用自身生成-纠正循环来减少累积漂移,与典型的 RLHF 或 reward 模型训练相比,避免了昂贵的人工标注和奖励设计,为 TTS 模型的自监督式微调提供了工程上易于复现的路径。
- CFG-aware MeanFlow 蒸馏实现流式低延迟:将流匹配头蒸馏为 MeanFlow 模型并融入 CFG(无分类器引导)感知,在输出流式和双流模式下首包延迟分别降至 85ms 和 54ms,同时保持语音质量,这解决了大型自回归 TTS 在线服务的延迟瓶颈,为实时交互场景提供了可部署的蒸馏策略。
方法
整体流程:文本与参考音频到语音的连续自回归生成
输入为需合成的文本序列,以及可选的参考音频(用于声音克隆)。文本经由语义编码器提取高层表示,参考音频则由 AudioVAE 编码为连续隐变量序列,两者拼接后送入 LLM 主干网络。
核心模块设计
- AudioVAE:采用多目标训练(重构损失、KL 正则、对比损失等)构建一个语义结构化且易于预测的连续隐空间,编码器输出作为 LLM 的预测目标,解码器将预测的隐变量还原为波形。
- LLM 主干:基于 2B 参数的自回归模型,在训练时通过交错序列设计支持双流模式(文本与隐变量交替输入),自回归地预测下一组隐变量,实现从文本到语音的逐步生成。
- 流匹配头(Flow-matching head):在 LLM 输出的每一时刻,以全历史条件(block-causal attention)建模流场,将简单先验分布变换为目标声学隐变量,从而缓解长序列生成中的漂移并保持跨句一致性。
- 后训练优化:
- 无奖励自校正对齐(reward-free self-corrective alignment):直接以声学质量为目标,对生成样本进行自我修正,不依赖外部奖励模型,提升鲁棒性与自然度。
- CFG 感知的 MeanFlow 蒸馏:将多步流匹配蒸馏为单步预测,同时保持分类器无关指导(CFG)的灵活性,显著降低推理延迟至首包 54 ms(双流模式)。
输出为高质量语音波形,可通过输出流或双流模式实时推流。
与同类方法的差异:dots.tts 在连续自回归框架下,融合多目标 AudioVAE 结构化隐空间、全历史流匹配以抑制漂移,并以即插即用的自校正后训练替代传统 RLHF,兼顾生成质量与推理效率。
实验
实验设计
评估覆盖多维度基准:Seed-TTS-Eval(中文/英文/中文困难集)衡量可懂度和说话人相似度,MiniMax-multilingual 测试多语言泛化,CV3-Eval 与 EmergentTTS-Eval 考核声音克隆与情感表达。所有实验统一使用预训练、自校正后训练及 CFG-aware MeanFlow 蒸馏后的模型,对比当前开源 TTS 系统。
关键发现
- dots.tts 在 Seed-TTS-Eval 上取得 0.94% / 1.30% / 6.60% 的 WER 和 81.0 / 77.1 / 79.5 的 SIM,平均性能超越所有对比开源模型。
- 困难测试集(zh-hard)上仍保持高可懂度,体现鲁棒性。
- 蒸馏模型实现 85 ms(输出流式)与 54 ms(双流式) 的首包延迟,满足实时交互需求。
- 模型在声音克隆和情感表达评估中同样达到 SOTA 水平,生成稳定性强。
与基线对比
主流连续自回归 TTS 常面临长序列生成中的漂移与语义退化。dots.tts 通过 AudioVAE 多目标训练 构建了更语义结构化、预测友好的连续空间,配合全历史条件流匹配头,显著抑制了长音频的失真。相比依赖 RLHF 的方案,自校正后训练无需奖励模型,降低了工程复杂度,在保持高合成质量的同时实现了高效对齐。尽管整体表现突出,作者在论文中也指出模型对复杂韵律控制、极端口音克隆仍有提升空间,为后续优化指明了方向。
行业影响
落地场景
- 实时语音交互应用:客服机器人、虚拟数字人直播、游戏 NPC 对话等需要低延迟流式 TTS 的场景,可直接受益于 dots.tts 的
dual-streaming mode(首包延迟仅 54 ms)。 - 内容生产与媒体:短视频配音、有声书生成、多语言课程音频制作等,模型的高自然度与情感表达力可减少人工后期调整。
- 无障碍与辅助服务:为视障用户或语言障碍者提供个性化语音输出,支持跨语言语料合成。
商业价值
- 降本:通过高质量自动合成替代录音棚与声优重复录制,降低多语言内容生产成本;MeanFlow 蒸馏模型大幅降低推理算力需求,云端或边缘部署成本更低。
- 增收:情感丰富的合成语音可提升虚拟主播、互动广告等业务的用户参与度与转化率;多语言能力帮助产品快速拓展全球市场。
- 体验提升:0.94%/1.30% 的极低 WER 与 >80 的 SIM 分数,意味着合成语音自然度与清晰度达到商用标准,连续自回归生成避免长句漂移,提升长文本朗读体验。
与现有工作流的集成
- 开源协议友好:代码与模型基于 Apache 2.0 发布,可直接在标准 TTS 引擎中集成(如作为基于 LLM 的声学模型)。
- 模块化组件:AudioVAE 可单独用于语音重建或特征提取;Flow-matching head 可对接其他语言模型,灵活性高。
- 流式接口:支持输出流和双流模式,通过 WebSocket/gRPC 可无缝嵌入实时对话系统,与传统 TTS 前端(文本规范化)和声码器组合。
- 蒸馏可用:CFG-aware MeanFlow 模型已发布,可直接部署至移动端或边缘设备,减少云端依赖。
具体落地案例
- 电商虚拟直播:卖家使用虚拟形象实时推销,dots.tts 提供富有情绪变化(如兴奋、强调)的语音生成,结合低延迟流式输出,使直播互动更自然,提升用户停留时长和购买转化。
- 在线语言学习平台:自动生成标准、带有不同语速和情感的多语言素材,帮助学习者训练听力,平台无需为每种语言雇佣录音人员,内容迭代更快。
局限
- **主观听感评估不足**:论文主要依赖 Seed-TTS-Eval 等客观指标(WER、SIM)衡量模型质量,虽在数值上达到开源 SOTA,但未提供全面的大规模主观听力测试(如 CMOS/MOS)结果。对于语音自然度、情感表现力等主观维度,仅凭 SIM 分数难以完全反映实际听感优势,这在一定程度上削弱了结论的用户体验可信度。
- **模型部署的资源约束**:dots.tts 参数规模达 2B,尽管通过 **CFG-aware MeanFlow 蒸馏** 将首包延迟降至 85/54 ms,但整体推理所需内存与计算量仍然较大。技术报告未深入讨论在移动终端、嵌入式设备等资源受限场景下的部署方案与性能损耗,其实用覆盖面可能受限。
- **自回归特性的固有局限**:连续自回归生成虽结合 **全历史条件** 与 **自我校正后训练** 尝试缓解曝光偏差和长程漂移,但该方法仍可能面临训练-推理分布不一致的固有问题。报告未给出与高性能非自回归模型(如基于扩散的并行 TTS)在生成稳定性、长句合成质量方面的定量对比,也未分析流式生成中误差累积的严格上限,对追求极致可靠性的工程应用尚存不确定性。