小红书开源连续自回归语音合成模型 dots.tts
dots.tts 不走离散 Token 路线,在连续隐空间自回归生成语音,20 亿参数全开源,音色和准确度均达 SOTA。
语音合成正像早期大模型一样路线未定。小红书与上海交大开源的 dots.tts 另辟蹊径:不把语音压成离散 Token,而是在连续隐空间(模型内部的连续数值表示)中逐个声学块自回归生成。20 亿参数全开源,Seed-TTS-Eval 上平均准确度和音色相似度均达 SOTA,首包延迟低至 54.4 毫秒。
正文摘录
.jpg) 语音合成这条赛道,最近越来越像早期的大语言模型:模型一个比一个强大,底层路线却远没有收敛。 - 有人选择非自回归的扩散,一次并行生成整段声音,但是这种方法只适合离线使用; - 有人沿用大语言模型最熟悉的方式,把语音压成离散 Token,再逐个自回归预测,但是语音毕竟不是一个一个的词,这样的做法会有一个无法打破的天花板。 小红书 dots 团队和上海交通大学 X-LANCE 实验室这次合作开源的 dots.tts ,走的是另一条路线: 不用离散 token,而是在连续隐空间中进行自回归生成。 它是一个 20 亿参数、全连续、端到端的自回归 TTS 基础模型。整条生成链路不依赖离散声学 Token:模型直接在连续隐空间中,以自回归方式逐个声学块建模,再把连续隐变量还原成波形。 - 最稳最像 :Seed-TTS-Eval 三个子集上,平均准确度和平均说话人相似度达到 SOTA; - 可扩展基座 :支持音色微调、任务微调,例如 dots.tts.edit 就直接沿用 dots.tts 基座模型,支持文本、情绪、韵律和停顿四类编辑,指令执行率和局部保持率在 doteBench 上整体领先; - 全量开源 :预训练、自纠正对齐、MeanFlow 四步、两步和单步,以及 1T1A 双流共六个检查点;同时开放训练、推理、微调、蒸馏代码,采用 Apache 2.0 许可; - 交互优先 :天然支持流式输出,配合双工对话系统还可以使用 1T1A 的双流模式; - 推理友好 :1T1A 双流模式音频首包低至 54.4 毫秒;