突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术
美团发布新 TTS 模型 LongCat-AudioDiT,跳过梅尔谱直接在波形空间生成语音,提升零样本音色克隆质量。
能不能让 AI 直接学会声音本身的规律,跳过中间环节?美团 LongCat 团队发布 LongCat-AudioDiT,彻底抛弃梅尔谱等中间表示,直接在波形潜空间进行基于扩散模型的文本转语音(TTS),从根源阻断数据转换的级联误差。
正文摘录
音频生成技术正在经历一场全新的范式迁移——从传统级联架构,逐步向端到端生成范式演进。长期以来,主流的做法是"曲线救国":合成系统先将音频压缩成梅尔频谱图等中间表征,再依赖神经声码器"翻译"回波形。每一次转换都带来信息损失与误差累积,最终丢失了最需要保留的细腻音色与个性化细节。 能不能让 AI 直接学会声音本身的规律,跳过中间环节? 为破解这一技术瓶颈, 美团 LongCat 团队正式发布 LongCat-AudioDiT 。在该模型中, 我们彻底抛弃梅尔谱等中间表示,直接在波形潜空间进行基于扩散模型的文本转语音(Text-to-Speech, TTS),从根源阻断数据转换的级联误差 。 另外,我们做了两个关键改进:首先,我们识别并 纠正了一个长期存在的"训练-推理不匹配"问题 ;其次,我们 用自适应投影引导(APG)取代了传统的无分类器引导(CFG) ,从而大幅提升了最终的语音生成质量。 结果表明, LongCat-AudioDiT 在 Seed 基准测试中取得当前最优(SOTA)的零样本语音克隆性能,同时保持了具有竞争力的可懂度。 其中 LongCat-AudioDiT-3.5B 模型,在 Seed-ZH 测试集的说话人相似度(SIM)指标提升至 0.818,Seed-Hard 测试集达到 0.797,超过了 Seed-TTS、CosyVoice3.5、MiniMax-Speech 等知名模型,验证了波形空间直接生成范式的有效性。