小红书发布统一语音生成与编辑模型 FireRedTTS3
FireRedTTS3 让一个模型同时搞定克隆、设计、编辑三种语音需求,靠的是语义增强的表示,值得关注。
FireRedTTS3 用一个模型实现多语言音色克隆、文本描述生成声音和局部语音编辑。其核心是 RedAE 表示,通过语义教师蒸馏让连续表示自带语义信息,避免误差累积,在音色相似度和语言覆盖上达到领先水平。
正文摘录
.jpg)  小红书 FireRed 团队发布新一代语音生成与编辑模型 FireRedTTS3。它用同一个模型打通了语音的三大能力——多语言、多方言的零样本音色克隆,用自然语言「描述」就能定制的声音设计,以及「哪里不满意改哪里」的精准语音编辑,并在四大公开评测集上全面达到行业领先水平。 - 论文标题:FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations - 技术报告:https://arxiv.org/abs/2608.17492 - Demo 链接:https://fireredteam.github.io/demos/fireredtts3/ - 代码链接:https://github.com/FireRedTeam/FireRedTTS3 给它几秒钟你的声音,它就能用「你」说 24 种语言、21 种中文方言;给它一句话描述,它能凭空「捏」出一个从不存在的声音;给它一段现成的语音,它能像改文档一样,只动你圈出来的那一处,其余分毫不改、音色不飘。