行业新闻

小红书发布统一语音生成与编辑模型 FireRedTTS3

FireRedTTS3 让一个模型同时搞定克隆、设计、编辑三种语音需求,靠的是语义增强的表示,值得关注。

FireRedTTS3 用一个模型实现多语言音色克隆、文本描述生成声音和局部语音编辑。其核心是 RedAE 表示,通过语义教师蒸馏让连续表示自带语义信息,避免误差累积,在音色相似度和语言覆盖上达到领先水平。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/d16bca1e-a476-421a-af34-41405a54b6bb/013(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 小红书 FireRed 团队发布新一代语音生成与编辑模型 FireRedTTS3。它用同一个模型打通了语音的三大能力——多语言、多方言的零样本音色克隆,用自然语言「描述」就能定制的声音设计,以及「哪里不满意改哪里」的精准语音编辑,并在四大公开评测集上全面达到行业领先水平。 - 论文标题:FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations - 技术报告:https://arxiv.org/abs/2608.17492 - Demo 链接:https://fireredteam.github.io/demos/fireredtts3/ - 代码链接:https://github.com/FireRedTeam/FireRedTTS3 给它几秒钟你的声音,它就能用「你」说 24 种语言、21 种中文方言;给它一句话描述,它能凭空「捏」出一个从不存在的声音;给它一段现成的语音,它能像改文档一样,只动你圈出来的那一处,其余分毫不改、音色不飘。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-21原文

相关内容