阿里 Qwen-Audio-3.0-TTS 语音合成模型登顶全球榜单
阿里新语音模型让合成语音从“能说话”升级到“会表演”,登上全球权威榜首。
阿里发布语音合成大模型 Qwen-Audio-3.0-TTS,能通过 [gasp]、[giggles] 等标签精确控制每个字的语气,支持 16 种语言和 20 种方言,在高噪声环境下也能克隆音色,输出品质提升至 48kHz。该模型在 Artificial Analysis 榜单夺冠,提供 Flash(300 毫秒首包延时)和 Plus 两个版本。
正文摘录
.png) 7 月20日,阿里巴巴发布语音合成大模型 Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方权威榜单 Artificial Analysis,Qwen-Audio-3.0-TTS-Plus 斩获冠军,其预览版 Fun-Realtime-TTS 也曾在一个月前登顶该榜单。  Qwen-Audio-3.0-TTS 的上一代版本已支持 freestyle(自由风格模式),可在提示词中加入“资深客服”、“足球解说员”等角色设定,以控制情绪、场景和语速等。新模型则在细粒度上进一步跃迁,通过结构化标签,用户可直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记,把控制精度从整段情绪细化到“哪个字后面该倒吸一口气”,适用于需要精确控制细节的叙事、游戏、配音等场景。 面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖中、英、日、韩、德等 16 种语言,新增阿拉伯语、越南语、马来语以及菲律宾语。