阿里发布语音合成大模型 Qwen-Audio-3.0-TTS 登顶全球榜单
阿里新语音合成模型可精确控制语气、支持多语言方言,登顶权威榜单,让语音从能说话到会表达。
阿里发布语音合成大模型 Qwen-Audio-3.0-TTS,分实时交互版和高品质版。它能在文本里嵌入 [gasp]、[giggles] 等标签,精确控制每个字的语气;覆盖 16 种语言和 20 种方言;即使在高噪声环境下也能克隆音色,输出音质提升至 48kHz。该模型已在全球权威榜单登顶。
正文摘录
- title: AI 语音进入“表演时代”:阿里 Qwen-Audio-3.0-TTS 登顶全球权威榜单 - sourcecompany: 量子位 - bodymarkdown: 7 月 20 日,阿里巴巴发布语音合成大模型 Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方权威榜单 Artificial Analysis,Qwen-Audio-3.0-TTS-Plus 斩获冠军,其预览版 Fun-Realtime-TTS 也曾在一个月前登顶该榜单。 Qwen-Audio-3.0-TTS 的上一代版本已支持 freestyle(自由风格模式),可在提示词中加入“资深客服”、“足球解说员”等角色设定,以控制情绪、场景和语速等。新模型则在细粒度上进一步跃迁,通过结构化标签,用户可直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记,把控制精度从整段情绪细化到“哪个字后面该倒吸一口气”,适用于需要精确控制细节的叙事、游戏、配音等场景。 面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖中、英、日、韩、德等 16 种语言,新增阿拉伯语、越南语、马来语以及菲律宾语。根据 CV3-Eval 的多语种基准测试,在 16 种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS 家族在 10 种语言中获得 SOTA,韩语和马来语的领先幅度最大;