阿里发布Qwen-Audio-3.0-Realtime实时语音模型 四项能力升级
阿里实时语音大模型打破快与聪明的权衡,在智商、工具调用、共情和双工交互上同步升级。
阿里发布实时语音交互模型Qwen-Audio-3.0-Realtime,通过在线策略蒸馏(边自己生成回答边由文本模型实时纠正)同步提升智商、Agent工具调用、共情对话和双工交互流畅度。在语音问答基准VoiceBench上,口头化提问得分仅下降2.0,抗干扰能力强;在共情和双工基准上取得领先。模型无需明确指令即可调用工具,并保持上下文连贯。
正文摘录
7 月 15 日,阿里巴巴发布实时语音交互对话模型 Qwen-Audio-3.0-Realtime,在智商、Agent 工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。模型包括推理更强的 Plus 版本和速度更快的 Flash 版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。今年 5 月,模型的 Preview 版本曾在全球权威第三方评测平台 Artificial Analysis 榜单斩获了两项冠军,超越 GPT-Realtime-2。 为压低时延,实时语音模型往往牺牲推理深度,智商衰减。Qwen-Audio-3.0-Realtime 针对日常对话、简单问答等对时延敏感的场景,可直接生成回复,毫秒级响应。在考验“AI 会不会答”的语音问答基准 VoiceBench 上,以书面化的标准 prompt 和口语化的 prompt 提问,Plus 版本得分分别为 92.5 和 90.5,仅下降 2.0 ——意味着模型能扛住真人说话的随意性。在更难的多轮音频对话挑战 AudioMultiChallenge 基准测试中,Flash 版本标准和口语化 prompt 得分分别为 43.6 和 38.1,仅下降 5.5。今年 5 月,模型的 Preview 版本 Fun-Realtime-Audiochat 在“语音推理能力”指标上曾以 97.6% 登顶 Artificial Analysis。 文本大模型的 Agent 能力已相当成熟,但语音模型往往是“能聊天不能办事”,模型要边听边判断何时该调工具,往往需要用户明显说出“帮我打开 XX”才能触发工具,且切回闲聊后,容易出现上下文断裂。Qwen-Audio-3.0-Realtime 无需明确的指令,即可自行调用外部工具,调用结果还会自动融入对话记忆,一次调用的结果会被记住,后面几轮追问都能接着用。