动态

Qwen3-Omni开源,支持多模态,性能卓越

Qwen3-Omni开源,支持多模态,性能卓越
Junyang Lin
Qwen3-Omni终于来了,距离Qwen2.5-Omni发布已经过去半年多了!上次我们以为在统一音频理解和生成方面取得了一些成功,但当时我们还在构建小型7B模型,且在数据数量和质量上远远落后。今年,我们的音频团队在构建大规模音频数据集(预训练和后训练)上付出了巨大努力,现在我们拥有了顶级的ASR和TTS模型——Qwen3-ASR和Qwen3-TTS,并且我们将所有东西整合在一起,包括LLM(特别是2507系列)以及即将推出的Qwen3-VL,打造了Qwen3-Omni!这次我们开源了Qwen3-Omni-30B-A3B-Instruct和Qwen3-Omni-30B-A3B-Thinking,还通过API提供了更高质量的服务,使用最佳模型Qwen3-Omni-Flash(https://modelstudio.console.alibabacloud.com/?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3-omni-flash)。两个模型在音频理解、音视频理解和音频生成上均取得了非凡的性能,指令跟随能力显著提升。这可能会改变开源Omni模型的格局!希望你喜欢!
Qwen
🚀 介绍Qwen3-Omni——首个原生端到端全模态AI,统一文本、图像、音频和视频于一个模型,无需模态权衡!🏆 在22/36个音频和音视频基准上达到SOTA 🌍 支持119种文本语言、19种语音输入、10种语音输出 ⚡ 延迟211ms | 🎧 支持30分钟音频 https://t.co/qGn34N7Xvd
动态Junyang Lin2025-09-22原文

相关内容