动态

通义千问开源语音模型Qwen3-ASR和强制对齐器

通义千问开源语音模型Qwen3-ASR和强制对齐器
Qwen
Qwen3-ASR 和 Qwen3-ForcedAligner 现已开源——专为嘈杂真实世界音频设计的生产级语音模型,具有竞争性能和强鲁棒性。
● 52种语言与方言,带自动语言识别(30种语言+22种方言/口音)
● 在嘈杂复杂场景下鲁棒(包括歌唱和歌曲)
● 支持长音频:单次最长20分钟
● 词/短语级时间戳:通过Qwen3-ForcedAligner对11种语言进行高精度对齐,优于MFA/CTC/CIF风格对齐器
同时提供完整的开源推理和微调栈,支持vLLM批处理、流式和异步服务。
GitHub: https://github.com/QwenLM/Qwen3-ASR
Hugging Face: https://huggingface.co/collections/Qwen/qwen3-asr
ModelScope: https://modelscope.cn/collections/Qwen/Qwen3-ASR
Hugging Face Demo: https://huggingface.co/spaces/Qwen/Qwen3-ASR
ModelScope Demo: https://modelscope.cn/studios/Qwen/Qwen3-ASR
博客: https://qwen.ai/blog?id=qwen3asr
论文: https://github.com/QwenLM/Qwen3-ASR/blob/main/assets/Qwen3_ASR.pdf
动态Qwen2026-01-29原文

相关内容