动态

讨论替换Whisper使用Qwen3-ASR模型

宝玉
其实这些问题都能很好的解决了

1. 扔掉 whisper,换 ASR 模型,Qwen3-ASR 就很不错幻觉很少、也有一些别的ASR选择,whisper 幻觉多也要求 30s片段,Qwen3-ASR 塞更长的音频识别越准确,最大支持 20 分钟;
2. 文字时间轴 也扔掉 whisper 不是很准, 虽然 Qwen/Qwen3-ForcedAligner-0.6B
动态宝玉2026-05-15原文

相关内容