腾讯混元发布Hy ASR 3.0 preview,提升通用识别与方言覆盖
腾讯混元新语音识别模型靠大模型理解语义,提升准确率和方言覆盖,复杂环境下表现稳定,值得关注。
8月4日,腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview。它基于Hy3大语言模型,在识别时理解上下文,通用识别、方言覆盖和复杂环境下的稳定性均有提升。评测中,普通话、英语、粤语的词错误率(WER,即识别中单词出错的比率)都在3%左右,领先竞品。
正文摘录
8 月 4 日,腾讯混元正式发布新一代 语音识别模型 Hy ASR 3.0 preview 。基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升,能够在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果,从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。 Hy ASR 3.0 preview 在多个开源评测集和自建评测集上整体表现领先。在开源评测集中,Hy ASR 3.0 preview 在多语种的 WER(Word Error Rate, 词错误率)上都控制在 3% 左右,其中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,整体领先竞品。  开源评测集表现:Hy ASR 3.0 preview 在语种及方言上均取得最低 WER,整体表现领先 在自建评测集上,Hy ASR 3.0 preview 在通用识别、方言识别、上下文 Context 理解、专词理解、复杂声学场景(高噪、耳语)等场景化评测中,WER 也保持较低水平,整体领先竞品。