行业新闻

腾讯混元发布 Hy ASR 3.0 preview 语音识别模型

腾讯混元推出 Hy ASR 3.0 preview,让语音识别理解上下文和方言,错误率约 3%,已开放 API。

腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview。它把语音识别和大语言模型(能理解语义的 AI 模型)结合,不只是逐字转写,还能结合上下文纠错、识别方言和嘈杂环境。在中文、英语、粤语评测中词错误率(识别错的词占比)约 3%,已上线腾讯云 API。

正文摘录

8 月 4 日,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升,能够在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果,从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。 Hy ASR 3.0 preview 在多个开源评测集和自建评测集上整体表现领先。在开源评测集中,Hy ASR 3.0 preview 在多语种的 WER(Word Error Rate, 词错误率)上都控制在 3% 左右,其中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,整体领先竞品。 在自建评测集上,Hy ASR 3.0 preview 在通用识别、方言识别、上下文 Context 理解、复杂声学场景(高噪、耳语)等场景化评测中,WER 也保持较低水平,整体领先竞品。 Hy ASR 3.0 preview 的能力提升并非来自单一模块,而是模型架构、数据 Scaling 与后训练优化共同作用的结果。 在架构层面,Hy ASR 3.0 preview 采用兼顾效率与性能的 MoE 架构,并将基座模型升级至 Hy3,进一步增强语言理解、上下文建模和语义推理能力。在语音侧,团队自研无监督语音 Encoder,通过数千万小时级无监督语音数据训练,使其能够从复杂音频中提取高质量的声学表征。 为了持续提升模型的语音建模与理解能力,混元团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,覆盖多种方言、口音和声学环境,并通过高质量数据管线进行精细化标注。

阅读原文(qbitai.com)→

行业新闻允中2026-08-04原文

相关内容