论文

迈向类人交互式语音识别:Agentic Correction 与 Semantic Evaluation

迈向类人交互式语音识别:Agentic Correction 与 Semantic Evaluation

自动语音识别(ASR)是人机交互的核心组件,也是基于LLM的助手和代理的重要前端。然而,当前大多数ASR系统仍遵循单次通过范式,与人类通过迭代澄清和修正解决误解的方式不一致。这种不匹配导致意义关键的错误一旦发生就难以纠正,且词级指标如WER或CER无法充分反映该问题。 为解决这些局限,我们将交互式ASR形式化为多轮精炼任务,并提出Agentic ASR——一个闭环框架,将单次ASR前端与语义纠正、意图路由和基于推理的编辑相结合。进一步引入句子级语义错误率(S^2ER),一种基于LLM的语义评估指标,以及交互式模拟系统(Interactive Simulation System),用于可扩展和可重复的基准测试。 在多语言、命名实体密集和代码切换基准上的实验表明,迭代交互持续减少语义错误,在S^2ER上的提升远大于传统词级指标。人机对齐和消融研究进一步验证了语义判断器的可靠性和所提框架的鲁棒性。代码和演示分别见 https://interactiveasr.github.io/ 和 https://i-asr.sjtuxlance.com/。

论文精读

TL;DR 将单次 ASR 扩展为多轮交互式语义校正与推理编辑框架,用句子级语义错误率 S²ER 替代传统 token 指标,在多种基准上显著降低语义误解,使语音识别更贴近人类迭代澄清的交流方式。

问题

问题背景

自动语音识别(ASR)是 LLM 驱动助手与 Agent 的关键前端,其输出质量直接影响下游任务。当前研究聚焦于提升单次识别准确率,但人类交流中,误解往往通过迭代澄清与修正解决,而现有系统普遍缺乏这种交互能力。

现有方法局限

  • 单遍推断范式:主流 ASR 系统(如 Whisper、Conformer)仅做一次前向,无法根据上下文修正已发生的语义错误。一旦将 "Turn right at the next intersection" 误认为 "Turn left",后续对话无法自动纠正,导致任务失败。
  • 评估指标失真:词错误率(WER)和字错误率(CER)基于 token 级编辑距离,对语义保真度不敏感。例如,将人名 "Dr. Zhang" 错成 "Dr. Chang" 的 WER 仅 0.5,但在医疗或法律场景可能引发严重后果。
  • 缺少交互闭环:现有交互式 ASR 研究多依赖预定义澄清问题,无法灵活推理错误根源并进行针对性修正,限制了实用价值。

为什么这个问题难/重要

  • 技术挑战:语义纠错需同时完成错误检测、意图理解与上下文推理。系统必须判断哪些词是意义关键的,并生成精准的修正指令,而非简单重述。这要求结合 ASR 前端的声学信息、LLM 的世界知识与推理能力,形成闭环。
  • 业界关注度:随着语音助理进入高可靠场景(如车载导航、智能医疗),语义错误可能导致的安全与体验风险日益凸显。多语言、命名实体密集(如会议转录)及语码切换(中英混杂)场景加剧了问题,因为实体错误往往 token 级误差小但语义损失大。

行业类比

类似对话式 AI 助手(如智能音箱)在复杂指令下,若不能通过反问"你是想打开书房灯还是客厅灯?"来消歧,则可能错误执行,严重破坏用户体验与信任。

核心洞察

  • 从 token 级纠错到语义级交互的范式重构:传统 ASR 评估和优化以 WER / CER 为中心,但这类指标无法反映输出对下游任务(如 LLM 意图理解)的实质影响。该工作提出的 S^2ER 指标,利用 LLM 作为语义裁判来量化句子级别语义错误,使得系统可以针对“即使词级错字少但语义却错误的片段”进行定向修复。这本质上将 ASR 的优化目标从表面字符串匹配转向意义保真,为构建以 LLM 为终端的语音交互流水线提供了新的评价基准。
  • 闭环多轮交互框架将 LLM 从被动后处理提升为主动推理核心:不同于仅对 ASR 输出做一次性纠正的二阶段方案,Agentic ASR 将语音识别建模为多轮对话任务,通过语义纠正、意图路由和推理编辑模块协同工作,模拟人类澄清误解的过程。框架能主动识别命名实体或代码切换中的关键歧义,借助 LLM 的上下文推理能力生成修正文本,整个交互过程可通过交互仿真系统(ISS)进行自动化复现和评估。这种设计为在真实场景中部署鲁棒的语音助手提供了更具泛化性的工程路径。

方法

方法详解

Agentic ASR 将语音识别重新定义为多轮语义修正任务,构建了一个闭环交互框架。

输入与前端处理:用户语音经 single-pass ASR 引擎(如 Whisper 或 Conformer)转写为初始文本 $T_0$。

核心 agentic 环:系统对 $T_i$ 进行 语义错误检测,判断是否存在意义扭曲(如命名实体错误、代码混合误译)。若检测到错误,意图路由器(intent router)分析错误类型并选择对应的修正策略(澄清、实体替换、重述等)。随后 基于推理的编辑器(reasoning-based editor),由一个具备长上下文理解的大语言模型担任,结合当前转录、对话历史和世界知识,通过思维链推理生成修正后的转录 $T_{i+1}$。这一过程可多轮迭代,直至达到预设的语义正确条件或轮次上限。

评估机制:为摆脱 WER/CER 的局限,论文提出了 S^2ER 指标,利用 LLM 作为语义评判器,按句子级评估语义等价性,并构建了 交互式仿真系统 (ISS) 包含用户模拟器和评判器,实现可重复的大规模评测。

输出:最终产出经过交互校正的高语义保真转录文本。

与同类方法的差异点:不同于传统的单次 Decoding 或仅基于 token 编辑的后处理,Agentic ASR 将 LLM 的推理能力融入闭环交互,主动识别并修复语义错误,更贴合人类沟通中误解澄清的迭代模式。

实验

实验设计

实验围绕 Agentic ASR 框架的多轮交互修正能力展开,评估覆盖三类典型场景:

  • 多语言语音 (Multilingual speech)
  • 命名实体密集型语音 (Named-entity-intensive speech)
  • 语码切换语音 (Code-switching speech)

同时设计了 Human–AI Alignment Study 验证新指标 S²ER 与人类判断的一致性,以及 消融实验 (Ablation Study) 考察不同基础 ASR 模型、LLM 推理器大小和 LLM-as-a-Judge 策略对系统的影响。采用 Interactive Simulation System (ISS) 进行可扩展、可重复的基准测试,将用户模拟与语义评判结合,避免昂贵的人工标注。

关键发现

  • 多轮交互持续降低语义错误:在各类测试集上,随着交互轮次增加,S²ER 逐步下降,且降幅远大于传统 token 级指标 (WER/CER)。
  • 语义评价更贴近人类感知:Human–AI 对齐研究表明 S²ER 与人类偏好高度相关,而 WER/CER 常低估或漏判意义关键性错误。
  • 框架鲁棒性:消融实验显示,即使更换基础 ASR 模型或调整 LLM 规模,Agentic ASR 仍稳定提升语义正确性;推理式编辑 (Reasoning-based Editing) 和意图路由 (Intent Routing) 是关键模块。

与基线的对比解读

传统单次 ASR 系统仅输出一次识别结果,无法修正识别后仍存的语义错误,此时 WER 的改变并不直接对应语义改善。Agentic ASR 通过闭环多轮修正,直接面向语义校正,因此在 token 指标几近不变的条件下(部分场景 WER 仅微降),S²ER 大幅降低。这揭示了 只优化 WER 的局限——尤其在需要高可靠性的 LLM 前端场景,必须引入语义级评价与交互式修正才能实现与人类沟通方式更相符的语音识别。

行业影响

落地场景

Agentic ASR 将单轮语音识别拓展为多轮语义校正,尤其适合需要高精度语义理解的交互系统:

  • 智能客服与工单生成:在银行、保险、电商售后等场景,语音转文本后自动提取意图、实体,迭代澄清歧义表述,避免因识别错误导致工单分类错误或重复确认。
  • 医疗语音录入:医生口述病历、医嘱时,对药物名称、剂量等关键实体要求零歧义,系统可通过反问确认实体,降低语义错误导致的医疗风险。
  • 车载/AR 语音助手:在嘈杂环境下,单次识别常出错,多轮交互可自然修正,例如“导航到星巴克”被误识为“新巴克”时,助手可主动询问“您是指星巴克咖啡吗?”
  • 多语言/代码切换场景:会议记录、跨国客服中经常出现中英混杂或方言,框架对 code-switching 和多语言数据集有较好支持。

商业价值

  • 降本:减少因 ASR 语义错误引发的下游任务失败(如错误订单、错误处方),并降低人工复核成本。在客服场景中,直接提升首次解决率,减少转人工量。
  • 增收:更自然的交互体验可提升用户粘性与转化率,例如电商语音搜索准确率提升直接关联下单率。
  • 体验提升:用户可与机器像人类一样进行澄清和修正,而非机械重复,大幅优化强噪声或专业领域的交互体验。

与现有产品 / 工作流的接口

该框架可作为现有 ASR pipeline 的轻量插件:

  1. 前端:复用现有流式或非流式 ASR 引擎(如 Whisper、Conformer),输出 N-best 或 lattice。
  2. 中间件:部署 Agentic ASR 模块,包含 语义校正意图路由推理编辑 三个子组件,接收 ASR 输出和用户交互历史,决定是否发起澄清或直接输出校正文本。
  3. 后端:校正文本送入下游 NLU/LLM,并与业务系统交互。评估体系可集成 S^2ER 指标,与传统的 WER/CER 互补,监控线上语义质量。

具体落地 use case

  • 电商 / 外卖语音搜索:用户:“帮我搜一下 XXL 的防晒衣”。ASR 将“防晒衣”误识为“放晒衣”。系统根据上下文和用户购物历史,主动反问:“您是否要找防晒衣?”。用户确认后,系统自动修正并返回精确搜索结果。此过程减少了因误识别导致的无结果或错误推荐。
  • 银行电话银行:用户:“我要转账五千元到我的信用卡”。ASR 可能将“五千”误识为“四签”。系统通过意图路由识别到转账场景,并结合账户实体信息,反问:“您是想转账 5000 元到信用卡吗?”。确认后完成转账,避免资金损失。

局限

  • **依赖 LLM 带来高延迟与成本**:Agentic ASR 中的语义纠正、意图路由和推理编辑均依赖大语言模型 (LLM) 推理,S^2ER 指标亦基于 LLM 评判。这可能导致每轮交互耗时显著增加,难以满足实时或低延迟场景 (如语音助手) 的要求;同时 API 调用成本较高,限制其在资源受限设备或大规模部署中的可行性。
  • **仿真系统无法完全替代真实用户研究**:所提出的交互仿真系统 (ISS) 虽提供了可扩展的基准测试,但其用户模拟器基于预设策略和文本交互,难以复现真实人类对话中的多样化纠错行为 (如模糊表达、部分修正) 和情感因素。这可能导致实际部署中交互质量和用户接受度与仿真结果存在差距。
  • **场景覆盖有限,缺乏鲁棒性验证**:实验聚焦在多语言、命名实体密集和代码切换三个典型场景,未涉及噪声、远场、口音变化、低资源语言等更普遍的 ASR 挑战。此外,多轮交互可能增加用户认知负担,论文未进行真实用户研究验证可用性和用户体验,框架的泛化能力仍待进一步考察。
论文Zixuan Jiang2026-05-28原文

相关内容