论文

Whisper 幻觉检测与缓解:基于隐藏表示操控和稀疏自编码器

Whisper 幻觉检测与缓解:基于隐藏表示操控和稀疏自编码器

Whisper 是一种广泛使用的 ASR 模型,但存在幻觉问题——为非语音音频生成连贯但无关的转录。本文通过 Whisper 的内部表示来检测和缓解幻觉。 我们提取了 音频编码器激活值,并评估两个表示空间:原始 Whisper 激活和 稀疏自编码器 (SAE) 隐变量。实验表明,两个空间都编码了线性可分的幻觉相关信息,且判别信息集中在稀疏特征子集中,并随编码器层加深而增强。 我们提出两种操控策略: 1. 激活空间操控:直接调整编码器激活值。 2. SAE 隐变量空间操控:在稀疏特征空间中进行干预。 在完整非语音测试集上,SAE 操控 将 Whisper small 的幻觉率从 72.63% 降至 14.11%,Whisper large-v3 从 86.88% 降至 27.33%,且语音数据上的 词错误率 (WER) 仅有轻微增加,性能接近基于微调的方法。

论文精读

TL;DR 通过 Whisper 内部 SAE 潜变量操控,可线性分离并大幅抑制幻觉,将幻觉率从 86.88% 降至 27.33%,接近微调方法性能,且对语音转录影响极小。

问题

问题背景

大规模自动语音识别(ASR)模型如 Whisper 在工业界被广泛用于语音转写、语音助手、语音大模型数据预处理等场景,但非语音输入(如音乐、环境噪音)经常触发模型产生幻觉转录——输出看似连贯但与输入无关的文本。这类幻觉严重破坏下游任务可靠性,成为工程落地的关键卡点。

现有方法局限

目前缓解 Whisper 幻觉的主流方法依赖微调(fine-tuning)或外部语音活动检测(VAD)后处理。微调需要大量带标注的非语音-文本对,数据获取成本高,且容易损害正常语音的识别精度(WER 升高);VAD 作为前置模块虽然能过滤部分非语音,但存在漏检与时延问题,且无法处理模型内部已产生的幻觉。这些方法均未利用模型内部表示的可解释性,缺乏轻量、即插即用的机制来动态抑制幻觉。

为什么这个问题难且重要

幻觉检测与缓解的核心挑战在于:非语音信号在声学特征上与语音高度重叠,单纯从输入端难以区分;幻觉行为源于编码器深层的高维表征,需要找到线性可分的稀疏特征子集。同时,方案必须保持低计算开销,且不能降低语音转录质量。随着 Whisper 被集成进越来越多的语音处理管道(如 Kimi Audio、语音 LLM 训练),幻觉问题直接影响数据质量和用户信任,工业界迫切需要无需重新训练、可解释性强的控制方法。

行业类比

这类似于大语言模型(LLM)中的「激活操控」(activation steering)技术,通过干预模型内部表示来抑制有害输出,而无需微调整个模型,为黑盒模型提供了一种更经济的可控性方案。

核心洞察

  • **稀疏自编码器(SAE)将幻觉信号解耦为可操控的潜在特征**:通过训练 SAE 将 Whisper 编码器激活分解为一组稀疏、单义的潜在变量,幻觉相关信息被隔离在少数潜在维度上。这使得推理时操控这些维度即可显著抑制幻觉,而无需调整整个激活分布。相比直接操控原始激活,SAE 提供的透明接口副作用更小:在非语音测试集上,幻觉率从 72.63% 降至 14.11%,语音 WER 仅轻微上升,优于其他推理时干预方法,并接近微调效果。
  • **幻觉判别信息在编码器深层高度集中,揭示了内部机制**:实验表明,线性分类器能很好地区分幻觉与非幻觉输入,且准确率随编码器层加深而上升,关键特征高度稀疏。这证明 Whisper 深层已编码了清晰的‘幻觉表征’,为构建轻量级探针、实现实时检测提供了依据。与依赖外部 VAD 或音频特征的方法不同,利用内部表征无需额外模块,端到端且反应迅速,同时指明未来可针对特定神经元方向实施修剪或正则化。

方法

表示提取

Whisper 音频编码器的中间层(越深层信息越明显)提取逐 token 的激活向量,作为原始表示。同时训练一个稀疏自编码器(SAE),将高维激活映射到更高维但稀疏的潜在空间(潜在维度通常设为激活维度的 2–4 倍,施加 L1 稀疏惩罚),然后重建原激活。训练后的 SAE 编码器输出即为SAE 潜在表示,其分离的、可解释的特征有助于更精准地操控。

幻觉检测

构造一个线性二分类器(逻辑回归),输入某个时间步的表示向量,输出该帧是否会导致幻觉。训练数据来自非语音音频(如音乐、环境噪声)的前向传播:若模型最终生成连贯文本(即使与输入无关),则相应帧标记为幻觉正样本;否则为负样本。分类器在预留集上评估线性可分性,验证幻觉信息已编码在表示中,且 SAE 潜在表示的分类 AUC 更高、所需特征更稀疏。

推理时操控(Steering)

在解码过程中,对编码器输出施加一个修正向量,以将表示推向“非幻觉”方向。

  • 激活空间操控:直接对每层激活加上由分类器权重决定的修正向量(如分类超平面的法向量乘以一个缩放系数)。
  • SAE 潜在空间操控:先将激活编码为 SAE 潜在值,在潜在空间中施加同样的方向修正,再用 SAE 解码器重建操控后的激活,送入后续 Transformer 层。 修正强度在验证集上根据幻觉率与 WER 的权衡进行标定。

与同类方法的差异

区别于对整个模型微调或基于输出文本的后处理过滤,本方法仅分析并修改内部前向表示,无需额外训练 ASR 模型参数(SAE 是轻量级附加模块),在显著降低幻觉率的同时保持语音转录质量,提供了可解释的内部状态干预路径。

实验

实验设计

团队从 Whisper 音频编码器提取中间层激活,构建两种表示空间:

  • 原始 Whisper activations
  • 稀疏自编码器(SAE)latents

在每个空间训练线性分类器,检测幻觉帧。随后设计两种操控策略:直接操控原始激活空间中的特征,或操控 SAE 潜在空间中与幻觉相关的稀疏特征。在非语音测试集上评估幻觉率,在语音数据上监控 WER 退化。

关键发现

  • 两种表示空间均存在 线性可分 的幻觉信息,且判别特征高度稀疏并集中在更深层。
  • SAE 潜在操控 显著降低幻觉率:Whisper small 从 72.63% → 14.11%(↓58.52pp),Whisper large-v3 从 86.88% → 27.33%(↓59.55pp)。
  • 语音数据上的 WER 退化极小,表明方法不影响正常语音识别。
  • 该效果逼近基于微调的方法,却无需修改模型参数。

与基线方法的深度对比

相比未操控的原始 Whisper 模型,幻觉率下降超过 50 个百分点,这是一个实质性改进。与常见的微调缓解方案相比,SAE 操控 保持了模型原有参数不变,避免了灾难性遗忘风险,且计算开销更低。SAE 潜在空间的稀疏性质提供了更可解释的幻觉调控维度,为“查找-操控”式的轻量幻觉干预提供了工程可行性。未来可进一步探索在流式 ASR 或长音频场景中实时应用该策略。

行业影响

落地场景

依赖 Whisper 的自动语音识别 (ASR) 产品会因非语音输入产生幻觉转录,污染下游数据。本方法可广泛集成于视频平台字幕生成、会议转录、呼叫中心语音分析、IoT 语音交互等场景,特别是长音频处理中静音、音乐、环境噪声频繁出现的情况。

商业价值

幻觉率从 72.63% 降至 14.11% (small) 和从 86.88% 降至 27.33% (large-v3) 意味着大规模转录任务中人工审核成本大幅下降。在医疗、法律等对准确性敏感的领域,幻觉可能引发严重风险,本方法可显著提升可靠性。它无需重新训练模型,通过轻量级操控即实现接近微调的效果,节省 GPU 资源和部署周期,直接降低运营成本并改善用户体验。

与现有工作流的接口

可在现有 Whisper 推理 pipeline 中插入一个“幻觉检测与操控”模块,利用音频编码器的隐藏状态实时分类,并对非语音帧施加 SAE 潜在空间操控向量。该方法不修改模型架构,能以插件或库的形式集成,通过修改推理代码或注入钩子函数完成,兼容已部署的 Whisper 推理服务。

典型使用场景

  • 电商智能客服:用户语音交互中常夹杂沉默或背景噪声,幻觉转录会扰乱对话引擎。SAE 操控可抑制这类虚假输出,使客服系统更准确地理解用户意图,减少人工坐席介入。
  • 教育视频平台:自动生成字幕时,课堂录音中翻书、笔记声等非语音片段易被转写成无意义文字,误导学生。该方法能有效过滤,提升字幕质量与学习体验。

局限

  • 论文仅在 Whisper 模型(small 和 large-v3)上进行验证,未扩展到其他 ASR 架构,如 Conformer、RNN-T 等。不同模型的内部表征差异可能导致该方法泛化能力不足。此外,所处理的幻觉仅限于非语音输入引发的幻觉,对于背景噪声、重叠语音等复杂场景下产生的幻觉是否有效未作探讨。
  • 方法依赖训练稀疏自编码器(SAE)和二分类器,引入额外训练步骤和计算开销,且 SAE 需要针对不同模型层和表示维度进行调参。在实时 ASR 系统中,增加前向传播和操控操作可能引入延迟,文章未讨论延迟影响。同时,在语音数据上仍观察到小幅 WER 退化(具体数值未详述),对于高精度场景可能不可接受。
  • 与基于微调的方法相比,本文方法无需修改原始模型权重,但幻觉率降低仍未完全消除(large-v3 仍有 27.33%),且操控强度选择依赖开发集调整,可能过拟合特定非语音分布。在真实部署中,非语音音频类型多样,需要持续更新分类器和操控向量,维护成本较高。
论文Georgii Aparin2026-06-05原文

相关内容