论文

Question Relay 中的恶魔:Source-Conditioned Relay Steering 缓解 Audio-visual Large Language Models 中的幻觉

Question Relay 中的恶魔:Source-Conditioned Relay Steering 缓解 Audio-visual Large Language Models 中的幻觉

Audio-visual large language models(AVLLMs)通过视觉、听觉和语言信息的交互,在多模态理解与推理方面取得了显著进展。 然而,近期研究表明 AVLLMs 面临一个关键挑战:源混淆 grounding 幻觉 (source-confused grounding hallucination),即来自未使用模态的线索会诱导出所需模态并不支持的响应,损害真实场景中的可靠性。现有方法在缓解该失败上已有进展,但对于它如何从内部跨模态交互中产生仍理解不足。 为填补这一空白,我们进行路径干预 与表征分析,揭示了一种 question-relay 机制:问题状态在携带所需源证据的同时,也携带干扰线索,从而削弱对所需模态证据的 grounding。切断从干扰模态到问题状态的路径,比切断到生成位置的路径,能带来更大的正确答案 logit 恢复。 受此启发,我们提出 SECRET(SourcE-Conditioned RElay sTeering),一种免训练方法,在 question relay 处缓解跨模态干扰。利用通过不同模态-路径干预诱发的对比问题表征,SECRET 将原始问题状态引导向所需源证据。 在 CMM 和 AVHBench 两个广泛采用的基准上,跨三个 AVLLMs 的实验表明,SECRET 持续优于先前免训练方法,大幅缓解源混淆 grounding 幻觉 (例如,相比基础模型最高提升 +18.0 和 +7.1 个百分点)。模态特定 captioning 进一步证明了其向开放式生成的泛化能力。

论文精读

TL;DR 论文定位 AVLLM 幻觉源于问询状态中的跨模态干扰,提出无需训练的方法 SECRET,通过操控问询表征强化所需模态证据,在 CMM 和 AVHBench 上显著抑制源混淆幻觉。

问题

问题背景

音频-视觉大语言模型(AVLLMs)在多模态理解与推理中快速演进,但 源混淆接地幻觉(source-confused grounding hallucination)——未使用模态的线索诱导出所需模态不支持的响应——已成为阻碍其实际部署的关键可靠性问题。

现有方法局限

已有缓解方案(如微调、提示工程、对比解码)多从行为层面抑制幻觉,但对 AVLLM 内部跨模态交互机制理解不足。具体而言:

  • 未定位干扰线索的传播路径,干预位置往往选择生成 token 处或输入层,忽视了中间隐藏状态的中继作用。
  • 训练依赖的方法需要额外标注数据,泛化成本高;无训练方法又缺乏对模态证据源的显式建模,难以精准消除跨模态串扰。

为什么这个问题难 / 重要

论文通过路径干预与表示分析发现,AVLLM 的 question states(问题状态) 同时携带所需模态证据与干扰模态线索,形成 question-relay 机制:干扰线索在问题状态层被中继放大,进而影响后续生成。切割干扰模态到 question states 的路径,比切割到生成位置能恢复更多正确 logit,说明问题状态是幻觉传播的关键瓶颈。挑战在于:如何在无训练约束下,仅利用模型自身表示来引导 question states 向所需模态证据对齐,同时避免破坏原始语义信息。

行业类比

类似多传感器自动驾驶中的信号串扰——当视觉传感器短时失效时,模型若过度依赖历史雷达轨迹而忽略当前摄像头证据,会产生错误决策;需要在融合早期阶段进行源条件信号校准,正如 SECRET 对 question states 的定向操控。

核心洞察

  • 源头混淆接地幻觉并非源于模型无法识别所需模态,而是问题状态中混入了干扰模态的线索,并通过问题接力机制影响后续生成。本文通过路径干预与表示分析发现,切割干扰模态到问题状态的连接比切割到生成位置的 logit 恢复效果更好,这说明干预点应前移至问题编码阶段而非解码阶段。与大多数假设解码时混淆并施加输出约束的工作不同,该机制定位为跨模态融合的中间表示污染,为更轻量、更精准的推理时修正提供了理论依据。
  • SECRET 通过源条件化的问题表示 steering 实现训练自由修正,在多个 AVLLM 上稳定优于既有 training-free 方法。它利用不同模态路径干预构造对比问题表示,提取方向向量后对原始问题状态进行修正,无需更新模型参数或调用外部工具。相比基于解码约束、提示工程或微调的方法,SECRET 直接作用于跨模态干扰的关键瓶颈,在 CMM 和 AVHBench 上最高提升 18.0 个百分点,且可泛化到开放式生成任务,展示了推理时干预在幻觉缓解中的工程部署优势。

方法

输入与总体流程

输入为多模态问题(视觉 + 听觉 + 文本指令),模型为 AVLLM。SECRET 是一个训练无关的推理时干预方法,分为两个阶段:

  1. 所需模态识别:先利用模型自身判断当前问题需要视觉还是听觉证据(注意是判断所需源,而非识别具体答案)。
  2. 问题中继引导:基于路径干预分析发现,问题状态(question states)是跨模态干扰的关键中继点。SECRET 通过对比不同模态路径切断后得到的问题表示,构造方向向量:
    • 切断干扰模态 → 获得纯净的所需源证据表示
    • 切断所需模态 → 获得干扰表示 利用两者差异调整原始问题状态,使其向所需源证据方向偏移。具体操作类似 激活操控 (activation steering),在特定层对问题 token 的隐藏状态施加方向修正。

输出

修正后的问题状态继续向前传播,生成时不再受干扰模态线索影响,从而缓解源混淆接地幻觉。

实际工程启示:该方法不需要额外训练数据或梯度更新,可直接部署在已训练好的 AVLLM 上;并且干预位置在问题中继而非生成位置,计算开销低,适合实时推理场景。

与同类方法的差异点:不同于以往在生成位置或全局表示上做干预,SECRET 首次针对问题状态的中继机制进行源条件操控,从根源上切断跨模态干扰。

实验

实验设计

在 CMM 和 AVHBench 两个基准上,覆盖三种 AVLLM 骨干模型;除选择题形式评测外,还引入 modality-specific captioning 开放生成任务。SECRET 为 training-free,通过对比不同模态路径干预得到的 question 表征,对原始问题状态施加 steering。

关键发现

路径介入分析显示,切断干扰模态到 question state 的通路,可比切断到生成位置恢复更多正确答案 logit;说明 question relay 是幻觉产生的关键节点。SECRET 在 CMM 上最高提升 +18.0 个百分点,AVHBench 上最高 +7.1 个百分点,且均高于既有 training-free 基线。

与基线对比解读

相比仅做注意力裁剪或表征擦除的方法,SECRET 不修改模型参数,只在问题阶段注入 source-conditioned 方向,能保留必要模态证据而抑制干扰;在 open-ended captioning 任务上同样稳定,验证了跨任务泛化性。工程上,该干预开销低,适合作为轻量安全层插入现有多模态推理链路。

行业影响

落地场景

SECRET 适用于音视频大模型 (AVLLM) 的推理增强,典型场景包括视频会议纪要问答、短视频内容审核、电商直播分析、在线教育录播检索等。它聚焦“问题应依赖哪个模态”的源混淆幻觉,避免模型用视觉信息回答音频问题或反之。

商业价值

  • 降低人工复核成本:减少关键业务中模态错配答案比例,在金融路演摘要、医疗多模态记录等场景降低人工抽检频率。
  • 提升信任与体验:企业级多模态助手给出更一致的答案,减少用户质疑。
  • 零训练快速部署:训练无关,可节省再训练与标注成本,缩短上线周期。

与现有工作流集成

SECRET 可作为推理时 steering 中间件,通过 hidden state hook 获取 question token 表示,计算干预方向并做线性修正,不改模型权重。兼容 vLLM、Transformers 等推理框架,支持 batch 和流式生成。

具体用例

  1. 视频会议纪要:用户问“发言人 A 是否提到预算数字”,画面 PPT 同时出现数字;SECRET 引导模型仅依赖音频轨迹回答,避免视觉干扰。
  2. 电商直播问答:买家问“主播说这款面霜适合什么肤质”,画面展示其他商品;SECRET 强制关注语音内容,减少答非所问。

总体而言,SECRET 为现有多模态 LLM 提供低风险、可插拔的可靠性增强方案。

局限

  • **SECRET** 需要在推理阶段执行额外的路径干预前向传播以获取对比问题表示,这会引入约两倍的推理延迟与计算开销,对于实时交互或低算力部署场景不够友好。同时该方法依赖对模型内部激活的直接访问,无法应用于仅提供 API 的黑盒模型,限制了其在多数商业产品中的落地可能。与训练无关的激活操控相比,虽然无需梯度更新,但每次推理的额外开销可能抵消其训练成本优势。
  • 论文主要针对 **source-confused grounding hallucination** 这一特定幻觉类型展开,实验仅在 **CMM** 和 **AVHBench** 两个基准上验证,且这两个基准的干扰模式相对受控。对于其他更常见的幻觉类型(如对象存在性幻觉、属性错误、关系误判等)并未涉及,也未在更开放的场景(如长视频理解、多轮对话)中测试。因此 **SECRET** 的泛化边界尚不明确,可能无法直接迁移到更广泛的多模态幻觉缓解任务中。
  • **SECRET** 通过引导问题状态远离干扰模态线索,可能过度抑制有益的跨模态交互。在需要同时依赖音频与视觉信息的任务中(如说话人定位、音画同步判断),强制剥离干扰模态可能损失部分上下文信息,导致模型忽略模态间的互补证据,影响答案的全面性或置信度。与微调方法相比,训练无关的 steering 缺乏任务特定的参数调整,在复杂分布上可能难以平衡干扰消除与信息保留之间的权衡。
论文Yu Zhang2026-09-29原文

相关内容