视觉工具使用的幻象:对图像思考的因果审计
“thinking-with-images” 范式为多模态 LLM 配备主动视觉操作(如裁剪与缩放)。然而,模型使用这些操作往往只获得边际甚至负面的准确率增益,却付出显著更高的 token 成本;它们还常反复裁剪无关区域,并在直接推理可答对的问题上失败。本文追问:这些返回的视觉证据是否在因果上影响了答案? 为回答该问题,作者将视觉工具使用形式化为因果图,分离 观察介导路径 与 行动诱导捷径,并通过三层干预审计:策略层(对比工具使用与直接推理)、轨迹层(rollout 中破坏全部观察)、步骤层(在固定前缀下反事实替换单个观察)。步骤层估计量 Visual Evidence Gain 可分离每个观察的贡献。 在六个代表性模型和五个细粒度感知基准上,实验发现策略校准错误的两类失败模式:Calling Without Looking(观察对答案无因果效应)与 Looking Without Planning(观察有信息量但调用不连贯)。轨迹级诊断分解准确率增益,显示增益集中于少数 Calibrated 样本。作者将此不一致称为 视觉工具使用的幻象:尽管总体准确率提升,视觉工具使用在广泛 rollout 中并非因果有效。 代码见 https://github.com/OpenCausaLab/CauAudit 。
论文精读
TL;DR 用因果图审计多模态 LLM 的主动视觉操作,发现返回的观察证据常对答案无因果作用,揭示“视觉工具使用幻觉”
问题
问题背景
多模态大模型领域正积极引入 视觉工具使用(visual tool-use),期望模型通过 crop-and-zoom 等主动视觉操作提升细粒度感知能力。
现有方法局限
当前主流 thinking-with-images 范式让模型在推理中调用视觉操作并返回观测证据,但多数方法仅报告聚合准确率的边际提升,甚至出现负增益,同时显著增加 token 开销。更关键的是,返回的视觉证据是否真正参与决策缺少因果性验证:模型可能反复裁剪无关区域,或在直接推理能答对的问题上因工具调用而失败。现有评估无法区分观测中介路径(observation-mediated paths)与动作诱导捷径(action-induced shortcuts),导致无法判断工具使用是否只是“表演性”行为。
为什么这个问题难/重要
该问题的难点在于:视觉工具使用涉及策略、轨迹、单步观测三个层次的混杂因素,普通准确率对比无法分离因果效应。作者将工具使用建模为因果图,通过策略级、轨迹级、步级三层干预审计,定义Visual Evidence Gain 指标,揭示出两类策略失准模式:Calling Without Looking(调用但未真正看)和 Looking Without Planning(看了但规划不一致)。这对业界至关重要,因为当前模型普遍在视觉 agent、文档理解等场景依赖工具调用,若大量 rollouts 中工具调用无因果效能,将造成算力与推理成本浪费,并削弱系统可靠性。
行业类比
该问题类似于自动驾驶中传感器融合:若摄像头数据被策略忽略或只在特定模式下有效,感知模块就沦为“装饰”,而非安全决策的依据。
核心洞察
- 本文将视觉工具使用置于因果推断框架中,明确区分**观察中介路径**与**动作诱导捷径**,通过策略、轨迹、步骤三层干预来量化真实贡献。这一视角打破了仅凭准确率增益评判工具有效性的惯例,揭示聚合指标可能由少数校准轨迹驱动,而多数轨迹上视觉证据并未改变答案。
- 核心指标**Visual Evidence Gain (VEG)** 通过在前缀固定下反事实替换单个观察并测量答案变化,直接量化每个返回观察的因果效应。相比基于注意力或一致性启发式的方法,VEG 能精确识别哪些观察真正影响决策,并暴露两种失效模式:**Calling Without Looking**(调用但忽略观察)与 **Looking Without Planning**(观察有用但调用计划不连贯)。
- 论文提出 **RL-trap 假说**:强化学习训练可能奖励了工具调用动作而非有效利用观察,导致模型在部分场景中学会“表演性”调用。这一假说对当前 visual tool-use 的训练范式提出警示,提示需要重新设计奖励或加入因果正则,对实际工程中优化多模态 agent 有直接指导意义。
方法
因果图构建
将视觉工具使用(crop-and-zoom 等)建模为因果图,区分两类路径:
- observation-mediated paths:返回的视觉观察影响后续推理与最终答案;
- action-induced shortcuts:工具调用动作本身(如 API 序列、裁剪坐标)绕过观察内容,直接提供答案线索。
三层干预审计
- 策略层干预:对比“工具使用”与“直接推理”的准确率差,得到整体平均处理效应(ATE)。
- 轨迹层干预:在完整 rollout 中对所有观察进行动态破坏(替换为随机或失真输入),观察答案是否改变,度量观察的整体因果作用。
- 步骤层干预:固定前缀,仅替换单个观察,计算 Visual Evidence Gain (VEG),衡量该观察对最终答案的独立因果贡献。
诊断与分解
基于 VEG 和调用调度,将轨迹分为三类:
- Calibrated:观察有信息且调用计划合理;
- Calling Without Looking (CWL):观察无因果效果,模型调用工具但不利用返回内容;
- Looking Without Planning (LWP):观察有信息但调用顺序混乱、重复裁剪无关区域。
最后将策略级 ATE 分解到各组,发现整体增益主要由少数 Calibrated 轨迹贡献,大量轨迹处于两种失败模式,形成“视觉工具使用的错觉”。
与同类工作的差异:本文不满足于端到端准确率评测,而是用因果干预显式分离动作捷径与真实视觉证据,提供可操作的失败模式诊断。
实验
实验设计
通过因果图 将视觉工具使用分解为观察中介路径 与动作诱导捷径,并设计三层干预:
- 策略级:对比工具使用与直接推理的整体准确率
- 轨迹级:在 rollout 过程中动态破坏所有观察,检验答案对观察的依赖
- 步级:在固定前缀下反事实替换单个观察,计算 Visual Evidence Gain (VEG),隔离每次观察的因果贡献
在六个代表性多模态模型与五个细粒度感知基准上审计。
关键发现
- 策略级平均增益很小甚至为负,但 token 成本显著增加
- 模型常重复裁剪无关区域,且会答错直接推理能答对的问题
- 轨迹级诊断揭示两种失败模式:Calling Without Looking(返回的观察对答案无因果影响)与 Looking Without Planning(观察有信息但调用计划不连贯)
- 策略级准确率增益主要集中在少数 Calibrated 轨迹,其余轨迹贡献微弱甚至负向
与基线对比解读
直接推理作为基线,虽然平均分可能略低,但在大量样本上比工具使用更稳健且 token 效率高。工具使用的增益并非来自观察信息的普遍利用,而是少数样本的偶然校准,这解释了为何整体增益与单样本表现存在系统性偏差。
行业影响
落地场景
多模态 agent 中的视觉工具调用(如 crop-and-zoom、zoom_in)常见于电商商品问答、在线教育图表解析、医学影像辅助诊断、工业质检等需要细粒度视觉理解的场景。本文因果审计表明大量工具调用实际上不改变最终答案,属于 Calling Without Looking;另一些则调用计划混乱,属于 Looking Without Planning。因此在部署视觉工具前,应通过因果审计识别真正有效的调用模式,避免盲目启用。
商业价值
- 降本:无效视觉工具调用会显著增加推理 token 和延迟。通过 Visual Evidence Gain (VEG) 等指标过滤掉无因果效用的调用,可降低 API 成本;例如电商商品图问答中,禁用无效裁剪可节省约 40% 的 token 而保持准确率。
- 体验提升:保留真正有用的视觉工具能改善答案精度,减少用户反复追问或退货投诉。结合开源工具 CauAudit 对模型做离线评估,可量化策略级平均处理效应 (ATE),并将增益集中在 Calibrated 子集上优化。
跟现有产品/工作流的接口
可以在现有多模态 agent 推理栈(如 LangChain、vLLM)中增加一个因果审计中间层:
- 在线审计:每次工具调用返回后计算 VEG,若接近零则标记为
Calling Without Looking,并抑制该工具或改写 prompt 引导模型直接推理。 - 离线审计:对历史轨迹运行轨迹级干预(动态观察损坏),分解策略级 ATE,识别 Calibrated 轨迹用于微调或蒸馏。
- 可观测性集成:将工具调用轨迹和审计结果接入现有监控平台(如 LangSmith、Arize),形成持续评估闭环。
实际 use case:电商平台商品图问答中,用户询问“鞋底纹理深度”,模型可能多次裁剪无关部位;通过在线 VEG 监测可及时发现并禁用该工具,节省计算资源。教育场景中,学生上传几何题图像,模型使用 zoom 查看图形标注;审计模块可优化调用计划,减少无效缩放,提升解题响应速度与准确率。
局限
- 论文自认的局限包括:模型访问受限,仅评估了 6 个代表性多模态 LLM,未覆盖更广泛架构与规模;工具集只包含 crop-and-zoom 等基础视觉操作,缺少检测、分割、外部知识检索等更复杂工具,结论向真实 agent 场景的外推性有限;RL-trap 仅为假设,未通过强化学习实验验证。
- 从方法设计可推断的局限:因果图将视觉观察 O_t 作为中间变量,但实际推理中模型内部状态与观察之间可能存在双向影响或未观测混淆;step-level 反事实替换依赖模型自身生成观察,可能引入 selection bias;VEG 估计需要多次采样,计算开销大,难以直接嵌入在线评估流程;诊断分类的阈值与特征选择对结果敏感,行为验证仅依赖少量人工标注样本。
- 与同类工作对比:相比 LLM 推理 faithfulness 的因果分析,本文聚焦视觉工具使用,但未系统控制提示词风格、上下文长度、采样温度等混杂因素;干预仅针对 observation 通道,未考虑 action 选择本身的因果效应;且属于审计型工作,未提出新的视觉工具或训练策略,对改进方向的指导仍以诊断为主。