论文

不是图像显示了什么:无关上下文会扰乱 VLM 评判者,却不为其提供信息

不是图像显示了什么:无关上下文会扰乱 VLM 评判者,却不为其提供信息

视觉语言模型(VLMs)正日益取代人类标注者,因此可替代性测试 应当反映模型本身,而非偶然的评测条件。为此我们提出 MIST(Misleading-Image Stress Test,误导图像压力测试):包含 200 个英文句子,每句围绕一个既可作比喻义、也可作字面义理解的短语,并分别配以对齐图像(呈现其中一种读法)、误导图像(呈现相反读法)或完全无图像。 评测指南要求标签仅依据句子本身判定,因此任何图像都不应改变答案。我们原本预期图像会把评判者的标签拉向它所描绘的含义,但两类图像都没有产生这种效果。在 13 个 VLM 评判者上,对齐图像 改变了 20.5% 的标签,误导图像 改变了 19.4%,各评判者之间数值相近,且都高于「删除忽略图像指令、但保留图像」时的 11.6%。 然而,两张图像之间出现差异的标签中,只有 37% 朝向图像所展示的含义移动;而无论图像是缺失、对齐还是误导,与人类标注者的一致率都没有变化。该效应在通过 alt-test 的 7 个评判者中比在从未通过的 6 个中更小,但在所有评判者中都存在。真正推动评判者的,是「有图像」这一事实,而非究竟是两张图像中的哪一张——因此可替代性结论所描述的既是模型,也是某种配置。

论文精读

TL;DR MIST 用 200 句双关句测试 13 个 VLM 裁判:在要求忽略图像时,对齐与误导图像都导致约 20% 标签改变且方向不随图像语义,证明 VLM 替代性评估受测试配置影响远超模型本身。

问题

问题背景:AI 评估领域越来越依赖 VLM 替代人工标注,但替代性测试能否真实反映模型能力仍存疑问。

现有方法局限:常规 alt-test 只比对模型输出与人类参考答案,默认输入上下文是无害的。然而,MIST 压力测试在 200 个句子上评测 13 个 VLM judge 发现:要求仅依据句子判读时,附带 对齐图像 改变 20.5% 标签,误导图像 改变 19.4%,都显著高于删除“忽略图像”指令后的 11.6% 基线。这说明传统测试没有隔离无关多模态上下文,导致对模型稳定性的过高估计。而且,在两种图像之间发生变化的标签中只有 37% 朝向图像所示意义,说明模型并非被语义引导,而是被“图像存在”这一扰动本身影响。

为什么重要:多模态模型对视觉输入的响应强烈,但标签偏移方向与图像内容不一致,无法通过简单校准修正。业界广泛采用 VLM 做数据标注与自动评估,若忽略配置依赖,替代性测试结论只描述特定输入组合,无法跨配置迁移。这直接影响模型选型与部署可靠性。

行业类比:类似 RAG 系统中无关检索片段仅以“上下文”形式出现就能改变 LLM 生成答案,而不需要提供正确信息。

核心洞察

  • 图像的存在本身(而非图像内容语义)是干扰 VLM 判断的主要因素。实验显示,对齐图像与误导图像导致的标签变化率几乎相同(20.5% vs 19.4%),且仅 37% 的变化朝向图像所示语义,证明图像内容不传递有效信息。这一现象挑战了“视觉信息有助于理解文本”的假设,提示在 VLM 评估中,无关上下文可能引入系统性噪声,而非提供线索。
  • 通过 alt-test 的 VLM 仍不能完全抵御无关上下文的干扰。七台通过 alt-test 的 judge 变化率低于六台未通过的,但所有模型均受到图像存在的影响,变化率仍在 11.6% 以上。说明 alt-test 只能筛选相对稳健的模型,无法保证其不受无关上下文影响。工程实践中,应将评估配置(如图像存在、指令措辞)视为模型表现的一部分,而不是孤立地测试模型能力。

方法

输入

MIST 数据集包含 200 个英文句子,每个句子围绕一个可作比喻或字面解读的短语构造,例如“break the ice”。每个句子配三种视觉条件:

  • Aligned image:图像内容与其中一种解读一致;
  • Misleading image:图像内容与相反解读一致;
  • No image:纯文本输入。 标注规则明确规定:标签必须仅由句子本身决定,图像不应改变答案。

关键模块

  1. 提示设计:系统提示中显式加入 ignore-the-image 指令,要求模型忽略图像、依据文本判断。另设对照组删除该指令,以区分“图像存在”与“指令失效”的效应。
  2. VLM Judges:选用 13 个视觉语言模型作为评判器,先进行 alt-test(替代标注者测试),将模型分为“通过组”(7 个)和“未通过组”(6 个)。
  3. 条件对比:对每个句子分别给无图像、对齐图像、误导图像三种输入,记录标签变化率;并比较对齐与误导图像下标签变化的方向是否跟随图像语义。
  4. 指标:主要输出三个量——图像引起的标签变化率、变化标签中向图像语义偏移的比例、与人类标注者的一致性。

输出

实验发现:对齐图像平均改变 20.5% 的标签,误导图像改变 19.4%,均高于删除指令后的 11.6%;但两者间差异很小,且变化标签中仅 37% 偏向图像所示语义。与人类一致性在三种条件下无显著差异。结论是图像存在本身而非其内容导致评判漂移。

与以往侧重准确率或人类对齐的评判测试不同,MIST 通过受控的图像-文本语义冲突设计,分离了“图像存在”与“图像内容”两个因素,揭示替代性测试结果对评估配置的高度敏感性。

实验

实验设计

MIST 数据集包含 200 个英语句子,每句围绕一个可作字面或比喻解读的短语,并配对三种图像条件:aligned(描绘句子实际解读)、misleading(描绘相反解读)或 无图像。标注指南要求仅根据句子文本判定标签,图像不应影响答案。13 个 VLM 法官 在三种条件下分别标注,测量标签改变率、改变方向是否跟随图像语义、以及与人类标注者一致性。同时通过 alt-test 将法官分为通过组(7 个)与未通过组(6 个)。

关键发现

  • aligned 图像导致 20.5% 标签改变,misleading 图像导致 19.4%,两者接近,且均高于删除忽略图像指令时(图像仍在)的 11.6%。
  • 在两种图像间产生差异的标签中,仅 37% 朝向图像所示意义移动,说明变化并非由图像内容引导。
  • 与人类标注者的一致性在图像缺失、aligned、misleading 三种条件下无显著差异。
  • 通过 alt-test 的 7 个法官受到的影响较小,但所有 13 个法官均出现图像存在导致的标签扰动。

基线对比与启示

若图像内容会引导判断,应观察到 aligned 与 misleading 产生方向相反的拉动,但实际改变率几乎相同,且方向性弱。删除指令条件(图像在但要求忽略)作为对照,显示图像单纯存在本身即可引发扰动,而非图像语义。这挑战了“VLM 法官可稳定替代人类标注”的假设:评估配置(如图像附带)本身成为混淆变量。与仅关注文本提示敏感性的同类工作不同,MIST 专门探测视觉无关上下文的干扰,提示在实际部署 VLM 标注时需严格控制或报告配置效应,否则替代性结论描述的是配置而非模型能力。

行业影响

落地场景

VLM 作为自动评估器在多模态任务中迅速普及,但 MIST 压力测试揭示:无关图像会显著改变模型标签(对齐图像 20.5%,误导图像 19.4%),且变化方向并不跟随图像语义,说明模型仅对图像存在本身敏感。这直接影响以下场景:

  • 电商内容审核:商家上传商品描述文本并附带无关图片,VLM 审核文本合规性时可能被图片干扰,例如一张卡通图导致违规描述被误放行。
  • 医疗报告结构化:从影像检查报告中提取关键信息时,若输入包含影像缩略图,VLM 可能错误地改变对文本严重程度的判断。

商业价值

  • 降本:当前依赖 VLM 的自动化标注系统因图像干扰产生错误,需要人工复核。引入 MIST 类压力测试可提前发现模型脆弱性,减少线上事故和返工成本。
  • 增收:提升审核准确率可减少客诉与罚款,尤其在内容平台和电商领域。
  • 体验提升:确保评估结果稳定可靠,增强用户对 AI 辅助决策的信任。

跟现有产品/工作流的接口

  • 预处理阶段:在 VLM 输入前增加图像相关性检测,若图像与文本语义无关则剥离图像,只保留文本进入模型。
  • 评估阶段:集成 MIST 风格测试套件作为 CI 门禁,每次模型更新时验证图像存在与否的标签变化率是否在阈值内。
  • 监控阶段:线上记录每个样本的图像存在性,统计标签漂移,对异常波动触发告警。
  • 指令优化:论文显示“忽略图像”指令反而加剧图像影响(无此指令时变化率仅 11.6%),因此不宜简单依赖指令,建议采用输入掩码或模型架构调整。

局限

  • 论文仅设置了对齐图像与误导图像两种条件,且均与句子中的短语直接相关,未考察更一般的无关图像(如随机自然图像)或真实世界标注场景中常见的噪声视觉上下文;这限制了结论向更广泛多模态干扰情景的外推。此外,图像数量有限(每个句子两张),可能无法充分捕捉 VLM 对图像内容变化的敏感度分布。
  • 实验未测量人类标注者在图像存在时的标签变化率,因此无法直接比较人类与 VLM 对无关视觉信息的鲁棒性差异,也就难以判断 VLM 的“不稳定”是否真的超出人类基线;同时,标签采用部分有序的 Likert 量表,统计上可解释性受限,难以进行更细粒度的效应量分析。
  • MIST 数据集规模为 200 个句子,且全部围绕一个短语的比喻/字面歧义构造,覆盖的语义现象较窄,可能无法代表 VLM 在更复杂标注任务(如情感分析、事实核查)中的表现;所有句子均为英语,未考虑多语言及跨文化图像-文本对齐差异,限制了结论的普适性。
论文Nagham Omar2026-09-29原文

相关内容