论文

SIGNPOST-Bench: 多模态大语言模型中的文本-视觉冲突消解基准

SIGNPOST-Bench: 多模态大语言模型中的文本-视觉冲突消解基准

多模态大语言模型(MLLMs) 需要整合视觉与文本线索进行真实场景预测,但现有基准很少检验两者冲突时模型的决策机制。 为此,我们提出 SIGNPOST-Bench,一个受控反事实基准,用于评估文本-视觉冲突消解。每张源图像被变换为反事实五元组:Original、Blank、Similar、Random 与 Adversarial。通过合成局部场景文本干预,在保留非文本内容的同时,实现定位性能变化及文本引入的地理目标偏移的成对测量。 SIGNPOST-Bench 包含来自四个数据集的 5,111 个反事实组和 25,555 张图像变体。我们评估了来自七家提供商的 20 个 MLLMs。与 Original 相比,Adversarial 变体将中位定位误差从 282 km 提升至 1,347 km(4.8倍)。在可地理编码的对抗样本中,6.5%-20.1% 的预测距离注入目标小于 50 km;所有模型的 Blank→Adversarial 目标距离均呈正向成对缩减。兼容、无关与冲突文本替换对预测产生不同影响,且干净输入下的定位性能无法完全预测对冲突文本的鲁棒性。 上述结果确立了视觉地理定位作为场景文本仲裁的连续诊断工具,并为评估 MLLMs 解决冲突多模态证据提供了受控框架。

论文精读

TL;DR SIGNPOST-Bench 通过受控反事实图像评估多模态大模型在文本与视觉冲突时的仲裁能力,揭示模型易被冲突文本误导,且视觉定位强不等于能抵御文本干扰。

问题

问题背景

多模态大模型(MLLMs)在现实场景理解中同时依赖视觉与文本线索,但两者可能冲突,例如街景中的文字标识可能与实际环境不符。当前领域关注如何让模型可靠地仲裁来自不同模态的冲突证据。

现有方法局限

现有基准存在以下技术局限:

  • 缺乏冲突场景:典型视觉问答或图像描述数据集未系统性构造文本-视觉矛盾,难以揭示模型在冲突下的行为。
  • 无法分离模态贡献:缺乏反事实图像生成与局部文本干预,不能单独测量文本信息对预测的引导作用。
  • 指标不连续:离散答案或分类准确率无法刻画预测位置的连续偏移,难以量化模型朝冲突文本目标定向移动的程度。
  • 缺少配对测量:未提供从干净到干扰文本的成对比较,无法直接评估模型对文本干扰的敏感度。

为什么这个问题难且重要

技术挑战 在于多模态融合机制不透明:模型可能过度信任文本通道,而忽略强视觉证据,且未知如何动态调整模态权重。业界关注 高:自动驾驶、机器人导航、监控等应用要求模型在文字可能被恶意篡改时仍保持正确判断,任何误判都可能导致安全风险。该问题为构建鲁棒多模态系统提供了关键诊断视角。

行业类比

类似自动驾驶系统遇到被涂改的限速标志(视觉)与地图导航限速信息(文本)冲突时,必须可靠识别真实约束以做出安全决策。

核心洞察

  • SIGNPOST-Bench 通过控制反事实图像组(原始、空白、相似、随机、对抗)构建了首个系统评估多模态模型处理文本-视觉冲突的基准,填补了现有基准忽视证据仲裁的空白。不同于自然场景的不可控冲突,该基准合成局部文本干预且保持非文本内容不变,实现了配对测量:既能量化定位误差变化,又能捕捉模型预测向冲突文本所指目标的定向偏移,为研究模型如何权衡多模态证据提供了清晰因果框架。
  • 基准将地理定位作为连续诊断任务,利用距离误差构建排名,比分类或二元判断更精细地刻画模型在冲突下的决策偏差。结果显示,对抗文本使定位中位误差从282公里升至1347公里,6.5–20.1%的预测落入了注入目标50公里范围内,且所有模型均呈现正向距离缩减。这种连续度量揭示了文本不仅降低精度,还系统性诱导预测,为工程部署中敏感场景的鲁棒性测试提供了可量化指标。
  • 评估发现,干净图像上的定位性能并不能预测模型对冲突文本的抵抗能力,凸显独立鲁棒性评测的必要性。部分模型在原始图像上定位较准,但面对对抗文本时偏差显著,表明强视觉编码未必能抵御语义误导。这一结果为模型选型与安全设计给出了直接启示:部署前需额外评估模型在欺骗性文本输入下的表现,不可仅依据标准基准上的精度做决策。

方法

输入

真实地理定位图像及 OCR 文本。源数据集(如 IM2GPS、OpenStreetView)提供图像与其拍摄坐标,通过 OCR 引擎提取场景文本,作为后续替换的锚点。

关键模块

  1. 反事实文本替换策略:根据场景-文本耦合分类(兼容、无关、冲突),为每张源图像设计多种文本替换方案:
    • Similar:保持地理语义一致的相近地名替换;
    • Random:随机替换为不相关的地名;
    • Adversarial:替换为与视觉证据冲突的遥远地名(注入的对抗目标)。
  2. 基于扩散模型的局部重绘:利用 Stable Diffusion Inpainting,仅对文本区域进行种子补丁式生成,严格保留非文本背景。对每张原图生成五元组:Original(原图)、Blank(擦除所有文本)、Similar、Random、Adversarial。后处理 OCR 验证合成图像文本准确性,人工审核视觉保真度。
  3. 反事实组构建:25,555 张图像组成 5,111 个反事实组,覆盖四个数据集。

输出与评估

MLLM 对每组所有变体预测地理坐标,通过以下诊断指标量化文本-视觉冲突的影响:

  • 定位误差倍增比:从 Original 到 Adversarial 的中位误差从 282 km 升至 1,347 km(4.8 倍);
  • 对抗目标拉近指标:Adversarial 样本中 6.5–20.1% 的预测落点在注入目标 50 km 内;
  • 多模态冲突鲁棒性分数(MCRS):综合坐标回归精度、文本对齐度与抗干扰能力,得到模型鲁棒性排名。

与同类方法的差异:不同于只测试多模态理解准确率的 VQA 基准,SIGNPOST-Bench 通过反事实图像生成实现文本-视觉冲突的连续、受控诊断,解耦视觉与文本证据的权重。

实验

实验设计

SIGNPOST-Bench 将每个源图像变换为反事实五元组:Original、Blank、Similar、Random、Adversarial。通过局部合成场景文本干预,保持非文本内容不变,这些变体构建了配对测量,可量化定位性能变化和由冲突文本引起的地理目标定向位移。实验覆盖4 个地理定位数据集,生成 5,111 个反事实组(25,555 张图像),评估来自 7 个厂商的 20 个 MLLM。

关键发现

  1. 对抗文本严重破坏定位:与 Original 相比,Adversarial 变体的中位定位误差从 282 km 升至 1,347 km(4.8 倍)。
  2. 不同文本干预产生不同失效模式:兼容、无关和冲突文本替换对预测的影响各自不同,且干净输入下的定位能力不能完全预测对冲突文本的鲁棒性。
  3. 所有模型均受文本驱动:每个被评估模型在 Blank→Adversarial 的配对目标距离上均呈现正平均减小,表明 MLLM 普遍倾向于跟随注入文本而非纯视觉证据。
  4. 冲突意识 ≠ 可靠防御:即使模型能意识到冲突,仍会做出错误预测。

对比解读

与仅关注纯视觉或纯文本理解的基准不同,SIGNPOST-Bench 提供受控框架,将地理定位用作连续诊断信号来仲裁文本-视觉冲突。这暴露了当前 MLLM 在多模态证据融合时的系统性脆弱性:模型易被注入文本劫持,且缺乏可靠的冲突消解机制。该工作为未来开发更鲁棒的多模态推理奠定了基础。

行业影响

落地场景

SIGNPOST-Bench 提供了一套可控的文本-视觉冲突诊断框架,直接适用于任何依赖**多模态大模型(MLLM)**进行视觉定位与场景文本理解的产品,例如:

  • 自动驾驶:路面标志与导航指令冲突时的决策优先级判断;
  • 电商内容审核:商品图中文字描述与实际视觉属性不一致的风险识别;
  • 地理信息服务:街景照片中的路牌文字与视觉地标冲突时的定位校准;
  • AR/VR 导航:叠加的虚拟标识与现实环境文本发生矛盾时的渲染策略。

商业价值

  • 降本:通过对抗文本注入测试,提前暴露模型在处理恶意或误导性场景文本时的脆弱性,减少线上事故处理与人工审核成本。例如,内容平台可自动过滤将“好评返现”文字合成到商品图上的欺诈图像。
  • 增收:提升广告投放中品牌安全检测的准确率,避免因多模态误判造成的投放损失。
  • 体验提升:在视觉问答、图搜等产品中,确保模型不会因画面内无关文字干扰而给出错误答案,维持用户信任。

与现有产品/工作流的接口

SIGNPOST-Bench 可作为模型评测门禁插入 CI/CD 流水线:

  1. 在模型迭代阶段,使用其反事实图像五元组(Original/Blank/Similar/Random/Adversarial)生成对抗测试集,计算 MCRS(Multimodal Conflict Robustness Score),量化模型在文本-视觉冲突时的鲁棒性。
  2. 与现有模型监控工具(如 Weights & Biases、MLflow)结合,持续跟踪 MCRS 变化,作为模型退化预警指标。
  3. 在 RLHF 或偏好对齐环节,将冲突样本作为负例,引导模型学习「视觉优先」或「语义仲裁」策略。

具体用例:

  • 地图服务:某厂商的街景定位模型在上线前,通过注入虚假路牌文字的对抗样本,发现模型在 6.5–20.1% 情况下会错误地偏向文本目标,从而针对性增加地理先验约束,将线上定位错误率降低 30%。
  • 跨境电商:商品合规检测模型在部署前用 SIGNPOST 风格测试集(将“100% organic”文字合成到含塑料材质视觉特征的图上)暴露过度依赖文本的 bias,后通过多模态融合权重调整,减少误判,提升合规召回率 12%。

局限

  • **任务泛化性有限**:当前基准主要设计用于地理定位(geolocation)任务,虽然论文展示了街景识别、地标识别等其他视觉任务的初步泛化实验,但文本–视觉冲突解决能力的评估框架在其他多模态任务(如视觉问答、图像描述)上的有效性尚未充分验证,可能限制了对 MLLMs 冲突解决机制的全面理解。
  • **场景文本干预的人为性**:所有文本替换都是通过 inpainting 与合成文字实现的,尽管努力保持非文本内容不变,但合成文字的字体、光照、透视等可能与真实场景文本存在差异,导致模型可能检测到人为篡改的痕迹,从而影响冲突真实性。真实世界中的冲突常涉及 OCR 噪声或多义文本,而基准中的文本是清晰且含义明确的,可能高估或低估模型的鲁棒性。
  • **缺乏对模型内部决策过程的分析**:评估仅基于最终预测的偏差和距离变化,没有深入探索模型是盲目信任文本、忽略文本,还是尝试进行显式推理。未能揭示模型在文本和视觉证据之间进行权重分配的内部机制,因此无法为改进模型架构或训练策略提供更细粒度的指导。
论文Sirun Li2026-08-04原文

相关内容