论文

MMOOC: 多模态大语言模型中上下文偏离评估的综合基准

MMOOC: 多模态大语言模型中上下文偏离评估的综合基准

多模态大语言模型(MLLMs) 在广泛的视觉-语言任务上表现出色,但在不完美或偏离的上下文下常常失效。一个可靠的 MLLM 应当拒绝真正上下文偏离(OOC) 的问题(涉及主体级别的上下文转移),同时仍能回答具有非主体上下文转移的转移上下文内(Shifted IC) 问题。现有基准主要关注 OOC 或视觉上不可回答的问题,但忽略了可回答的 Shifted IC 案例,且覆盖的 OOC 转移类型有限。 为填补这一空白,我们提出了 MMOOC,一个用于评估 MLLMs 拒绝能力与稳健回答能力的大规模基准。MMOOC 包含超过 41K 个图像-问题对,包括可回答的 Shifted IC 案例和不可回答的 OOC 案例,涵盖三种问题格式、八种转移类型和六种视觉场景,并通过基于 MLLM 的过滤和人工验证确保数据质量。我们使用准确率(Accuracy) 和拒绝率(Refusal Rate) 评估模型响应,并进一步引入 LLM-as-a-Judge 指标来评估模型推理的正确性。 对多种 MLLMs 的实验表明,现有模型在转移上下文下仍难以平衡可回答性与拒绝能力。我们进一步分析了关键失败模式,并展示后训练(post-training) 可以提升稳健性。MMOOC 将公开发布。

论文精读

TL;DR MMOOC 是首个同时评估多模态大模型在上下文偏移下拒绝不可答问题与正确回答可答问题的综合基准,揭示了当前模型难以平衡拒绝与回答能力的关键挑战。

问题

随着多模态大模型(MLLMs)在视觉-语言基准上不断刷新性能,其 安全性与可靠性 成为产业落地的核心关切。尤其在视觉上下文与文本提问不匹配时,模型能否恰当反应——该拒绝时拒绝,该回答时灵活适应——是衡量实用性的关键。

现有评估方法主要聚焦 Out-of-Context (OOC) 场景,即图像与问题完全不相关或视觉信息缺失,要求模型拒答。代表性工作如 MM-SafetyBench、HallusionBench 等,侧重于检测拒答能力,却忽略了现实中更普遍的 Shifted In-Context (Shifted IC) 情形:图像主体未变,但非关键属性(如光照、视角、颜色)发生偏移,此时模型应调整回答而非拒绝。此外,已有基准覆盖的偏移类型有限(通常仅物体替换等少数几种),数据量不足,且评估指标单一(仅凭答案准确率),无法评判推理过程是否正确。这导致业界难以全面诊断MLLMs在上下文偏移下的鲁棒性短板。

该问题的技术挑战在于,模型需精细区分“主题级偏移”(应拒答)与“非主题属性偏移”(应回答),要求在视觉理解、常识推理和边界感知之间良好协同。真实世界的输入多变,用户提问常伴随图像质量、视角的随机偏差,若模型过度拒答则实用性差,若胡乱回答则引发幻觉与安全风险。在自动驾驶、医疗影像等高风险应用中,错误的判断可能造成严重后果。因此,系统化评估MLLMs的“回答-拒答”平衡能力,是推动可信AI发展的迫切需求。

类比而言,这类似于 AI代码助手 面对用户提供的含拼写错误的代码片段时,应智能推断意图并给出修正建议,而非直接报错或生成错乱代码。

核心洞察

  • MMOOC 首次将上下文偏移明确划分为 Shifted IC 与 OOC 两类,填补了现有 benchmark 只关注不可回答情形的空白。以往工作大多聚焦于拒绝视觉不可回答提问(如 Causal-VQA),而 MMOOC 构建了大量可回答的 Shifted IC 样本——图像主体未变但属性、场景等非主体上下文变化,要求模型在理解偏移后仍给出正确答案。这种设计更贴近真实部署中常见的细微分布漂移,迫使 MLLM 在“拒答保守”与“过度联想”之间寻求平衡,而不是简单地训练一个万能的拒绝机制。
  • 引入 LLM-as-a-Judge 评估推理正确性,将评价维度从表面拒绝率/准确率拓展到思维链逻辑。现有 OOC 评估多用字符串匹配或分类器判断拒绝与否,忽略了模型在给出正确最终答案时可能依赖错误推理的问题。MMOOC 借助 LLM 对模型生成理由进行判断,能更精细地诊断模型究竟是稳健理解偏移还是“蒙对”答案,从而暴露出当前模型在面对非主体上下文偏移时真实的理解鲁棒性——即便答案正确,推理链条也可能存在严重偏差。这一发现对后训练策略的选择具有直接指导意义,提示不能仅用答案准确度作为唯一信号。

方法

基准构建与评估方法

MMOOC 是一个大规模多模态基准,旨在评估 MLLM 的拒绝回答与鲁棒理解能力。其构建流程分为三步:数据构造、过滤验证与评估设计。

数据构造

基于现有 VQA 图像,生成两类样本:1)Shifted In-Context (Shifted IC):问题与原图上下文部分不匹配,但仍可回答,例如改问图中物体属性但物体存在;2)Out-of-Context (OOC):问题涉及主体级别的上下文转移,如图中根本没有该物体,模型应拒绝回答。覆盖三种问题格式(Yes/No、多项选择、开放式 VQA)、八种转移类型(如对象替换、属性修改、计数偏差等)和六种视觉场景(自然图像、文档、图表等),最终收集超 41K 图像-问题对。

过滤与验证

采用 MLLM-based 自动过滤(如基于 GPT-4V)剔除低质量生成,再由人工复核确保标签一致。最终数据分为训练/测试集,用于公平评估。

评估指标
  • 准确率 (Accuracy):衡量 Shifted IC 上的回答正确率。
  • 拒绝率 (Refusal Rate):OOC 样本上模型明确拒绝的比例。
  • LLM-as-a-Judge:额外引入大语言模型评判模型推理逻辑的正确性,弥补简单匹配的不足。
与同类工作的差异

相比于仅关注视觉不可回答问题(如 MM-SafetyBench、RTVLM)的基准,MMOOC 首次同时评估可回答的 shifted 情况与必须拒绝的 OOC 情况,并提供了细粒度的转移类型与 LLM 推理评判,为鲁棒 MLLM 开发提供了更全面的诊断工具。

实验

实验设计

  • MMOOC 基准:包含超过 41K 图像-问题对,覆盖三种问题格式(YesNo、Multiple-Choice、Open-ended VQA)、八种上下文偏移类型(如对象替换、属性变更、场景变换等)和六种视觉场景(自然图像、室内、室外等)。
  • 评估模型:在一系列主流 MLLM(如 GPT-4V、Gemini Pro Vision、LLaVA 系列、CogVLM 等)上进行测试,涵盖开源与闭源模型。
  • 评估指标:采用 Accuracy 衡量 Shifted IC 问题的回答正确率,Refusal Rate 衡量 OOC 问题的拒绝率,并引入 LLM-as-a-Judge 自动评估模型推理的逻辑正确性。

关键发现

  • 平衡难题:当前 MLLM 普遍难以兼顾两类场景——对 OOC 问题合理拒绝的同时,对 Shifted IC 问题保持高准确率。模型要么过度拒绝所有上下文偏移问题,要么盲目回答导致幻觉。
  • 失败模式分析:模型在面对 Subject-level shift(主体层面的偏移,如图中的主要对象被替换)时更容易产生误判,而 Non-subject shift(非主体偏移,如背景或属性变化)相对容易处理。
  • 后训练提升:通过在混合 Shifted IC 和 OOC 数据上进行后训练(如 SFT / RLHF),模型鲁棒性显著改进,拒绝率与准确率的权衡得到优化。
  • 推理能力评估:LLM-as-a-Judge 指标揭示,即使模型答案正确,其推理过程也可能存在逻辑缺陷,凸显仅靠答案准确率评价的不充分性。

与基线对比解读

  • 相较于现有 OOC 基准(如 A-OKVQA、MMVP 等仅关注不可回答问题),MMOOC 首次系统纳入了 可回答的 Shifted IC 问题,提供了更全面的上下文偏移鲁棒性刻画。
  • 先前工作往往只考虑视觉不可回答(visually unanswerable)或单一类型的偏移,MMOOC 的八种偏移类型和六种场景提升了评估的多样性和难度。
  • 实验表明,在不考虑 Shifted IC 时,部分模型可通过激进拒绝获得高 OOC 拒绝率,但引入 Shifted IC 后,这种策略导致大量可回答问题被错误拒绝,暴露了真实部署的风险。
  • 该基准为评估 MLLM 的 上下文感知拒绝能力 提供了标准化工具,并证明了系统设计时平衡两个指标的重要性。

行业影响

落地场景

MMOOC 基准直接服务于多模态大模型(MLLM)安全部署与质量保障环节,典型落地场景包括:

  • 智能客服/视觉问答机器人:用户上传图片并提问,模型需判断问题是否与图像内容在主体级别不匹配(OOC),避免答非所问或幻觉输出。
  • 内容审核与安全风控:社交媒体、电商平台中,用户可能提交恶意拼接或上下文偏移的图像-文本对,模型应阻断违规问答,同时不误判正常偏移。
  • 教育/医疗辅助:教材插图与问题错配(如肺片图被问脑部诊断),系统必须拒答并提示上下文不一致,保障决策安全。

商业价值

  • 降低风险与合规成本:减少因模型误答 OOC 问题导致的错误决策、法律纠纷或品牌声誉损失。
  • 提升自动化效率:精准区分可回答的 Shifted IC(非主体偏移)与不可回答的 OOC,避免人工过度介入,节省审核人力。
  • 增强用户信任:在视觉搜索(如“以图搜货”)中,模型对货不对版的问题给出明确拒绝或修正提示,提升用户体验与转化率。

与现有产品/工作流的接口

  • 模型训练后评估 (Post-training Evaluation):将 MMOOC 集成到 CI/CD 流水线,作为模型版本发布的鲁棒性门禁指标。
  • LLM-as-a-Judge 推理检查:现有 RAG 或 multimodal 应用可附加 MMOOC 的评判逻辑,自动审计最终输出是否存在 OOC 偏差。
  • 数据增强与微调:利用 Shifted IC / OOC 样本构建拒绝采样与对齐数据集,通过 supervised fine-tuning 或 RLHF 提升模型安全边界。

具体落地 Use Case

  1. 电商平台图像问答
    买家上传一张只有衣服的图片,却提问:“这双鞋是什么材质?” 传统 VQA 模型可能强行描述衣服材质,而集成 MMOOC 评估管线后,模型能正确拒绝,并引导用户上传鞋子图片或修正问题,减少客服纠纷。
  2. 自动驾驶场景验证
    感知模型接收晴朗道路图像,却被问“当前车道线是否被积雪覆盖”,若模型不能识别 OOC,可能输出伪影,影响决策。通过 MMOOC 审计,可在离线仿真中过滤不可靠输出,提升系统安全性。

MMOOC 的八类偏移类型与多格式覆盖,使其可作为 MLLM 信任度评估的标准组件,嵌入任何需要视觉-文本一致性校验的 AI 产品线。

局限

  • **MMOOC** 作为一个评估基准,本质上不提供模型改进方案,其核心价值在于诊断当前 MLLMs 在上下文偏移下的短板。论文虽提及后训练可提升鲁棒性,但未给出具体的训练策略或架构调整建议,对希望直接提升模型可靠性的工程师指导有限。
  • 数据构建环节依赖 **MLLM-based filtering** 和人工验证,这可能引入标注偏差,尤其是“可回答性”与“非上下文”的界定存在主观性;**LLM-as-a-Judge** 指标虽自动化了推理评估,但其可靠性高度依赖评判 LLM 自身的能力,可能错误地奖励或惩罚某些回答模式,影响评估的准确性。
  • 基准涵盖了八种偏移类型和六种视觉场景,但其覆盖范围仍有限,例如未包含细粒度属性变化、组合式偏移等更复杂的真实世界情况;此外,评估仅针对静态图像-问题对,缺乏对视频、多图等多模态输入的考量,限制了在更广泛多模态应用中的代表性。
论文Wenjie Zhu2026-08-01原文

相关内容