论文

知道什么不该回答:视觉语言模型中的选择性不遵从

知道什么不该回答:视觉语言模型中的选择性不遵从

视觉语言模型(VLM)被期望在回应适宜请求时提供帮助,同时对错误、不安全、不可行或无法回答的请求暂缓遵从。然而,现有基准大多在查询整体层面评估不遵从,假设每个请求要么完全值得遵从,要么需要完全拒绝。实际上,真实世界的查询可能混合了可回答内容与需要拒绝遵从的部分。本文引入了KoNA基准,用于在五类场景下评估VLM的选择性不遵从:错误前提、视觉不可访问性、普遍未知、任务可行性和安全性。每项任务评估两种能力:查询级不遵从和组件级不遵从,通过成对的单一查询与复合查询进行。我们对多种VLM的评估显示,模型往往无法适当地拒绝、纠正或放弃回答,并且在需要选择性不遵从的查询中,这些失败更为明显。为应对此挑战,我们使用要求选择性不遵从的KoNA示例以及一组完全可回答的样本(应直接回答)对VLM进行微调。微调后的模型在不遵从准确率上获得显著提升,同时在完全可回答任务上基本保持原有性能。结果表明,微调模型能够区分可回答组件与需要不遵从的组件,并以任务适宜的方式进行响应。

论文精读

TL;DR KoNA 基准首次系统评估视觉语言模型在混合请求中选择性拒答的能力,覆盖错误前提、视觉不可及等五类场景;针对性微调可显著提升模型在保持正常回答的同时准确拒绝不当部分。

问题

背景与问题

当前 VLM 研究在安全对齐与可靠响应之间寻求平衡,但主流评测仍以整句请求为单位判断是否拒绝,忽略了混合请求中部分可回答、部分须拒绝的复杂情况。

现有方法局限

现有基准假设每个查询要么完全合法、要么完全违规,模型只能二选一输出“回答”或“拒绝”。例如 False Premise 与 Visual Inaccessibility 等类别通常单独成题,未考察复合查询中模型需要同时处理多个意图的能力。这导致模型面对混合查询时倾向于全盘拒绝(过度谨慎)或全盘回答(漏掉违规成分),无法进行选择式不遵从。

难点与重要性

选择式不遵从要求模型将查询分解为独立成分,分别判断其正确性、可回答性、安全性和可行性,再生成部分回答并明确拒绝不可回答部分。这种细粒度推理对 VLM 的视觉理解、知识边界判断和输出解耦能力提出更高要求,远超出单一分类或生成任务。业界 VLM 正大规模嵌入对话与多模态助手,混合意图查询频繁出现,处理不当直接导致用户信任下降或安全风险。

行业类比

类似智能客服收到一条同时包含“查询订单状态”和“预测未来股价”的消息:模型需正常回答前者,同时对后者明确表示无法提供预测。

核心洞察

  • - 选择性不遵从是视觉语言模型真实部署中被忽视的核心能力,KoNA 通过组件级评估首次系统化暴露了这一缺口。现有基准将查询视为整体,假设每个请求要么完全遵从要么完全拒绝,无法捕捉混合意图查询中需要只回答部分内容、同时拒绝其他部分的场景。KoNA 定义五类不遵从(虚假前提、视觉不可达、普适未知、任务不可行、安全),并设计成对单查询与复合查询,量化了模型在组件级判断上的脆弱性,填补了基准空白。
  • - 针对选择性不遵从的定向微调策略有效平衡了拒绝准确率与有用性,优于仅依赖推理时提示的方法。论文混合使用需要选择性不遵从的 KoNA 示例与可完全回答的样本进行微调,模型学会在回答可答成分的同时拒绝不可答成分,而非简单整体拒绝。这种训练策略显著提升不遵从准确率,并在可回答任务上保持性能稳定,表明通过数据构造而非提示工程能更稳定地注入选择性判断能力。

方法

输入:图像-文本查询对,覆盖五类需要非合规的场景:虚假前提、视觉不可达、普遍未知、任务不可行、安全。每个任务同时提供单查询(整体唯一非合规)和复合查询(混合可回答与需拒绝组件)。

关键模块:基准构建通过程序化模板与人工筛选生成,确保复合查询中可回答部分真实有效,拒绝组件有明确理由。评估分查询级 和组件级 两个粒度,组件级要求模型只能回答可回答部分并明确拒绝或纠正其余部分。

训练模块:微调时混合 KoNA 中要求选择性非合规的样本与完全可回答样本,采用 GRPO(Group Relative Policy Optimization)进行强化学习优化。奖励函数设计为:正确回答可回答部分并准确拒绝不可回答部分获最高奖励,完全错误回答或遗漏拒绝则受到惩罚,完全可回答样本的正确直接回答也给予正向奖励。数据划分与奖励细节见附录。

输出:微调后模型在五类任务上查询级和组件级非合规准确率显著提升,且保持对完全可回答查询的正常高频响应,缓解过度拒绝与错误合规。

与同类 VLM 非合规基准的差异点:现有工作仅评估整个查询的二元拒绝或回答,KoNA 首次引入组件级选择性非合规,并要求模型同样擅长完全回答任务,更贴近真实混合请求。

实验

实验设计

KoNA 基准包含五类任务:False Premise、Visual Inaccessibility、Universal Unknown、Task Feasibility 和 Safety,每类同时评估查询级与组件级非合规能力。实验首先对多个主流 VLM 进行零样本测试,随后在 KoNA 中选取需要选择性非合规的样本,并补充一个完全可回答集,对 VLM 进行微调。对比实验包括推理时提示(inference-time prompting)与微调两种策略。

关键发现

  • 现有 VLM 在整体查询非合规上表现不佳,在复合查询(需局部拒绝/纠正)中失败率显著升高。
  • 推理时提示带来的改善有限,而微调后模型在非合规准确率上获得大幅提升,且在完全可回答任务上性能基本持平。
  • 微调模型能够区分可回答部分与需拒绝部分,实现任务恰当的组件级响应。

与基线对比解读

基线失败源于模型倾向于对查询整体给出统一响应,缺乏局部拒绝或纠正的机制。微调通过注入组件级监督信号,使模型学会对混合查询进行细粒度处理,因此明显优于仅依赖提示的策略。该结果说明,对于真实场景中常见的部分可回答查询,需要构造混合数据集进行针对性训练,而非仅依靠推理时的指令引导。

行业影响

落地场景

KoNA 基准及微调方法可嵌入多模态 AI 助手、电商客服、内容审核、教育解题与医疗影像辅助等产品。典型场景如电商商品咨询:用户上传商品图并问“这件衣服的成分是什么?洗涤剂含致癌物吗?”系统需回答前者,拒绝后者。内容平台审核:用户上传图片并附带问题“图中人物是谁?如何规避版权检测?”前者可答,后者应拒绝。

商业价值

选择性不遵守直接降低错误合规风险 与 过度拒绝 造成的体验损失。错误回答安全/医学问题可能引发法律与声誉成本;整体拒绝则流失用户。精准区分可答与不可答部分,能提升自动化率,减少人工复审量,在客服与审核场景中降低人力成本,同时维持用户信任。

与现有工作流接口

将 KoNA 数据集作为评估集 与微调数据,可接入现有 VLM 训练流水线:在 SFT/RLHF 阶段加入混合查询样本,配合可答集合 防止过度拒绝。推理阶段可用轻量提示词或分类器预判组件类型。工程上可通过 奖励建模 或 GRPO(论文所用)在现有 RL 框架内实现,无需重构模型架构,兼容主流多模态训练栈。

局限

  • **KoNA** 基准依赖 LLM 合成与自动过滤生成数据,可能引入标注噪声或分布偏差。该基准仅覆盖五类预定义的不遵从类别,难以泛化到真实世界复杂混合查询中的其他情境,如隐式不安全内容、多模态冲突或模糊指代。此外,评测数据规模未公开细节,可能影响 fine-tune 后的泛化能力。
  • 实验主要在开源 VLM(如 LLaVA 系列)上进行,未包含闭源商业模型(如 GPT-4V、Gemini),而这些模型在实际部署中占比很高。模型微调使用 KoNA 自身数据,存在与评测集同源导致的过拟合风险;跨基准评估虽尝试缓解,但覆盖度和结论说服力有限。选择性不遵从的指标依赖 LLM judge,其准确性和一致性缺乏大规模人工验证。
  • 该工作仅关注单轮静态图像问答,未涉及多轮对话、视频输入或真实交互场景,而这些场景中混合意图和上下文依赖更复杂,对选择性不遵从要求更高。与已有 VLM 安全基准相比,创新点主要在 component-level 评估,但解决方法仍是常规的 SFT 或 GRPO fine-tune,未提出新架构或训练范式,因此对根本性提升模型不遵从能力的贡献有限。
论文Minji Kim2026-09-04原文

相关内容