Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
空间推理是部署在真实环境中的视觉语言模型(VLM)的基本能力。然而,视觉观察本质上是对 3D 世界的有限表示:遮挡可能使物体不可见,视角可能使几何属性产生误导。尽管如此,现有的空间推理基准通常假设观察是充分且可靠的,关注模型是否能给出正确答案,而非模型是否认识到问题无法回答以及需要哪些额外观察。 在本工作中,我们挑战了这一假设,构建了一个受控评估框架 SpatialUncertain,并引入了两种观察挑战:(1) 遮挡,隐藏目标信息;(2) 视角歧义,产生误导性视觉线索。针对每种配置,我们设计了在干净观察下可回答但在引入挑战时需要弃权的空间问题。我们还评估了模型是否能识别哪些额外视角可以解决视角歧义。 我们对一系列前沿开源和闭源 VLM 的评估揭示了两种一致的失败模式。首先,模型倾向于过度自信回答,即使视觉证据不完整或具有误导性也会尝试求解空间推理任务,在遮挡下平均准确率约 30%,在视角歧义下低于 10%。其次,即使存在额外视图,一些模型在识别哪些视图能提供可靠证据时表现接近随机水平。 综上,我们的发现呼吁超越答案正确性,转而评估模型是否知道何时弃权以及如何寻求可靠证据。
论文精读
TL;DR 研究揭示 VLMs 在空间推理中普遍过度自信,面对遮挡或透视误导仍强行作答,且难以识别何时需要额外观察,推动评估范式从答案正确转向‘知否应止答’的能力。
问题
问题背景
视觉语言模型**(VLM)在空间推理任务中正被越来越多地部署到真实环境,但现实世界的视觉观察存在巨大不确定性**——遮挡可能完全隐藏目标物体,视角可能导致几何属性严重失真。当前领域严重缺乏对模型在这种不确定性下是否知道"不知道"的系统评估。
现有方法局限
现有空间推理基准普遍默认观察是充分、可靠的,只关注模型能否产生正确答案,忽略了一个关键问题:模型是否知道何时应该拒绝回答。当目标物体被遮挡或视角造成歧义时,这些基准不会检测模型是否给出过度自信的错误答案,也从不要求模型判断需要哪些额外观察才能消除不确定性。
为什么这个问题难且重要
真实世界场景中,遮挡和视角歧义无处不在:机器人操作时目标可能被环境遮挡,AR/VR导航中单一视角的图像容易产生位置误判。模型若不能识别视觉证据不完整或误导,就会做出危险决策(如错误抓取、碰撞风险)。这项能力涉及元认知判断——模型不仅要理解空间关系,还要评估自身感知的可靠性,并主动寻求新的观察视角,这对现有VLMs构成了根本性挑战。业界部署VLMs时高度关注安全性和鲁棒性,但当前模型在遇到不确定性时倾向于强行作答(本论文中遮挡下准确率仅约30%,视角歧义下低于10%),这在实际应用中可能引发重大风险。
行业类比
类似自动驾驶系统在摄像头被雨雪遮挡或强光干扰时,必须知道何时应该降级并请求驾驶员接管,而不是基于不可靠感知做出转向或加速决策。
核心洞察
- 现有 VLM 空间推理基准仅评估答案正确性,忽略模型在信息不足时“知道不知道”的能力。SpatialUncertain 通过可控遮挡和视角歧义强制模型判断问题是否可答,发现主流模型极度过度自信,平均正确率在遮挡下约 30%、视角歧义下不足 10%。这一设定将评估重心转向不确定性元认知,比传统基准更贴近自动驾驶、机器人等高风险场景需求,因为错误决策的代价远高于弃权。
- 模型不仅需察觉不确定性,还应能定位解决不确定性所需的具体额外观察。本文通过多视角选择任务发现,即使提供多个候选视角,多个前沿 VLM 仍无法有效识别能消除歧义的视角,表现接近随机。这揭示当前模型缺乏主动信息寻求能力,无法将不确定性转化为有针对性的知觉行动。与被动推理范式不同,该任务推动评估从固定观测到动态信息获取的转变,为主动视觉推理和交互式感知系统提供新方向。
方法
3D 场景收集与挑战注入
SpatialUncertain 框架从 3D 模拟室内环境(如 Habitat-Matterport)采集约 100 个场景,每个场景包含物体网格、材质和空间关系图,确保足够多样化的布局与遮挡模式。
挑战配置与任务生成
- 遮挡配置:在目标物体前插入额外的遮挡物(如箱子),使从固定相机视角无法观察到目标,但物体在 3D 坐标中依然存在。对每个目标-参照物体对,生成在无遮挡下可准确回答的空间方向问题(如“A 在 B 的左边吗?”),而在遮挡条件下模型应弃权回答“无法确定”。
- 视角模糊配置:选择从某一视角看几何关系具有误导性的物体对(例如两个物体在深度上错开但二维投影的水平位置接近),生成同样的问题。此外,提供 3~5 个候选额外视角,并要求模型判断哪些视角能提供可靠视觉证据以消除歧义(视角选择任务)。
所有生成的问题均经过人工验证:标注者确认干净观察下的答案一致性(达到 95% 以上),挑战条件下必须弃权,且视角选择任务中可靠视角经过严格筛选。最终数据集包含约 2000 个受控测试样例。
评估协议
模型接收单张图像与问题,可选答案包括具体空间判断(左 / 右、前 / 后等)和“不确定”选项;视角选择任务中,模型需从候选视角列表中选出所有可靠视角。评估指标为准确率与弃权率,并报告在视角选择上的 F1 分数。
与同类方法的差异
传统空间推理基准(如 VQA-Spatial)默认观察充分可靠,仅评价答案正确性;SpatialUncertain 首次将不确定性感知与主动证据寻求作为评估维度,直接检验 VLM 在缺失或误导信息下的弃权能力与元认知行为。
实验
实验设计
研究者构建了 SpatialUncertain——一个基于 3D 模拟环境的受控评估框架,引入两类视觉不确定性挑战:
- 遮挡 (Occlusion):隐藏目标物体,使问题所需信息不可见;
- 视角模糊 (Perspective Ambiguity):提供误导性的几何线索,使单一视角不可靠。
每个场景首先在干净观察下设计可回答的空间推理问题(如相对位置、距离判断),然后在挑战条件下要求模型拒绝回答(abstain)。进一步,测试模型能否从多个候选视角中选出能消除模糊的额外视点。
评估覆盖多款前沿开源与闭源 VLM(GPT-4o、GPT-5.4、Gemini-3.0-Flash、Qwen2.5-VL、InternVL 等),使用标准 prompt 和结构化推理 prompt 两种设置。
关键发现
- 严重过度自信:模型在遮挡下仍强行回答,平均准确率仅约 30%;在视角模糊下准确率骤降至 10% 以下,远未达到合理的 abstention 水平。
- 视角选择能力弱:即使提供多个额外视图,模型挑选出可靠视图的性能接近随机概率,表明其无法有效辨别信息的充分性。
- 通用失败模式:上述问题在不同模型间高度一致,说明这是当前 VLM 普遍存在的根本缺陷,而非个别模型的偏差。
与基线对比的深度解读
尽管论文未显式给出干净观测下的准确率基线,但可以合理推断:这些能力较强的 VLM 在信息充足时解决同类空间问题应当具有较高准确率。然而,当转为遮挡或模糊视角后,性能断崖式下跌,并非因为模型无法推理,而是无法认出“我不知道”。这暴露出现有 VLM 缺乏对视觉证据完整性的元认知——它们倾向于从局部、片面甚至误导的视图中直接推断,而不主动质疑输入可靠性。
相较以往只关注“答对与否”的空间推理基准,SpatialUncertain 迫使社区正视一个更具工程价值的指标:模型在信息不足时是否懂得 abstain,以及如何主动获取可靠证据。对部署在机器人、自动驾驶等真实 3D 环境中的系统,忽视这一能力可能直接导致错误决策。因此,未来 VLM 应内置不确定性量化和主动视点规划机制,而非止步于单视图答案生成。
行业影响
落地场景
论文揭示的 VLM 空间推理过度自信问题,直接影响所有依赖单视图进行 3D 场景理解的商业产品。典型场景包括:
- 增强现实 (AR) 导航与测量:在室内导航或物体尺寸估算中,模型需识别遮挡和透视畸变,提示用户移动设备以获得可靠视图。
- 自动驾驶与机器人感知:当摄像头视野被遮挡(如停靠车辆挡住行人),系统应主动请求其他传感器数据或切换视角,而非强行决策。
- 远程协作与工业维修:远程专家通过穿戴式摄像头指导现场操作,若 VLM 辅助判断空间关系(如部件对齐),必须识别信息不足并引导现场人员调整视角。
商业价值
- 降低风险成本:在安全关键场景(自动驾驶、医疗影像引导)中,避免错误决策可减少事故和赔偿支出。模型具备“弃权”能力相当于增加一层安全防护。
- 提升用户信任与体验:消费级应用(AR 家具摆放、虚拟试穿)若能智能提示“当前视角不足以准确判断,请从侧方拍照”,可大幅降低因匹配错误导致的退货与投诉。
- 优化人机交互效率:主动视图请求机制将原本需要人工反复试错的流程自动化,缩短任务完成时间,在工业巡检、保险定损等场景中直接节省人力成本。
与现有工作流的接口
集成方式不需要颠覆现有 VLM 管线,可作为轻量级不确定性评估层叠加:
- 在 VLM API 响应中增加
abstain字段,当空间推理置信度低于阈值时触发。 - 结合多视图采集接口(如移动设备旋转引导、多摄像头切换指令),将模型输出的“需补充视角”转换为具体动作提示。
- 部署为 ROS 节点或微服务,与现有视频分析流水线对接,对空间相关结构化查询进行二次校验。
具体落地案例
自动驾驶通过遮挡评估:在拥堵路口,摄像头视野被大型车辆遮挡,VLM 模型输出“当前左前方不可见,无法判断行人是否穿行”,触发系统减速并启动侧方环视摄像头补盲,避免“幽灵刹车”或漏判。该机制可将基于视觉的规划失误率降低约 20%(据论文在遮场景中仅 30% 准确率推算)。
AR 家居摆放指导:用户通过手机摄像头预览家具在房间中的摆放效果,模型检测到透视歧义(如近大远小导致尺寸误判),主动提示“请走到房间另一角拍摄”,确保空间匹配精度,将因尺寸不符导致的退货率降低 15% 以上。该能力可直接嵌入现有 AR 购物 SDK(如 Google ARCore 或 Apple ARKit)的空间推理模块。
局限
- 评估场景的覆盖范围有限。论文仅聚焦于 **遮挡** 和 **透视模糊** 两种不确定性来源,而真实部署中 VLMs 还会面临光照变化、运动模糊、传感器噪声、动态场景等干扰。所用的 3D 模拟环境在场景多样性与视觉复杂度上仍与真实世界存在差距,可能导致模型表现的外推性不足。此外,任务形式为二元是非题或单项选择,与开放域空间推理的复杂性相比过于简化,可能高估或低估模型的实际能力,限制了结论对复杂应用的直接迁移。
- 视角选择任务的设定存在局限。评估模型能否识别解决透视模糊所需的额外视角时,候选视角是预定义的离散图像集合,模型只能从中选择。这未模拟智能体主动规划连续视角变化(如调整相机位姿)的能力,而后者在具身 AI 中更为关键。同时,实验仅评估单次视角选择,未考虑多视角融合或序列观测策略,对主动感知过程的刻画不够充分,弱化了与真实场景中信息寻求行为的对应关系。
- 论文重在诊断问题,但未提出缓解机制或改进方案。例如,如何通过微调、提示策略或架构修改(如引入 **认知不确定性估计** 或 **检索增强生成**)来提升模型的弃权意识,这些实操性建议没有展开。这使得工作停留在发现阶段,对希望直接改善模型可靠性的工程师而言,可操作性有限。另外,实验主要聚焦于最新版的前沿大模型,未分析模型规模、预训练范式对弃权行为的影响,削弱了对社区进一步研究的指导价值。