Why Far Looks Up: 探究视觉-语言模型中的空间表征
视觉-语言模型(VLMs)在空间推理基准上表现强劲,但这究竟反映了结构化的 3D 理解,还是利用了自然图像中的统计捷径,尚不清楚。本文引入了一套表征级分析框架,通过构建最小对比对来衡量 VLM 嵌入中空间轴的组织和分离程度。 对多个模型族的分析揭示了一致的垂直-距离纠缠:模型混淆了图像垂直位置与距离,反映了自然照片的透视偏差。这种偏差在透视一致和反启发式示例之间产生了显著的准确率差距,且随着数据规模扩大而加剧,尽管整体基准准确率在提升。进一步研究发现,基准分数相似的模型可能具有不同的内部表征,这些差异能预测不同空间推理基准的准确率和鲁棒性。 为将这种偏差与评估集偏斜分离,我们引入了SpatialTunnel,一个合成基准,通过移除自然图像中常见的相关性来暴露空间捷径偏差。实验确认该纠缠是模型固有的,且具有良好分离空间轴的模型表现出更强的鲁棒性,表明结构良好的空间表征能带来更可靠的空间推理。代码和基准位于项目页面:https://cheolhong0916.github.io/whyfarlooksup.github.io/
论文精读
TL;DR 发现视觉语言模型将图像垂直位置与距离混淆,导致空间推理存在系统性偏见,并提出表征分析框架与合成基准揭示此捷径。
问题
问题背景
视觉语言模型(VLMs)在空间推理基准上表现出色,引发了对模型是否真正具备结构化 3D 理解能力的讨论:它们究竟学到了深度、距离等几何关系,还是仅仅利用了自然图像中的统计相关性。
现有方法局限
当前评估主要依赖行为基准(behavioral benchmarks),通过端到端任务准确率来判断模型能力。这类基准存在两个核心局限:
- 分布偏差:自然图像中物体垂直位置与距离高度相关(越远越靠上方),基准数据通常隐式继承这一透视偏差,使得依赖垂直位置捷径的模型也能取得高分,无法区分真实理解与统计记忆。
- 表征不透明:相同准确率的模型可能具有截然不同的内部空间表征,而基准分数无法揭示模型是否将“上下”与“远近”这一对正交轴恰当解耦。即使模型整体准确率高,也可能在反透视直觉的边缘案例(counter-heuristic examples)上系统失败。
问题难点与重要性
空间推理是具身智能、增强现实、机器人操作等应用的基础能力,其核心挑战在于视角投影偏差(perspective projection bias):2D 图像丢失了深度信息,模型容易将垂直位置作为深度快捷代理。这种纠缠在自然数据中合理,但面对视角变化、非典型场景(如俯视、广角畸变)时会导致灾难性错误。更棘手的是,数据规模扩大可能掩盖而非消除偏差——论文发现更大模型或更多训练数据会提高基准分数,但垂直-距离纠缠反而加剧,形成“高分数但低鲁棒性”的假象。业界需要一种超越行为评分、能透视表征质量的诊断方法,以确保空间推理的可靠性。
行业类比
类似自动驾驶中,若感知模型仅通过图像中物体高度来判断距离(如同抬头看天则远、低头看地则近),一旦遇到上坡、空中物体或传感器外参变化就会严重误判,而行为指标可能直到安全事故发生前一直“正常”。
核心洞察
- VLMs 并非真正理解 3D 空间,而是依赖垂直位置与距离的统计纠缠——物体在图像中越靠上,模型就认为它越远,这正是自然图像透视偏差的体现。以往空间推理评估大多只看基准准确率,忽略了模型内部表征是否结构化;该工作首次通过最小对比对直接测量空间轴的解耦程度,发现这种纠缠普遍存在于多个模型家族,且无法通过简单的数据缩放消除。
- 随着模型容量和训练数据增加,整体空间推理准确率上升,但垂直-距离纠缠指数不降反升,说明更大规模的训练反而强化了这种捷径偏差。这与“更大模型自然会学到更鲁棒表征”的常见假设相悖,揭示了当前训练范式在空间认知上的根本局限:模型在适应数据分布偏差,而非习得几何一致的内部表征。该洞察对数据工程与模型评估的启示是,必须显式解耦轴表征,或者构造去偏的合成数据来引导学习。
方法
分析框架
论文提出一套表征级别分析框架,从 VLM 的嵌入空间直接测量空间轴的组织与解缠程度,而非仅依赖下游基准准确率。核心线索为“输入图像对 → 对比探针 → 纠缠指数”。
1. 透视偏置定义
首先形式化 垂直-距离纠缠 (vertical-distance entanglement) :由于真实世界的透视投影,图像中物体的垂直位置与到相机的深度高度相关。模型可能将“物体离地平面越近 = 越远”作为统计捷径,尤其在自然图像中该相关性极强。作者划分两类样本:
- 透视一致 (perspective-consistent):垂直位置与真实距离同向变化。
- 反启发 (counter-heuristic):垂直位置与距离反向(例如,远处物体却位于图像下方),依赖捷径会导致错误。
2. 合成基准 SpatialTunnel
为排除自然图像的混杂偏置,构建 SpatialTunnel 合成数据集。通过程序化生成隧道场景,精确控制物体放置和相机参数,系统性地破坏垂直位置与距离的共现关系。该基准完全由渲染的简单几何体组成,去除纹理、光照等干扰,确保模型的判断仅基于空间线索。
3. 对比探针 (Contrastive Probing)
核心创新是对比探针方法:
- 构建最小对比对:选取两张图像,仅改变一个空间属性(如物体距离),而其他属性(水平位置、大小)保持恒定。
- 轴一致性 (axis coherence) 度量:在 VLM 的某个中间层,提取对比对的嵌入差异向量,计算该差异与参考轴(如纯距离变化方向)的余弦相似度。若模型内部对某轴的编码与其他轴解缠,则差异向量应与该轴的参考方向高度一致。
- 垂直-距离纠缠指数 (VD-EI):通过对比“固定距离仅改变垂直位置”与“固定垂直位置仅改变距离”的嵌入变化,量化两个轴的相互干扰程度。
4. 表征强度与鲁棒性关联
对多个模型家族 (Molmo, Qwen-VL, NVILA) 执行探针,发现:
- 距离一致性 是所有空间轴中最低的,且在数据规模增大时模型的总准确率上升,但纠缠强度反而加剧。
- 反启发样本的准确率与距离一致性的提升同步,说明解缠的空间表征直接贡献于推理稳健性。
- 即使基准分数相近,内部表征结构差异仍可预测跨数据集的泛化性能。
与同类方法的差异
不同于常见的行为测试(只看最终答案正确率),该方法透过“黑色”嵌入空间,用对比探针直接读取并分解空间轴组织,首次量化了 VLM 内在的透视偏置,为诊断和改进空间推理能力提供了解剖式工具。
实验
实验设计:本文提出一种基于最小对比对的表示级分析框架,用于探测视觉语言模型(VLM)嵌入空间中“空间轴”的组织与解耦程度。通过构造透视一致(perspective-consistent)与反直觉(counter-heuristic)的图像对,测量嵌入向量的轴间一致性,量化模型是否将垂直位置与距离纠缠。同时,构建合成基准 SpatialTunnel,刻意移除自然图像中“近处物体在图像下方”等共现相关性,以隔离空间捷径偏差。分析覆盖 Molmo、NVILA、Qwen2.5-VL、Qwen3-VL 等多个模型家族,选取模型中间层进行探测。
关键发现:所有受测模型均表现出显著的 VD-Entanglement(垂直-距离纠缠):模型将图像中较高的位置解释为更远,与自然照片的透视投影偏一致。这导致透视一致样例上的高准确率与反直觉样例上的大幅下降,形成显著的 accuracy gap。更令人担忧的是,随着数据规模扩大,现有基准的整体准确率提升,但 VD-Entanglement 指数反而增强,说明模型并未真正学会空间推理,而是依赖统计捷径。此外,基准分数相近的模型其内部空间表示结构可能存在本质差异,这些差异能有效预测它们在不同基准上的准确率和鲁棒性。在 SpatialTunnel 上,空间轴分离程度越好的模型表现越鲁棒,验证了结构化良好的空间表示是可靠空间推理的基础。
与基线对比的解读:现有空间推理基准(如 BLINK)的数据分布天然偏向透视一致样例,高估了模型能力。SpatialTunnel 通过控制共现相关,暴露了模型依赖捷径而非结构化 3D 理解的本质。与仅报告最终得数不同,该工作深入到表示层,区分了“高分但脆弱”与“分数平庸但表示结构良好”的模型,为评估与提升 VLM 空间推理能力提供了新的诊断工具。
行业影响
落地场景
视觉语言模型(VLM)的空间理解偏差可直接影响依赖精确 3D 推断的产品。自动驾驶感知 中,模型若将物体在图像中的垂直位置与距离强绑定,在坡道、俯仰变化的场景下可能误判障碍物远近,引发安全风险。增强现实(AR)与机器人抓取 任务中,错位会妨碍物体位姿估计与操作规划。此外,医学影像分析(如 CT/MRI 深度估计)、遥感与 GIS 应用、电商虚拟试穿/家具摆放 等场景均需模型可靠地解耦高度与距离。
商业价值
该工作揭示的现象直接关联模型鲁棒性与部署安全。单纯追求基准准确率可能掩盖对强相关捷径的依赖,导致真实边缘案例严重误判。通过引入表示层面的诊断指标(如 VD-Entanglement Index),企业可在模型选型、迭代时提前筛选出内部空间轴对齐更好的版本,降低长尾事故概率,减少召回与赔偿成本。同时,针对解耦空间表征优化训练数据配比或模型架构,可提升跨域泛化能力,使同一模型适应多种环境(室内/室外、不同相机参数),减少重复适配开销。
与现有工作流集成
现有 VLM 评测多为行为基准,论文的对比探测(Contrastive Probing)框架 可作为无标注诊断模块嵌入 MLOps 流程:
- 在模型训练与数据治理阶段,使用最小对比对探测内部表示,检测垂直-距离纠缠,指导数据增强以削弱图像高度与真实距离的相关性;
- 在模型评估阶段,集成
SpatialTunnel类合成基准,剥离自然图像中的混杂因素,纯化空间推理测试; - 在模型选型中,将表示分离度作为与准确率并列的硬指标,避免选择在标准榜单上高分但内部表征劣化的候选模型。
具体落地案例
- 自动驾驶感知栈:部署前用对比探测分析下游检测/测距模型的视觉编码器,若发现 VD 纠缠度高,则通过添加俯仰角增强、路标高度随机化等策略重训,防止下坡场景将路面上方车辆误判为远处;
- 电商 3D 商品展示:在家具 AR 摆放功能中,对用户上传的房间照片进行深度推理时,若模型仅靠垂直位置估计距离,天花板角落的物品可能被推远,通过探测筛选并替换为空间轴解耦更佳的模型,可显著提升摆放位置与尺度的合理性,改善用户交互体验。
局限
- - **模型覆盖范围与分析深度**:分析主要集中在特定 VLM 家族(如 Molmo、NVILA、Qwen 系列),虽然包含不同参数规模,但未涵盖更多闭源模型(如 GPT-4V、Gemini 等)以及更广泛的训练范式。此外,只聚焦于“垂直-距离”纠缠,空间推理中其他类型的偏差(如方位、尺度、遮挡关系)未纳入分析框架,可能高估了该单一偏差的普遍重要性。对于真实世界复杂场景,仅凭合成基准 SpatialTunnel 难以完全反映模型在实际部署中的行为全貌。
- - **分析方法的相关性局限**:对比探测(contrastive probing)本质上是一种相关性分析,即使发现表示维度的纠缠与性能相关,也无法确立因果关系。该工作未引入干预实验(如 causal probing 或表示编辑)来验证垂直-距离纠缠是否直接导致推理错误,或仅是与模型能力共同变化的伴随现象。因此,从诊断到可操作的模型改进之间仍存在鸿沟。