SPACENUM: 重新审视VLM中的空间数值理解
视觉-语言模型(VLM)越来越多地部署在具身环境中,需要输出动作幅度和空间坐标等数值。然而,这些数值是否真正基于空间感知仍不明确。本文通过SpaceNum框架重新审视空间数值理解,该框架包含两个互补场景:空间探索中的数值作为动态转换,空间推理中的数值作为静态布局。 我们设计了Num2Space和Space2Num两种双向任务,评估VLM在视觉空间结构与语言数值表示之间的映射能力。系统研究表明,当前VLM在空间场景中未能真正理解数值含义,性能接近随机猜测。 通过错误分析、推理轨迹分析和控制干预,我们发现VLM严重依赖浅层空间线索,难以建立稳定的坐标感知表示,且无法从视觉观察中抽象出结构化空间布局。进一步实验表明,显式推理仅带来微小提升,而微调可以部分改善空间数值理解,并迁移到外部空间推理基准。
论文精读
TL;DR SpaceNum 框架通过双向任务系统评估 VLMs,发现其输出的空间数值多依赖浅层视觉线索、缺乏真正的坐标感知,在动态与静态场景下均接近随机水平,揭示了当前模型在空间数值理解上的根本缺陷。
问题
问题背景
在具身智能场景中,Vision-Language Models (VLMs) 越来越多地被要求输出动作幅度、空间坐标等数值。这些数值看似有意义,但模型是否真正具备 空间数值理解 (spatial numerical understanding) 尚不明确。当前领域开始关注 VLMs 在空间任务中的数值 grounding 能力,而不仅仅是视觉问答或语言生成。
现有方法局限
现有评估多直接检查数值输出的准确率,却忽略了 VLMs 是否建立了从图像空间结构到语言数值表示的稳定映射。本研究通过 SpaceNum 框架揭示了三个关键缺陷:
- 浅层线索依赖:模型倾向于利用物体大小等表面特征推断距离或坐标,而非构建坐标系感知的表征。例如,在动态过渡任务中,模型仅比较视野中的物体尺寸变化,却无法进行精细的位移对比。
- 反事实推理失败:当要求模型预测不同运动幅度下的观察结果时,性能接近随机。模型无法将“数值变化”与“空间变化”抽象关联。
- 图像空间 vs 定义坐标系混淆:模型常在图像像素空间推理,而非遵循任务定义的物理坐标系,导致数值输出缺乏几何一致性。
这些局限表明,单纯扩大模型规模或使用通用训练范式无法自动获得空间数值理解。
为什么这个问题难/重要
空间数值理解横跨连续空间与离散符号的鸿沟,要求模型内化度量、尺度、相对位置等结构化概念。这对当前的 vision-language alignment 范式提出根本挑战:标准对比预训练擅长匹配语义,却难以编码精确的度量关系。业界关注度持续攀升,因为 VLMs 正在进入机器人操作、自主导航等安全关键领域。若模型仅凭视觉捷径生成数值,可能导致灾难性的动作误差。此外,在 embodied AI 基准中,空间数值能力常被间接评估,缺乏专门诊断工具,使得问题长期隐藏。
行业类比
类似自动驾驶系统中,若感知模型仅通过图像纹理“猜”距离,而非基于几何重建或深度估计,面对恶劣天气或遮挡时就会输出危险的控制指令。SpaceNum 揭示的正是 VLMs 中这种“对数值的空洞表达” —— 看似流畅,实则缺乏空间 grounding。
核心洞察
- VLMs 的数值输出在空间任务中呈现“合理但未扎根”的幻觉:模型输出的数字看似有意义,实则依赖表面的视觉纹理而非坐标感知,因此大规模预训练并未自动建立起结构化的空间数值映射,与人类基于度量的空间推理存在根本差异。该发现颠覆了仅通过语言困惑度评估数值输出的常规做法,提示在具身场景中必须引入双向验证指标。
- Num2Space 与 Space2Num 双向任务设计首次系统解耦了视觉到语言和语言到视觉的映射不对称性,发现模型在“由数到空间”与“由空间到数”之间表现严重失衡,甚至接近随机猜测,而现有基准多仅评测单一方向,掩盖了这一关键脆弱性。
- 显式推理(如思维链)对空间数值理解的增益微小,表明模型并非因缺少计算步骤而失效,而是缺乏稳定的坐标感知中间表征;通过可控视觉干预进一步证明,模型在图像空间与定义坐标系之间错误切换,揭示出从像素到布局的抽象能力是当前 VLM 空间推理的真正瓶颈。
方法
SpaceNum 框架:空间数值理解的统一评估
SpaceNum 构建了一个双向映射评估体系,系统探查 VLMs 是否真正将数值输出与视觉空间结构对齐。框架围绕两种互补场景展开:动态过渡(动作幅度导致空间变化)和静态布局(空间坐标与视觉位置对应),并定义了两个互逆任务:
- Num2Space:给定数值(如移动距离或坐标),模型从多张候选图片中选出正确空间状态。
- Space2Num:给定空间状态(图片对或布局图),模型预测对应的数值(如步长、坐标)。
数据生成与平台
数据基于高保真模拟环境(如 Habitat-Sim)自动生成,通过程序化控制物体位置、相机运动和坐标标注,确保视觉与数值严格对应。动态数据记录连续帧间的相对运动;静态数据渲染随机布局,并标注每个物体的像素位置与标准化坐标。
评估流程与干预设计
模型以视觉问答形式参与测试,输出为选项索引或直接数值。除零样本评估外,还设计了三类受控实验以分离影响因素:
- 视觉干预:对图片施加遮挡、平移等扰动,检验模型是否依赖浅层视觉线索。
- 数值表征干预:更换坐标格式(如笛卡尔坐标 vs. 极坐标),观察模型对数值系统的敏感性。
- 结构抽象干预:输入改为物体关系图而非原始图片,探测模型能否脱离像素级特征提取空间结构。
额外分析模块
- 推理轨迹分析:收集 CoT 输出,发现模型常进行粗略空间比较(如“左边物体更大”)即止,未能执行精细坐标推演。
- 迁移实验:在 SpaceNum 上微调,测试对外部空间推理基准(如 BLINK、MMVP)的泛化能力,并探索数据组合与强化学习奖励的影响。
与同类方法的差异:传统空间推理基准多关注相对方位或物体存在性,SpaceNum 首次将评估聚焦于数值输出的空间基础性,并通过双向任务强制解耦视觉理解与数值映射,更精准地暴露 VLMs 的“坐标盲”问题。
实验
实验设计
SpaceNum 构建了统一的空间数值理解评估框架,涵盖两种设定:动态迁移(数字作为空间探索中的动作幅度)和静态布局(数字作为空间推理中的坐标布局)。基于此定义了两个双向任务:Num2Space(给定数字,匹配或生成空间配置)和 Space2Num(给定空间观察,预测对应数值)。研究系统评估了主流视觉语言模型(VLM)在这些任务上的表现,并通过错误分析、推理轨迹分析及对照干预实验,探究模型的空间数值映射机制。
关键发现
当前 VLM 在空间数值理解上表现极差,大量模型接近随机猜测,无法真正将数字与空间感知对齐。错误分析表明,模型严重依赖浅层空间线索(如物体大致位置),而非构建稳定的坐标感知表示;无法进行细粒度对比和反事实推理;推理通常在图像空间而非定义的坐标系中进行。显式推理带来的增益有限,但通过针对性微调(包括强化学习)能够部分改善该能力,并在外部空间推理基准上实现迁移。
对基线对比的解读
与先前侧重定性空间理解的基准不同,SpaceNum 直接量化VLMs 将视觉结构与数值表示双向映射的能力。实验揭示了一种根本性的能力缺失:即使是参数量更大的模型,也只是犯“更好的错误”,而非真正理解空间数值关系。这挑战了当前 VLMs 在具身智能等需要精确数值输出的场景中的可靠性。微调实验指出数据配方与奖励设计的重要性,为未来提升空间数值理解指明了方向。
行业影响
落地场景
SpaceNum 揭示的 VLM 空间数值理解缺陷,直接冲击所有依赖视觉-语言模型输出精确空间量的产品:
- 具身智能:服务机器人根据指令移动到目标坐标、机械臂抓取指定位置物体时,模型若缺乏真正的坐标感知,将导致操作失败。SpaceNum 的 Num2Space/Space2Num 范式可作为机器人 VLM 感知模块的必测基准。
- 自动驾驶与高级辅助驾驶:车辆需根据视觉输入预测行人意图、距离与速度数值,若模型仅依赖浅层纹理线索而非空间结构,会在复杂光照或遮挡下给出危险指令。
- AR/VR 空间标注与导航:眼镜设备通过 VLM 理解用户“把虚拟物体放在桌子右上角”的语音指令,若空间数值映射错误,用户体验崩溃。
商业价值
- 降低安全风险与召回成本:在自动驾驶、手术机器人等高风险场景,空间数值理解的可靠性直接决定产品能否通过合规验证。SpaceNum 提供的系统化评估可提前暴露模型短板,避免因感知错误导致的事故与诉讼。
- 加速具身智能产品落地:当前仓储、配送机器人常因视觉语言理解偏差卡在试点阶段。使用 SpaceNum 框架微调模型,可提升空间推理能力的可迁移性(论文显示微调后部分任务提升并迁移至外部基准),减少人工远程干预,提升运营效率与客户满意度。
- 提高开发者效率:模型选型时,产品团队可通过 Num2Space/Space2Num 双向任务量化 VLM 的空间理解成熟度,避免在无效模型上投入过多工程适配资源。
与现有产品 / 工作流的接口
SpaceNum 可无缝嵌入 MLOps 流程:
- 模型评估阶段:在集成测试中加入 SpaceNum 评测集(包括动态过渡与静态布局),与通用 VLM benchmark 互补,衡量空间推理专项能力。
- 微调与对齐:利用
SpaceNum-ft数据配方(论文中提及的微调策略)对 VLM 进行轻量级 instruction tuning,改善空间数值理解,输出模块可直接替换现有机器人规划器中的 VLM 组件。 - 推理增强:在现有 VLM 推理 pipeline 中加入显式空间推理链(虽然论文指出纯推理增益有限,但可作为辅助验证层),结合后处理校验模块(如度量一致性检查)过滤异常坐标。
具体落地用例
- 电商仓库机器人拣选:系统接收“将第三层货架左侧第二个箱子移到打包台”的语音指令,需要将空间描述转化为机械臂运动数值。利用 SpaceNum 筛选和微调 VLM,确保模型能理解货架布局的静态空间关系,正确输出抓取坐标。
- 手术机器人术前规划辅助:内窥镜画面中,医生口头标记“在距贲门 3cm 处切除”,VLM 需将视觉结构与距离数值对齐。通过 SpaceNum 的 Num2Space 任务验证模型能否依据病灶位置正确输出对应图像区域的坐标,避免手术引导偏差。
局限
- - 论文评估的VLM模型范围有限,主要覆盖了通用开源模型(如LLaVA、Qwen-VL等),未纳入针对具身场景专门微调的领域模型或更大规模的商用模型(如Gemini Pro Vision等)。这可能导致结论偏向悲观,且无法断定是否通过领域适应能显著改善空间数值理解。此外,动态和静态任务均在相对简单的合成室内场景(基于AI2-THOR)中测试,缺乏真实世界噪声、视角变化和物体多样性,外部效度不足。 - 数据集构造依赖程序化生成,空间数值映射的复杂度和组合性受限。Num2Space和Space2Num双向任务虽然巧妙,但仅覆盖欧几里得坐标和有限的动作幅度,与现实具身任务中丰富的语义空间关系(如“在桌子左侧”)和交互尚有差距。模型可能仅在封闭的数值表达格式(如[x, y])上表现差,但在更自然的语言描述中可能隐含空间理解,实验设计未充分对比。 - 论文提出的微调策略(SFT和RL)改善幅度有限,且RL奖励设计高度依赖人工定义,泛化性存疑。分析表明模型难以构建坐标感知的稳定表示,但未探索引入额外空间先验(如深度图、点云或空间图)或多模态融合对空间数值理解的增益。与近期显式3D/2D空间融入VLM的工作(如SpatialVLM、3D-LLM)对比,该工作未充分利用结构化空间表征,限制了提升空间认知的路径探索。