论文

SpatialBlock: 通过合成积木堆叠问题增强 LVLMs 的空间智能

SpatialBlock: 通过合成积木堆叠问题增强 LVLMs 的空间智能

Large Vision-Language Models (LVLMs) 在多种视觉任务上已取得强劲表现,但其重建并推理 2D 图像所描绘场景的 3D 结构的能力——即 空间智能 ——仍然有限。现有方法通常借助需要密集几何标注的真实场景空间问答数据集来弥补这一差距,然而此类标签的构建成本高昂、耗时,且因依赖外部感知模块而往往带有噪声。 本文提出一种受人类认知发展启发的新范式:通过结构化的积木操作任务学习基础空间技能。为此,我们构建了 SpatialBlock-15k,一个包含 15,000 个积木堆叠问题的合成数据集,覆盖 3D-to-2D 投影、视角变换 与 结构组合。该数据集还引入可控的颜色调制作为视觉线索,以促进视觉复杂条件下的 锚点式推理。 实验表明,无论是采用直接作答还是基于推理的预测,在该数据集上训练的 LVLMs 均显著优于基线,并能泛化到真实世界空间任务;尽管数据集本身是合成且紧凑的,这一效果依然成立。代码与数据见 https://github.com/rsoohyun/SpatialBlock。

论文精读

TL;DR SpatialBlock 用 15k 合成积木堆叠问题训练 LVLM,覆盖 3D 投影、视角变换与结构组合,加入颜色锚点强化推理,在真实空间任务上显著泛化。

问题

空间智能 指从 2D 图像重建与推理 3D 场景结构的能力,是 LVLMs 尚未充分掌握的短板。尽管 LVLMs 在 VQA、图像描述等语义任务上表现优异,但在深度估计、视角变换、遮挡推理等空间任务上仍落后于专用模型。

现有方法局限

当前提升空间智能的主流方案依赖真实场景空间问答数据集,如 ScanQA、SpatialVQA 等。这些数据集需要逐帧标注相机位姿、深度图、物体 6D 位姿或点云配准信息,构建成本高、周期长;同时,许多标注通过外部感知模块(如深度估计器、分割模型)自动生成伪标签,继承了上游模块的系统性偏差与噪声,导致数据质量不可控。模型在有限真实场景分布上训练,难以覆盖多视角、多遮挡组合的边界情况,泛化性弱。

为什么这个问题难且重要

3D 理解要求网络从单张 RGB 图中恢复缺失的深度信息与不可见表面,这本质上是病态逆问题;而 LVLMs 的预训练目标主要优化语义对齐,并未注入显式的几何先验。空间推理能力是具身智能、AR/VR、机器人操作 等下游任务的基础,业界迫切需要低成本、可控、可扩展的训练数据来补齐这一能力。

行业类比

类似自动驾驶用程序化仿真生成 corner case 来训练感知模型,SpatialBlock 通过合成块堆叠问题自动生成精确几何标签,规避真实标注噪声,为空间智能提供可复现的测试与训练环境。

核心洞察

  • 合成积木堆叠任务将空间智能分解为 3D-to-2D 投影、视角变换和结构组合,以程序化方式生成低成本、无噪声的训练样本。 与依赖真实场景密集几何标注的现有方法相比,该设计避免了外部感知模块引入的噪声和昂贵标注成本。通过控制场景复杂度和视角变化,模型可专注于学习空间关系推理的核心机制,类似人类通过积木游戏发展空间认知,为 LVLMs 提供了一种高数据效率的课程式训练范式。
  • 颜色调制作为可控视觉锚点,显式引导模型进行 anchor-based reasoning,提升复杂视觉条件下的空间对齐能力。 在积木堆叠问题中引入受控颜色变化,为同一物体在不同视角或组合下提供稳定可识别的锚点特征。与仅依赖几何形状的数据集相比,该设计迫使模型利用颜色线索进行物体对应和结构推理,模拟人类在复杂场景中依靠显著标记定位。实验表明该机制不仅提升合成任务表现,还促进向真实世界空间任务泛化,证明了视觉线索设计对空间智能迁移的关键作用。

方法

输入 为合成 3D 块堆叠场景的 2D 渲染图像,配以三种结构化问题类型:3D 到 2D 投影、视角变换、结构组合。视觉上通过受控颜色调制生成 anchor blocks 作为显著线索,引导模型在复杂遮挡条件下进行锚点推理。

关键模块 分为数据生成与训练策略两部分:

  • 数据生成器基于几何约束自动构建 15k 样本,无需人工标注;每个问题附带 ground-truth 答案与可选推理链。
  • 训练策略包含两条路径:direct answer prediction(仅对问题直接输出答案)与 reasoning-based prediction(先显式生成推理步骤,再推导答案),后者可结合强化学习进一步优化推理质量。

输出 为目标问题的结构化答案,如投影位置、新视角下的块排列或组合后结构。训练目标采用标准自回归语言建模损失,不引入额外几何监督。

与同类方法的差异点在于:现有空间问答数据集依赖真实场景密集几何标注,成本高且噪声大;本方法通过合成块操作任务模拟人类认知发展中的基础空间技能学习,以极低成本的数据实现从合成域到真实空间任务的强泛化。

实验

实验设计

SpatialBlock-15k 包含 15,000 个合成积木堆叠问题,覆盖三类任务:3D-to-2D projection、viewpoint transformation、structural combination。数据引入受控颜色调制作为视觉线索,鼓励基于锚点的推理。实验比较两种训练范式:直接答案预测 与 基于推理的预测,并在合成域及真实场景空间任务上评估泛化能力。

关键发现

  • 在 SpatialBlock-15k 上训练后,LVLM 在合成测试集与真实场景空间推理任务中均显著优于未训练基线。
  • 基于推理的预测模型相比直接预测,在复杂视觉条件下表现更稳定,表明显式推理有助于空间智能迁移。
  • 数据集规模紧凑,但能覆盖核心 3D 空间技能,验证了合成数据用于空间智能训练的有效性。

与基线对比

  • 相比依赖真实场景稠密几何标注的方法,SpatialBlock 无需外部感知模块,标注成本低且噪声少。
  • 合成数据训练的模型能泛化到真实任务,说明块操作抽象出的底层空间规律可迁移。
  • 但论文未给出具体数值对比,需查看原文附录确认提升幅度。

行业影响

落地场景

SpatialBlock 训练的 LVLMs 可落地于需要 3D 空间推理的产品:

  • 电商 AR 导购:用户上传房间照片并询问“这张桌子能放进角落吗?”,模型需从 2D 图像重建 3D 结构,给出适配建议
  • 自动驾驶感知 QA:对车载图像进行空间关系问答(如“右侧车辆距离是否安全?”),辅助驾驶决策与数据标注质检
  • 教育空间思维训练:交互式积木拼搭题,反馈学生空间想象能力

商业价值

  • 降本:用 15k 合成数据替代昂贵真实场景几何标注,数据成本降低数十倍
  • 增收:电商导购转化率提升,AR 试摆放减少退货;自动驾驶数据闭环效率提高
  • 体验提升:用户获得更可靠的 3D 交互反馈,信任度上升

与现有工作流接口

该数据集可直接作为 SFT 或 RLHF 数据 注入现有 LVLM 训练流程:

  • 使用 SpatialBlock-15k 生成块堆叠图像与问答对,微调 LLaVA / Qwen-VL 等模型
  • 作为 评测基准 SB-Bench 嵌入持续集成测试,监控模型空间智能退化
  • 结合 视觉提示调制(color modulation)生成的难例,可用于课程学习或主动学习

代码已开源:SpatialBlock GitHub

局限

  • 论文承认其 **SpatialBlock-15k** 数据集仅包含 15,000 个合成积木堆叠问题,图像以简单块状几何体为主,缺少真实场景的纹理、光照、遮挡与复杂背景。这可能导致模型在合成数据上学到的空间推理特征向真实世界任务迁移时存在域差距,尤其是在需要精细深度估计或非朗伯表面理解的任务上。与使用真实影像及密集 3D 标注的数据集相比,其覆盖的场景多样性和几何复杂度明显不足。
  • 方法中引入 **颜色调制** 作为视觉线索以促进 anchor-based reasoning,但模型可能形成对颜色标记的过度依赖,而非真正学习 3D 几何关系。当测试图像缺失或改变颜色标记时,性能可能显著下降。论文虽报告了消融,但未系统考察颜色与几何线索冲突时的鲁棒性,也未验证去除颜色后模型是否仍能推理,这限制了其作为通用空间智能训练策略的证据强度。
  • 实验主要基于自建的 **SB-Bench** 进行评测,缺少在公认 3D 空间推理基准(如 **BLINK**、**SpatialVLM**、**ScanQA** 等)上的系统对比。与现有真实场景空间问答数据集(如 **SpatialQA**、**VSI-Bench**)相比,论文未充分展示在多样视觉任务上的迁移效果。此外,训练仅使用单个 LVLM 基座,未验证该方法对不同架构或规模的泛化能力,削弱了结论的普适性。
论文Soohyun Ryu2026-09-07原文

相关内容