论文

为视觉语言模型的空间推理蒸馏路由式 3D 特权

为视觉语言模型的空间推理蒸馏路由式 3D 特权

空间推理一直是 vision-language models (VLMs) 的持续短板,因为 RGB 输入并不直接提供几何证据。现有补救方案要么在推理阶段向模型注入 3D,付出架构改造与延迟代价;要么用结果奖励训练,仅监督最终答案。但空间错误其实源自感知:一次误判的深度或方向,只能依靠场景的真实几何来纠正——而空间训练语料的 3D 扫描源恰好已经提供了这种几何。 我们提出 GPD (Geometry-Privileged Distillation),把几何证据变成 on-policy self-distillation (OPSD) 中的特权信息。对每个问题,depth、semantic 与 bird's-eye-view (BEV) 线索被渲染成紧凑文本,与参考答案一起路由给 teacher;一个只作用于错误轨迹的 privileged KL 对 GRPO 形成增强,而部署模型仍保持纯 RGB 输入。 在 4B backbone 上,GPD 在 VSI-Bench 取得 57.1,并在 MindCube、SPARBench、MMSI-Bench 与 ViewSpatial 上平均达 37.6,优于 GRPO 与 answer-privileged OPSD。消融实验证实了 3D 特权与 answer privilege 的互补性、question-conditioned routing 相较 full-context injection 的优势,以及把蒸馏限制在错误轨迹上的收益。

论文精读

TL;DR 将 3D 几何线索作为特权信息蒸馏进仅 RGB 输入的 VLM,在不改变推理架构的前提下显著提升空间推理,VSI-Bench 达 57.1。

问题

问题背景

视觉语言模型(VLMs)在通用视觉问答上表现强劲,但空间推理(距离、方向、布局判断)仍是明显短板,相关 benchmark 持续暴露此类能力不足。

现有方法局限

当前解决方案主要两条路径:

  • 推理时注入 3D 信息:通过深度传感器、点云或多视角几何模块提供额外输入,但引入额外架构和推理延迟,部署成本高,不符合轻量级 VLM 的实际需求;
  • 训练时仅用结果奖励:例如 GRPO 等强化学习仅监督最终答案是否正确,无法修正感知层错误——若模型在早期错误估计深度或方向,后续推理链条即使逻辑正确也无法得到正确几何结论。

为什么这个问题难/重要

RGB 图像本身不直接携带可判读的几何证据;空间错误源于感知阶段,而传统文本监督信号难以定位并纠正感知偏差。许多空间推理训练语料其实来源于 3D 扫描环境(如室内场景数据集),其原始几何信息本可用于教师信号,但现有蒸馏方法仅传递答案,未利用这些特权几何信息。空间推理能力直接关系到具身智能、增强现实、机器人导航等核心应用,业界对低成本且高性能的空间推理模型需求迫切。

行业类比

类似于自动驾驶中训练阶段使用 LiDAR 与高精地图融合,但部署时仅依赖摄像头——通过蒸馏将特权几何信息压缩到纯视觉学生模型中,实现低延迟与高可靠性的平衡。

核心洞察

  • GPD 的核心思路是把 3D 几何证据作为 RL 后训练中的特权信息,通过 on-policy 自蒸馏将几何感知能力迁移到仅用 RGB 的模型,而不是在推理时注入 3D 或在最终答案层面监督。与推理时注入 3D 的方法相比,GPD 在部署时保持 RGB-only,避免额外架构和延迟;与仅用 outcome reward 的 GRPO 相比,GPD 提供了过程级别的几何纠正信号,可修正错误的中间推理,从而在空间推理基准上取得显著提升。
  • GPD 提出错误门控的特权 KL 损失,只对错误轨迹施加与教师几何线索的分布对齐,从而避免对正确轨迹的过约束,让模型只在犯错时获得针对性几何指导。这一设计与 answer-privileged OPSD 不同,后者将答案特权作为额外上下文,而 GPD 的几何特权针对感知过程,与答案特权互补;错误门控进一步降低了对正确样本的干扰,并在消融中被证明优于全量蒸馏。
  • GPD 采用问题条件路由,根据每个问题选择相关的深度、语义和 BEV 线索作为紧凑文本,而不是将所有 3D 信息全量注入教师上下文。这避免了 full-context 注入带来的无关噪声和上下文长度膨胀,使得教师能够聚焦于与问题直接相关的几何证据,提高蒸馏信号的信噪比。消融验证了 question-conditioned routing 优于 full-context injection,说明结构化特权信息的筛选对空间推理训练至关重要。

方法

输入:训练时同时使用 RGB 图像、文本问题以及从 3D 扫描数据中离线提取的几何线索(depth、semantic、BEV)作为特权信息;推理时模型仅接收 RGB 图像与问题,不依赖任何 3D 输入。

关键模块

  1. 离线 3D 特权构造:对训练样本的 3D 场景渲染 depth 图、语义分割图和 BEV 图,将几何证据压缩为紧凑文本描述(如“目标距离 2.3 米”“位于视角左前方 30 度”),形成特权 cue 库。
  2. 问题条件路由:根据具体问题动态选择最相关的几何 cue 子集(询问距离时侧重 depth,询问布局时侧重 BEV),而非将全部 3D 信息一次性注入 teacher,以减少冗余并提升特权利用效率。
  3. 几何特权自蒸馏:teacher 模型同时接收 RGB 和路由后的几何 cue 生成 reference answer;student 模型仅接收 RGB,通过模仿 teacher 的推理轨迹学习几何感知。训练以 GRPO 为基础策略优化,额外引入 privileged KL 散度损失,仅对错误轨迹施加,迫使 student 在答错时更贴近 teacher 的特权分布。联合目标为结果奖励 + 错误门控 KL 正则。

输出:一个保持 RGB-only 接口的 VLM,空间推理能力显著增强。在 4B 骨干上,VSI-Bench 达 57.1,MindCube、SPARBench、MMSI-Bench、ViewSpatial 平均 37.6,优于 GRPO 和仅答案特权的 OPSD。

与同类方法差异:不同于推理时注入 3D 带来架构与延迟开销,也不同于仅用结果奖励监督最终答案,GPD 首次将几何证据作为 OPSD 中的特权,通过错误轨迹上的自有 KL 实现感知层纠错,训练后模型保持轻量且不依赖 3D 输入。

实验

实验设计

GPD 基于 4B backbone 训练,采用 GRPO 作为基础策略优化,并在错误轨迹上施加特权 KL 散度。对于每个问题,从 3D 扫描源渲染深度、语义、鸟瞰图 (BEV) 线索为紧凑文本,通过问题条件路由送入 teacher,与参考答案一同构成特权信息。评估覆盖 VSI-Bench 及 MindCube、SPARBench、MMSI-Bench、ViewSpatial 四个空间推理基准。

关键发现

  • VSI-Bench 上取得 57.1,四个额外基准平均 37.6,全面优于 GRPO 和 answer-privileged OPSD。
  • 消融实验证实三个设计选择的有效性:
    • 3D 与 answer privilege 互补:同时使用两种特权比单一特权提升更显著。
    • 问题条件路由优于全上下文注入:按问题相关性筛选几何线索,避免冗余干扰。
    • 限制蒸馏到错误轨迹:仅对失败样本施加特权 KL,避免正确轨迹的分布偏移。

与基线对比

相比纯 outcome reward 的 GRPO,GPD 通过特权 KL 在错误轨迹上注入几何监督,直接修正感知错误,而非仅在最终答案层面优化。相比 answer-privileged OPSD,GPD 额外引入 3D 几何证据,且路由机制降低上下文长度,提升训练效率。部署模型保持 RGB-only,推理零额外成本,对工程落地尤其友好。

行业影响

落地场景

GPD 训练出的 RGB-only VLM 在不增加推理延迟的前提下显著提升空间推理,可直接嵌入需要几何判断的交互式 AI 产品:电商平台的家居搭配助手(用户上传房间照片并询问“沙发到门的距离是否足够放一个鞋柜”)、机器人自然语言操控(理解“抓取距离杯子最近的方块”)、AR/VR 室内导航与物品定位、以及自动驾驶座舱内的空间指令问答。

商业价值

  • 降本:部署端无需 3D 传感器或额外模型,保持原有 RGB 输入 pipeline,推理成本和延迟不变。
  • 体验提升:空间类问答错误率下降,减少用户因错误答案引发的重复咨询或退货,提升转化率。
  • 增收:更可靠的视觉推理能力可作为差异化卖点,推动高客单价应用(如智能家居设计、机器人服务)落地。

与现有产品/工作流集成

GPD 属于训练阶段改进,与现有 RLHF/GRPO 后训练流程兼容。只需在训练数据中额外提供 3D 几何线索(深度、语义、BEV)作为教师特权,无需改动推理架构。可先在小规模空间推理数据集上微调,再与通用指令数据混合训练,避免灾难性遗忘。对现有产品,升级模型权重即可,无需更新客户端或服务端推理代码。

具体用例

  1. 电商家居场景:某电商平台的家居导购机器人,用户上传客厅照片并询问“这个书架能放在电视柜左边吗?”。GPD 训练后的模型能准确判断空间容纳性,减少因误判导致的退货和客服工单。
  2. 仓储机器人:自然语言指令“把蓝色箱子搬到货架第二层靠右的位置”,VLM 通过 RGB 图像即可理解空间层级关系,提升抓取成功率,降低人工干预频次。

局限

  • **依赖 3D 标注数据。** GPD 的训练数据必须来自带有 3D 扫描或深度信息的空间推理语料,才能提取 depth、semantic、BEV 三类特权 cue。这一前提限制了数据来源:大量现成的 VQA 或场景理解数据集没有 3D 对应,若要用 GPD 需要额外采集或重建 3D 结构,成本高且覆盖场景有限。论文在四个基准上验证,但未讨论无 3D 标注时的 fallback 策略,也未分析特权信息质量对蒸馏效果的影响,实际部署时该依赖可能成为瓶颈。
  • **仅在 4B 模型上验证,且训练开销未充分披露。** 实验围绕 4B backbone 展开,缺少更大规模模型(如 7B、13B)上的结果,不能说明 GPD 的优势随模型容量如何变化。此外,方法需要 teacher model 参与 on-policy 蒸馏,并在每个问题推理时从 3D 源渲染特权 cue,训练时间和显存开销相比普通 GRPO 明显增加,论文未给出具体成本对比。与推理时直接注入 3D 的架构方法(如引入 depth 分支)相比,GPD 在部署时保持 RGB-only 有优势,但训练侧的额外负担可能限制其在资源敏感场景的应用。
  • **评估集中在专门空间推理基准,泛化性存疑。** 所有实验都基于 VSI-Bench、MindCube、SPAR-Bench、MMSI-Bench、ViewSpatial 等构造型空间任务,缺少在通用 VQA、真实导航或机器人操作数据集上的验证,可能过拟合于特定问题的分布。另外,错误门控蒸馏只对最终答案错误的轨迹施加 KL,但有些轨迹虽然答案正确,中间几何推理却存在偏差,这类隐性错误无法被纠正,可能限制了模型在更复杂开放场景下的空间推理鲁棒性。
论文Hongxing Li2026-10-08原文

相关内容