论文

Spatial-Interactor:通过与可观测物理世界交互学习空间推理

Spatial-Interactor:通过与可观测物理世界交互学习空间推理

空间推理 是 VLM 理解物理世界并采取行动的关键能力。在动态环境中推理,要求 VLM 感知由物体运动和视角变化引起的局部状态转移,并在长轨迹上对其整合以维持不断更新的空间状态,然而现有 VLM 在这两方面均存在明显局限。当前的空间训练主要聚焦于物体属性与空间关系等静态问题,对状态转移提供的直接监督十分有限。 相比之下,交互轨迹天然连接了「前一观测—动作—后一观测」,可为局部状态转移提供直接监督,而完整轨迹则揭示了连续转移之间的依赖关系。为此,作者提出 Spatial-Interactor 框架,通过交互训练 VLM 建模物理世界的状态转移,并将该学习过程组织为三级课程:1. L1 被动世界状态转移;2. L2 主动自状态转移;3. L3 长时程交互轨迹。相应地,他们从仿真与真实交互轨迹中构建了 Learning from Spatial Interaction(LSI-108K) 数据集,各任务与对应层级的目标对齐。 训练采用两阶段策略:先以 Supervised Fine-Tuning(SFT) 面向 L1 与 L2 进行局部转移建模;随后用 On-Policy Distillation(OPD) 实现特权自蒸馏——由获得片段级转移描述的教师分支监督学生的 on-policy CoT,帮助学生学会在 L3 长轨迹上整合连续转移。 在多种 VLM 与空间 benchmark 上的实验表明,该方法在局部转移建模与长时程整合两方面均取得一致提升。

论文精读

TL;DR Spatial-Interactor 通过三层交互课程(被动世界转移、主动自身转移、长程轨迹)训练 VLM 建模物理状态转移,并利用特权自蒸馏 OPD 整合长程空间状态,在多个基准上显著提升动态空间推理。

问题

问题背景

空间推理是 视觉语言模型(VLM) 在物理世界中理解和行动的核心能力。在动态环境中,模型不仅要识别单帧中的空间关系,还要感知由物体运动和视角变化引起的局部状态转换,并在长轨迹上整合连续转换以维持更新后的空间状态。

现有方法局限

当前空间推理训练主要基于静态问题,例如询问物体属性或空间关系,缺乏对状态转换的直接监督:

  • 静态问答无法教会模型建模“前一观察 → 动作 → 后一观察”的因果链条,导致局部状态转换推理能力薄弱。
  • 长程轨迹中连续转换之间的依赖关系未被显式利用,模型难以逐步更新空间状态,在需要时序整合的任务上表现不佳。

为什么这个问题难且重要

  • 技术挑战:动态环境中的状态转换是时序因果结构,模型必须理解动作如何改变观察,并持续维护内部空间表示;仅靠静态数据扩展无法覆盖这种动态依赖。
  • 业界关注:具身智能、自动驾驶、机器人操作等应用场景均要求模型具备实时空间状态追踪能力,因此该问题具有较高的工业落地价值。

行业类比

类似于自动驾驶 系统需要持续融合多帧感知来跟踪周围车辆和行人的运动,而不是仅仅识别单帧图像中的对象位置。

核心洞察

  • 将空间推理从静态属性问答重构为动态状态转移建模,通过交互轨迹提供局部转移的直接监督。与传统空间基准只关注单张图像中物体位置和关系不同,Spatial-Interactor 利用动作前后的观测对,显式训练模型感知由运动或视角变化引起的局部状态变化,这直击 VLMs 在长时导航和操控中空间信念无法及时更新的缺陷。
  • 采用从被动观测到主动自我状态再到长程整合的三层课程,并配合 On-Policy Distillation 用特权段级描述监督学生在线 CoT。与简单堆叠长序列的 SFT 相比,该设计既分阶段降低学习难度,又解决长轨迹中逐级推理的误差累积问题;特权自蒸馏避免离线蒸馏的分布偏移,使模型在闭环交互中能稳定融合连续转移。

方法

输入与数据

Spatial-Interactor 的训练数据来自 LSI-108K 数据集,包含模拟与真实环境的交互轨迹,每条轨迹由观察-动作-后续观察三元组构成,并按 三层课程 组织:

  • L1 被动世界状态转换(物体运动、视角变化)
  • L2 主动自我状态转换(自身动作引起的状态变化)
  • L3 长程交互轨迹(连续状态转换的依赖关系)

关键模块与训练流程

  1. 局部状态转换建模:对 L1、L2 使用 监督微调(SFT),模型学习从前后观察和动作推断局部状态变化,直接监督状态转换。
  2. 长程集成与策略蒸馏:对 L3 使用 On-Policy Distillation(OPD)。采用特权自蒸馏:教师分支获得分段级转换描述,监督学生分支的 on-policy 思维链,从而学会整合连续转换,维护长时空间状态。
  3. 联合优化:结合过程损失与可验证奖励(详见论文 C.3),平衡局部与全局监督。

输出

训练后的 VLM 同时具备局部转换建模和长程空间状态更新能力,在多个空间推理基准上取得一致提升。

与同类方法的差异点:现有空间训练主要依赖静态问答,缺少对时间状态转换的直接监督;Spatial-Interactor 通过交互轨迹和三层次课程,显式建模物理世界状态转换及其时间依赖,并以 on-policy 蒸馏实现长程整合。

实验

实验设计:在多个 VLM 基座(如 LLaVA、Qwen-VL 系列)上应用两阶段训练。第一阶段对 L1/L2 任务进行 SFT,重点学习局部状态转移建模;第二阶段采用 On-Policy Distillation (OPD),利用特权教师分支提供段级转移描述,监督学生在线策略 CoT 在 L3 长轨迹上的整合。评估涵盖作者提出的 ESI-Bench 以及多个公开空间推理基准。

关键发现:论文报告在局部转移建模和长程整合任务上一致提升。三阶段课程逐步从被动世界状态、主动自身状态到长时交互,降低了学习难度;OPD 通过特权过程监督有效缓解了长轨迹上的误差累积。扰动分析显示模型 CoT 能利用转移描述辅助推理。

基线对比:相较于仅使用静态空间问答数据的现有方法,LSI-108K 直接提供状态转移监督,弥补了动态场景下的监督缺口。OPD 相比普通 SFT 或离线蒸馏,通过在线策略采样和特权过程监督,在长程任务上更稳定,体现了与同类的差异。

行业影响

落地场景

Spatial-Interactor 训练得到的 VLM 可赋能需要动态空间推理的产品:

  • 机器人操作与导航:仓储机器人、服务机器人在环境中移动并操作物体时,需持续更新自身与物体的相对位置。
  • AR/VR 交互:虚拟内容叠加真实场景时,理解视角变化与物体运动可提升沉浸感与交互准确性。
  • 自动驾驶感知:预测道路参与者状态转移,增强长时序场景理解。
  • 智能视频分析:内容平台或安防场景中,对长视频进行空间事件摘要与异常检测。

商业价值

  • 降本:利用交互轨迹自动生成监督信号,减少人工标注空间关系数据成本;提升模型在长程任务上的可靠性,降低因空间理解错误导致的返工或安全风险。
  • 增收/体验:让机器人或 AR 产品具备更自然的环境交互能力,直接提升用户付费意愿与产品竞争力;在自动驾驶仿真中加速测试闭环,缩短开发周期。

与现有工作流集成

  • 可插入主流 VLM 训练管线(如 LLaVA、Qwen-VL)作为继续预训练或微调模块,使用其 LSI-108K 数据集与两阶段策略(SFT + OPD)。
  • 推理阶段可利用 OPD 蒸馏出的 CoT 能力 增强模型空间推理的可解释性与准确性。

具体 use case

  1. 电商仓储机器人拣选:面对货架布局动态变化(如货物被取走后腾出空间),模型需推理新的可操作区域。用 Spatial-Interactor 训练后,机器人可更好地规划抓取路径与避障。
  2. 自动驾驶仿真测试:将真实交互轨迹转为合成场景,训练模型预测他车变道、行人横穿等状态转换,提升长尾场景覆盖率,降低实车测试成本。

局限

  • 论文提出的 Spatial-Interactor 依赖交互轨迹数据进行训练,但 LSI-108K 数据集主要来自模拟环境和有限真实交互,模拟到真实的分布差异可能限制模型在真实物理世界中的泛化能力。此外,数据构建需要动作和观察序列,获取成本高,难以扩展到大规模多样化场景。
  • On-Policy Distillation (OPD) 阶段使用特权教师分支提供段级转换描述,这要求训练时额外的标注或强大的预训练模型生成过程监督,推理时无法获得此类特权信息,可能导致训练与推理不一致;同时 on-policy 采样带来高昂的计算开销,限制模型规模扩展和迭代效率。
  • 实验评估虽在多个空间基准上显示一致提升,但基准可能偏向对静态空间关系和短期转换的测试,对真实长时程交互中累积误差和闭环决策能力的评估仍不足;论文未与一些最强的闭源多模态大模型进行充分对比,无法完全证明其相对优势的普适性。
论文Kaixiang Yao2026-09-19原文

相关内容