论文

打破视觉-动作捷径:面向可泛化机器人基础模型的 Latent Interface Training

打破视觉-动作捷径:面向可泛化机器人基础模型的 Latent Interface Training

机器人基础模型 在分布内表现优异,但在视觉分布偏移下往往显著退化。当模型从预训练视觉表征生成动作时,可能利用与训练分布中示范动作相关、却与任务无关的视觉线索。这类 vision-action shortcut 会在此类相关性随分布变化时损害泛化能力。要缓解它,需要在保留任务相关空间信息的同时,约束视觉信息被用于动作生成的方式。 我们提出 Latent Interface Training (LIT),一种与框架无关的两阶段策略:先建立不含图像的、以空间目标为条件的动作先验,再通过位姿监督的 latent interface 约束视觉条件。 - Stage 1 训练 action expert,以语言、机器人状态以及每个示范 chunk 的终止 SE(3) 末端执行器位姿 为条件生成 action chunk,从而在无视觉线索下学习目标导向的动作生成。 - Stage 2 引入 latent interface,聚合视觉与语义表征,并作为预训练 action expert 唯一的视觉条件通路;该接口被监督去重建 Stage 1 所用的终止位姿,从而保留动作生成所需的目标相关空间信息。 在四种 vision-language-action 与 world-action 架构(Pi0.5、MolmoAct2、FAST-WAM 与 ImageWAM)上,LIT 使 LIBERO-Plus 总体成功率提升 3.87-10.70 个百分点,同时保持或提升 LIBERO 平均成功率。真实世界评测中,在未见相机配置、光照变化与干扰物下,三项任务累计成功率提升 13.30-16.70 个百分点。

论文精读

TL;DR LIT 先学习以末端位姿为条件的无图像动作先验,再通过位姿监督的潜在接口注入视觉,抑制视觉-动作捷径,在多个架构上将分布外成功率提升最高 10.7 个百分点。

问题

问题背景

机器人基础模型(如 VLA / WAM)在训练分布内表现优秀,但在真实部署中常因视觉分布偏移导致性能显著下降。领域当前关注如何提升跨环境、跨相机视角的泛化能力。

现有方法局限

现有方法通常直接将预训练视觉特征接入动作生成模块,缺乏对视觉信息使用方式的显式约束。模型容易学到任务无关的视觉线索(如背景纹理、光照强度)与示范动作之间的虚假相关,即 vision–action shortcut。这类捷径在训练分布内有效,但分布一变化就失效。现有缓解做法大致分为两类:

  • 仅用高层语义特征:可能丢失精细空间定位信息(如目标物体位姿、夹爪接近方向)。
  • 引入辅助任务(如重建、对比学习):通常是无目标的,不一定保留对动作生成最关键的空间目标信息,并增加训练复杂度。

为什么这个问题难/重要

根本挑战在于:视觉输入中既包含任务相关空间信息,也包含大量无关干扰,如何在不牺牲目标空间精度的前提下切断捷径是困难的。机器人数据采集成本高,难以覆盖所有视觉偏移;同时,真实场景中相机安装位置、光照、环境纹理、干扰物千变万化。业界对机器人基础模型的泛化性诉求强烈,一个小幅度的成功率提升就能直接影响部署可行性。该问题也关乎模型可解释性与安全性:模型基于错误线索决策,在生产环境中可能造成不可预测的失败。

行业类比

可类比计算机视觉中的 shortcut learning:例如图像分类模型依赖背景颜色识别物体,换背景即失效——机器人操作中则表现为换一个光照或视角就抓取失败。

核心洞察

  • LIT 的核心洞察是将视觉条件与动作生成解耦,通过显式的终端 SE(3) 位姿作为中间表示来约束视觉信息。与常见的端到端视觉-动作联合训练或数据增强方案不同,LIT 先训练一个不依赖图像的动作先验,再引入一个受位姿监督的潜在接口作为视觉信息的唯一通道。这种设计强制模型只从视觉中提取目标相关的空间信息,从而在分布偏移下避免利用视觉捷径。此思路将问题从“视觉特征学习”重构为“条件信息路由”,具有更明确的归纳偏置。
  • LIT 的第二个关键洞察是两阶段训练顺序的因果性:先固化动作专家的目标导向行为,再适配视觉接口。许多基线方法在训练中同时更新视觉编码器和动作解码器,导致视觉捷径与动作生成纠缠在一起。LIT 第一阶段仅用语言、机器人状态和终端位姿训练动作专家,使其学会根据目标位姿生成动作;第二阶段冻结动作专家,只训练潜在接口,并用第一阶段使用的位姿作为监督信号。这种先验优先的策略确保视觉接口的任务是恢复空间目标而非重新学习动作分布,显著降低了捷径学习的可能。

方法

方法概述

LIT 采用两阶段训练,核心思想是将视觉条件学习与动作先验解耦,避免视觉捷径。

阶段 1:空间目标条件动作先验

  • 输入:语言指令、机器人状态、以及每个动作块对应的终端末端执行器位姿 SE(3) 作为目标条件。
  • 关键模块:动作专家网络,通常为 Transformer 解码器,生成动作块。
  • 输出:动作块(末端执行器位移与夹爪状态)。
  • 该阶段完全不使用视觉输入,迫使模型学习目标导向的动作生成,建立无视觉的动作先验。

阶段 2:视觉-动作潜在接口

  • 输入:视觉观测(多视角图像)、语义表示(如来自预训练 VLM 的特征)、语言指令、机器人状态。
  • 关键模块:潜在接口聚合视觉和语义特征,输出一个紧凑的潜在向量,作为动作专家的唯一视觉条件输入。
  • 监督信号:该潜在向量被训练以重建阶段 1 中使用的终端位姿 SE(3),从而确保保留目标相关空间信息。
  • 输出:位姿重建损失用于更新接口参数,同时保持阶段 1 的动作专家冻结或微调。

在推理时,给定语言、状态和视觉观测,先通过潜在接口提取空间目标潜在表示,再输入动作专家生成动作。

工程启示:这种解耦设计允许视觉编码器与动作专家独立更新,便于跨平台迁移,且位姿监督无需人工标注,直接从演示数据中提取。

与同类方法的差异:常规 VLA 模型直接以视觉特征作为动作生成条件,易依赖训练分布中的视觉捷径;LIT 以位姿监督的潜在接口约束视觉输入,仅保留空间目标信息,这是其核心差异。

实验

实验设计概览

LIT 在 四个机器人基础模型架构(Pi0.5、MolmoAct2、FAST-WAM、ImageWAM)上评估,覆盖 视觉-语言-动作(VLA) 与 世界-动作(WAM) 两类主流路线。评测基准采用 LIBERO-Plus(包含视觉分布偏移的扩展基准)与原始 LIBERO,并在真实世界三个操纵任务上进行测试,包含未见相机配置、光照变化、干扰物 等视觉挑战。训练设置上,Stage 1 建立无图像的空间目标条件动作先验;Stage 2 引入位姿监督的潜在接口约束视觉条件化路径。

关键实验结果

  • 在 LIBERO-Plus 上,LIT 将整体成功率提升 3.87–10.70 个百分点,同时保持或提升平均 LIBERO 成功率,说明未损失原始分布性能。
  • 在真实世界三个任务上,LIT 带来 13.30–16.70 个百分点 的成功率增益,验证了跨环境泛化能力。

与基线的深度对比

LIT 的核心差异在于显式阻断视觉-动作捷径:传统方法直接从视觉表征回归动作,易利用训练分布中任务无关但相关的视觉线索;LIT 则先学习空间目标条件动作先验(仅依赖语言、机器人状态与终端 SE(3) 位姿),再通过位姿监督潜在接口 约束视觉信息只保留目标相关空间特征。该设计使得视觉输入不直接参与动作生成,而是通过重建终端位姿来引导,从而在分布偏移下更稳健。实验覆盖四种架构与真实环境,证明方法具有框架无关性 与实际部署价值。相比单纯数据增强或域随机化,LIT 从模型结构层面解决捷径问题,更贴近因果不变性学习。

行业影响

落地场景

LIT 可应用于任何依赖视觉-动作映射的机器人基础模型,典型场景包括:

  • 电商仓储分拣:视觉变化(光照、摄像头角度、货架摆放)导致抓取失败,LIT 抑制视觉捷径,提升复杂环境下的分拣成功率。
  • 自动驾驶末端执行:机械臂在生产线上的装配、检测,通过空间目标条件先验,增强对相机标定偏移的鲁棒性。

商业价值

LIT 直接降低机器人部署的视觉调试成本:

  • 训练好的模型无需针对新摄像头布局重新采集大量数据,减少数据标注与模型重训开支。
  • 在物流场景中,成功率提升 3-10 个百分点意味着每年减少大量人工干预,提高吞吐量。
  • 框架无关性使得已有视觉-语言-动作模型(如 Pi0.5、MolmoAct2)可无损升级,保护现有投资。

与现有工作流集成

LIT 作为两阶段训练策略,可嵌入现有 模仿学习管线 而不改动推理架构:

  • Stage 1 仅使用本体感觉和语言训练动作先验,可在离线数据集上预计算终端位姿,额外标注成本低。
  • Stage 2 的潜在接口轻量,可作为即插即用模块替换原视觉编码器后的融合层。
  • 支持 LIBERO、真实机器人评测协议,便于在既有基准上验证迁移效果。

结论:LIT 为机器人基础模型的视觉泛化提供低成本增强方案,适合大规模部署中的鲁棒性需求。

局限

  • 依赖精确 **SE(3) 末端位姿** 监督。LIT Stage 1 使用每个 chunk 的终端 SE(3) 位姿作为条件,Stage 2 接口也通过重构该位姿进行监督。这要求训练数据具备完整、精确的末端执行器位姿标注,而许多大规模机器人操作数据集(如 Open X-Embodiment 中的部分来源)缺少连续位姿或仅有粗粒度信息,限制了 LIT 的适用范围。此外,推理时接口预测的位姿误差可能传播到动作先验,影响控制精度。
  • 两阶段训练流程复杂,引入额外模块和计算开销。LIT 需先离线训练动作专家,再训练视觉-动作接口,无法直接端到端微调。虽然框架无关,但集成到现有 VLA/WAM 架构时需要保留 Stage 1 的冻结动作专家并新增潜在接口,增加了训练步骤、超参数和工程复杂度。对资源受限或快速迭代场景不够友好。
  • 实验覆盖的场景与任务规模有限。论文在 LIBERO 仿真基准和三个真实任务上验证,但真实世界仅涉及少量任务,且未展示长时程、多阶段操作或更极端的视觉干扰(如遮挡、背景替换)下的表现。另外,虽然跨四个架构验证了通用性,但未与更近期的大规模机器人基础模型(如 OpenVLA、RT-2 等)直接比较,泛化增益的边界仍需探索。
论文Jianman Lin2026-09-11原文

相关内容