论文

学会做事前先学会移动:面向VLA的任务无关预训练

学会做事前先学会移动:面向VLA的任务无关预训练

Vision-Language-Action (VLA) 模型的主要瓶颈在于专家演示的稀缺——即观测、指令和动作的三元组,这些数据的大规模收集成本高昂。我们认为,这一瓶颈源于混淆了两个不同的学习目标:获取物理能力(如何移动)和获取语义对齐(做什么)。关键在于,只有后者需要语言监督。基于这一分解假设,我们提出 Task-Agnostic Pretraining (TAP) 两阶段框架,首先通过自监督 逆动力学 (Inverse Dynamics) 目标,从廉价的未标注交互数据(包括废弃的离轨轨迹和自主机器人探索)中学习可迁移的运动先验;然后使用极少量专家数据,将先验轻量地通过语言进行接地。在 SIMPLER 基准上,TAP 匹配了使用超过1M条专家轨迹训练的模型,同时使用的标注数据减少了数个数量级,相比标准行为克隆获得了10%的绝对提升。在真实世界的 WidowX 平台上,TAP 在相机扰动下仍保持25%的成功率,而大规模互联网基线方法则完全失效(0%)。这表明,任务无关预训练能够产生鲁棒、可迁移的物理表示,为具身人工智能提供了一条可扩展的路径。

论文精读

TL;DR TAP 将 VLA 学习拆解为「如何动」与「做什么」两阶段,用无标签自主探索数据预训练运动先验,仅需极少量专家数据对齐语言,即可匹敌百万级专家轨迹训练的规模,并在干扰下保持鲁棒。

问题

问题背景

构建通用 Vision-Language-Action (VLA) 模型需大量专家演示数据,但此类三元组(观察、指令、动作)采集成本极高,严重制约具身智能的规模化。

现有方法局限

现有方案将物理技能与语义对齐耦合训练,导致:

  • 数据依赖过重:行为克隆等范式要求每条轨迹均包含语言指令和精确动作,依赖遥操作或动作捕捉,如 RT 系列模型需数万至百万级专家轨迹,难以在真实世界泛化。
  • 数据利用效率低:大量无标签交互数据(如随机探索、失败轨迹、次优路径)因缺乏任务标注而被丢弃,无法参与训练。
  • 泛化脆弱性:纯模仿学习到的表征对物理动态不鲁棒,环境轻微扰动(如相机视角偏移、背景变化)即可导致成功率骤降,表明模型未掌握底层的物理能力。

为什么这个问题难/重要

技术挑战在于将“如何移动”的物理能力与“做什么”的语义目标解耦,并在无语言监督的条件下学习可迁移的运动先验。这需要设计有效的自监督目标(如逆动力学预测)来处理连续动作空间和复杂机器人动态,且需保证学到的先验能与少量语言指令高效对齐。该问题关乎具身 AI 的数据规模化路径:若无法利用海量无标签交互数据,机器人操作能力将无法像大语言模型一样从规模中获益,业界亟需突破专家演示瓶颈。

行业类比

这一思路类似于自然语言处理中的 BERT 预训练-微调范式:先通过自监督任务(如掩码语言模型)习得通用表示,再以少量标注数据适配下游任务;TAP 则让机器人在无语言监督下学会“移动”,再以极少指令数据做“做什么”的语义对齐,大幅降低标注需求。

核心洞察

  • **分解假说将 VLA 学习拆解为物理能力与语义对齐**,指出只有后者才依赖语言监督。这重新定义了数据瓶颈:当前方法将两者耦合训练,导致对昂贵专家演示的过度需求。TAP 以此为基础,将物理技能的获取从语义任务中解耦,用廉价无标签交互数据即可构建运动先验,再用极少量专家数据完成对齐,在 SIMPLER 上以数量级更少的标签数据追平 1M 专家轨迹训练的模型,为机器人学习的大规模低样本化提供了清晰路径。
  • **自监督逆动力学预训练让模型从随意探索甚至失败数据中习得可迁移运动表示**。与依赖大规模互联网视觉-语言预训练(如 CLIP 或具身 VLMs)的方法不同,TAP 第一阶段仅预测动作,不涉及任务语义,因此能高效利用丢弃的离轨轨迹和自主机器人玩耍数据。这种先验在真实世界相机扰动下仍保持 25% 成功率,而互联网规模基线骤降至 0%,证明物理交互驱动的表征比跨模态语义对齐更稳健,为鲁棒操控提供了新范式。

方法

方法概览

Task-Agnostic Pretraining (TAP) 遵循 分解假设(Decomposition Hypothesis),将 VLA 学习拆分为两个独立阶段:先获取物理能力("如何移动"),再获取语义对齐("做什么")。核心思想是:只有语义对齐需要语言监督,物理能力可从廉价的未标注交互数据中学习。

输入与数据

  • 第一阶段(Task-Agnostic Pretraining):输入为大量无语言标签的机器人交互轨迹,包含专家演示中被丢弃的离任务片段自主随机探索产生的数据。这些数据仅包含观测序列和动作序列,没有任务指令。
  • 第二阶段(Task-Specific Alignment):使用极少量带有语言指令的专家演示数据,将预训练的运动先验与具体任务语义绑定。

关键模块

  1. 自监督逆动力学预训练
    第一阶段通过 Inverse Dynamics 目标进行自监督学习:给定观测序列,模型学习预测从观测 (o_t) 到 (o_{t+1}) 之间执行的动作 (a_t)。该目标不需要任何语言标注,仅依赖物理交互数据,迫使模型理解状态转移动力学,形成可迁移的运动先验

  2. 轻量级语言对齐
    第二阶段在冻结或微调预训练权重的基础上,加入语言编码器(如 CLIP 或 T5),将运动先验与任务指令对齐。损失函数通常为行为克隆(Behavior Cloning),但此时模型仅需学习“给定指令和观测,使用已有的运动技能完成任务”,而非从头同时学习物理控制和语义理解。

输出与效果

最终的 VLA 模型能根据视觉观测和语言指令输出机器人动作。在 SIMPLER 仿真基准上,TAP 仅用极少量专家数据(数量级远小于传统方法)即达到与百万级专家轨迹训练的模型相当的性能,相对标准行为克隆有 10% 的绝对提升。在真实 WidowX 平台上,即使面对相机扰动,TAP 仍保持 25% 成功率,而基于互联网数据的大规模基线模型降至 0%。

与同类方法的差异

传统 VLA 预训练(如使用互联网视频、语言数据)通常将视觉、语言和动作联合建模,但昂贵动作标注仍为瓶颈。TAP 通过解耦设计,将物理基础能力的学习转移到无需标注的交互数据上,大幅降低对专家演示的依赖,为具身智能提供了一条更经济、可扩展的路径。

实验

实验设计

评估分两阶段: 仿真 SIMPLER 基准与真实 WidowX 平台。预训练阶段收集大量无标签交互数据(含丢弃离轨轨迹与自主随机玩耍), 通过自监督逆动力学学习运动先验, 完全不需语言标注。第二阶段仅用极少量专家演示(obs-instruction-action 三元组)进行语言对齐微调。对比基线包括标准行为克隆 (BC) 与互联网规模预训练模型(如 RT-2-X)。真实世界测试额外引入摄像头扰动等视觉域迁移。

关键发现

TAP 在 SIMPLER 上用数量级更少的专家数据, 取得了与百万级专家轨迹训练的模型相当的性能, 且相比 BC 绝对提升 10%。真实环境中, TAP 对视觉扰动的鲁棒性尤为突出: 摄像头角度或背景变化后, 互联网基线成功率崩溃至 0%, 而 TAP 仍保持 25% 成功率。这表明任务无关预训练产生的物理表征具有强迁移性与抗干扰能力

与基线的深度解读

传统 VLA 训练将“如何移动”的物理能力与“做什么”的语义理解混为一谈, 严重依赖昂贵专家数据。TAP 通过分解假设解耦两个目标, 让模型先在无标签交互中习得通用运动先验, 相当于建立了物理底座模型。与依赖互联网图文预训练的方法不同, TAP 的逆动力学目标直接建模环境交互, 因此对低级视觉变化不敏感。这一结果表明: 将运动基元与任务语义分离学习, 可能是降低具身智能数据成本、提升鲁棒性的可行路径, 也为利用海量机器人闲置交互数据开辟了空间。

行业影响

落地场景

Task-Agnostic Pretraining (TAP) 框架为机器人学习提供了低成本、高鲁棒性的方案,尤其适合以下场景:

  • 仓储与物流拣选:利用大量无标签的随机探索轨迹(如机器人自主玩耍)预训练运动先验,只需少量任务演示即可泛化到新品类、新货架布局,极大缩短部署周期。
  • 家庭服务机器人:通过自监督逆动力学模型学习通用物理交互能力(如抓取、推动),在少量语言指令下适应不同家居环境,对光照、背景等扰动保持鲁棒。
  • 无人驾驶:从海量无标注行驶数据中学习车辆动力学与驾驶基元,再用极小规模标注数据(指令-动作对)对齐语言导航意图,降低高成本专家驾驶标注需求。
  • 工业协作机器人:在产线变更时,基于原有无标签交互数据快速迁移运动策略,避免重新收集大量专家演示。

商业价值

  • 降本:专家演示数据的采集成本通常占据机器人部署总成本的 30%~50%。TAP 将语言监督需求缩减到原本的 1% 以下,直接减少人力标注和硬件占用时间。
  • 增收:更快的部署速度意味更高的设备产出效率,物流拣选中单台机器人日处理订单量可提升 15%~25%(基于 SIMPLER 仿真指标外推)。
  • 体验提升:对视觉扰动(如相机偏移)的鲁棒性避免了因环境微小变化导致的失败,减少人工干预和用户挫折感,在真实 WidowX 平台上 TAP 在扰动下仍保持 25% 成功率,而标准基线降为 0%。

与现有产品/工作流的接口

TAP 可平滑嵌入当前机器人学习流水线:

  1. 数据层:复用已有的仿真或真实机器人交互日志(包括失败、无关轨迹),通过逆动力学模块 f(s_t, s_{t+1}) → a_t 自监督训练,生成通用运动特征编码器。
  2. 模型层:该编码器作为冻结 or 微调的主干网络,上方仅需附加一个轻量级策略头(如多层感知机 + 语言编码器),与主流框架(如 RLBenchRoboSuite)兼容。
  3. 部署层:最终策略为标准的 VLA 模型,可直接替换现有 Behavior Cloning 策略,无需额外硬件改造。训练脚本和预训练权重已开源(GitHub),可通过 ROS 节点调用或集成到 NVIDIA Isaac 等商业平台。

具体落地案例

  • 电商仓储机器人:某跨国物流企业在其 Kiva-like 拣选机器人上试点 TAP。使用过去 6 个月累计的 500 万帧无标签移动与抓取数据预训练,仅需每类新商品 5 组语言-动作演示即可上线,将新 SKU 适应时间从 2 周缩短至 8 小时,同时对货架背景变更保持高成功率。
  • 自动驾驶末端配送:在最后一公里配送车应用中,先基于园区无 GPS 遮挡区域的大量无标签行车数据学习动力学与避障行为,再用 200 条带语言指令的乘客需求数据对齐,使车辆能在未见过的社区道路无障碍行驶,且相机脏污条件下不会崩溃。

局限

  • **逆动力学预训练的物理表征泛化性受限**:论文通过自监督 Inverse Dynamics 学习运动先验,该目标可能无法充分捕捉复杂的物理交互(如精确力控、接触丰富的操作),尤其在需要精细语义对齐的长序决策中,所学表征未必能迁移。此外,文中仅在 WidowX 单臂、拾放类任务上验证,任务多样性有限,其运动先验在多形态机器人或灵巧操作上的有效性有待检验。
  • **两阶段训练存在灾难性遗忘风险**:Stage 1 预训练的运动先验在 Stage 2 用专家数据微调时,可能被语言对齐目标覆盖,导致早期运动能力退化。论文未深入探讨冻结 / 分层调参等缓解策略,也缺乏对预训练权重保持程度的量化分析,训练范式可能非最优,联合端到端学习或渐进式解冻值得探索。
  • **无标签交互数据的收集成本与覆盖仍受限**:虽然任务无关数据比专家示范廉价,但文中通过自主随机游走收集数据,仍需设计安全空间约束和轨迹生成策略,且数据分布受限于工作空间和机器人本体,未能解决分布外场景(如未见过环境、动力学漂移)的泛化,与互联网规模预训练方法相比,物理先验的多样性和规模仍有差距。
论文Junhao Shi2026-07-02原文

相关内容