论文

APT: Action Expert Pretraining 提升 Vision-Language-Action 策略的指令泛化

APT: Action Expert Pretraining 提升 Vision-Language-Action 策略的指令泛化

Vision-Language-Action (VLA) 模型将预训练的 Vision-Language Model (VLM) 与连续动作专家结合,在操作任务上表现强劲,但面对分布外 (OOD) 语言指令时泛化能力差。根本挑战在于 VLA 数据的结构不平衡:语言多样性远低于视觉与动作内容,导致策略倾向于依赖视觉捷径。离散动作方法通过视觉-语言联合训练缓解该问题,但连续动作专家缺乏此类保护:它们从随机初始化开始,完全在不平衡数据上学习,产生噪声梯度,损害 VLM 并无法利用其语言能力。 本文从贝叶斯视角出发,将策略分解为与语言无关的 Vision-Action (VA) 先验和语言条件化的 VLA 似然,提出APT(Action expert PreTraining),一种强调动作专家预训练的两阶段训练方法。阶段1:动作专家作为 VA 先验,在来自冻结 VLM 的视觉-动作对上预训练,绕过语言不平衡。阶段2:通过门控融合机制注入语言 tokens,整合 VLM 特征的同时保留已学习的视觉运动先验。 APT 适用于主流 VLA 架构(包括 π 和 GR00T 风格)。大量实验验证 APT 在未见指令和组合任务上取得一致提升。

论文精读

TL;DR APT 通过两阶段训练,先预训练动作专家获得视觉-动作先验,再注入语言条件,解决 VLA 模型中语言不平衡导致的视觉捷径问题,显著提升对未见指令的泛化。

问题

当前机器人操控领域正从固定任务向开放指令跟随 演进,Vision-Language-Action (VLA) 模型成为主流范式,但其语言指令的分布外 (OOD) 泛化仍非常有限。

现有 VLA 方法将预训练 VLM 与连续动作专家耦合,但面临训练数据结构性失衡:语言指令多样性远低于视觉和动作数据,导致策略陷入视觉捷径 (visual shortcut),即忽略指令、仅依赖视觉线索。离散动作方案可通过视觉-语言联合训练缓解,但连续动作专家通常从随机初始状态开始,直接在不平衡数据上端到端学习。这会带来两方面问题:1) 动作专家产生的噪声梯度反向传播至 VLM,破坏其预训练语言能力;2) 专家本身无法有效利用 VLM 的语言表征,因为语言信号被视觉主导的梯度淹没。结果模型在已知场景中可能表现尚可,但面对改写、组合或未见指令时性能骤降。

语言指令泛化是机器人实用化的核心瓶颈。连续动作空间的高维特性使得精确的条件控制极为困难,任何对指令的误解都可能导致危险的错误操作。同时,收集大规模多样化的语言标注成本极高,因此模型必须从有限、不平衡的数据中学会真正理解指令语义,而不是依赖表面的视觉相关性。该问题的解决直接关系到 VLA 模型能否从实验室走向真实多变的应用场景,如家庭服务、柔性制造等,因而受到机器人学习与基础模型社区的广泛关注。从技术角度看,它要求在保留 VLM 世界知识的同时,建立鲁棒的视觉-运动映射,这需要精细的训练策略和结构设计。

这一类不平衡导致的“忽略文本”现象,类似于视觉问答模型过度依赖图像偏差而忽略问题本身,或者在多模态对话系统中模型仅凭图像上下文生成回答,都是跨模态对齐中的经典陷阱,需要从训练机制层面加以修正。

核心洞察

  • 第一阶段将动作专家预训练为视觉-动作先验,绕开了语言不平衡导致的噪声梯度干扰。在VLA模型中,语言标注远少于视觉和动作数据,直接端到端训练会使随机初始化的连续动作专家产生破坏性梯度,损害VLM的语言能力。APT通过冻结VLM,仅用视觉-动作对预训练动作专家,使其先学会稳定的视觉运动映射,从而在第二阶段语言注入时保有鲁棒的先验,这为连续控制下的指令泛化提供了数据不平衡下的可行训练方案。
  • APT采用门控融合机制在第二阶段注入语言信息,既保留了预训练的视觉运动先验,又实现了灵活的语言条件化。该机制允许模型动态调节来自VLM的语言特征与视觉特征的融合,避免覆盖已学到的视觉运动策略,从而在遵循新语言指令时仍能保持可靠的操作表现。相比直接将语言嵌入视觉特征,这种显式分离和门控设计更解耦地平衡了语言泛化与动作稳定。
  • 从贝叶斯视角将VLA策略分解为语言无关的视觉-动作先验和语言条件的似然,为理解和设计两阶段训练提供了概率基础。这一形式化不仅解释了为何视觉捷径会削弱语言泛化,还自然导出了预训练-注入的两阶段流程,使得训练目标更清晰。与现有启发式方法不同,该框架可推广到多种VLA架构,揭示了结构化数据不平衡下语言条件化策略的本质。

方法

输入与问题定义

输入包含机器人操作数据:视觉图像语言指令连续动作轨迹。在标准 VLA(Vision-Language-Action)训练中,由于语言多样性远低于视觉和动作多样性,策略易陷入视觉捷径,导致未见指令(OOD)泛化差。

两阶段训练框架

APT 从贝叶斯角度将策略分解为语言无关的 Vision-Action (VA) 先验语言条件的 VLA 似然,并采用两阶段训练:

第一阶段:动作专家预训练(Action Expert Pretraining)
  • 冻结预训练 VLM(如 LLaVA 等),仅利用其视觉编码能力。
  • 用大量视觉-动作对训练一个动作专家网络(连续动作头),使其学会从视觉直接回归动作,形成 VA 先验。
  • 此阶段完全不依赖语言标记,避开语言不平衡带来的噪声梯度,确保先验稳定收敛。
第二阶段:带门控融合的 VLA 微调
  • 将第一阶段训练好的动作专家权重作为初始化,解冻 VLM 并引入门控融合机制(Gated Fusion)。
  • 门控单元以语言令牌为输入,动态调节视觉特征与动作专家中间表示之间的信息流,在注入语言指令的同时保护已学的视觉运动先验
  • 联合优化视觉、语言与动作模块,使策略对齐后验 VLA 分布。

输出与适用性

最终输出连续动作值(如末端位姿增量),模型能够泛化到训练时未见过的语言指令与组合任务。该方法兼容主流 VLA 架构,如 π 模型和 GR00T 风格模型。

与同类方法的差异

现有离散动作方案通过视觉-语言联合训练减轻捷径,但连续动作专家从随机初始化开始、完全依赖不平衡数据,缺乏类似保护。APT 首次为连续动作专家引入显式两阶段预训练,将视觉运动先验学习与语言条件化解耦,从而在保持视觉操控能力的同时显著提升语言泛化性。

实验

实验设计

本文在 模拟与真实世界 两个维度验证 APT 的有效性。模拟实验基于 LIBERO 和扩展的 LIBERO-Plus 基准,涵盖多类物体、不同场景的物体操作任务,重点评估对未见过的语言指令组合任务 的泛化能力。真实世界实验在 Franka 机械臂平台上执行单任务和组合指令的拾取-放置操作,指令涵盖不同属性、空间关系的组合,以检验策略的实际鲁棒性。

关键发现

实验表明,APT 在各类 OOD 指令和组合任务上获得一致的性能提升。与直接联合训练的 VLA 基线相比,两阶段训练显著降低了视觉捷径 带来的误导,使策略真正利用语言信息而不是忽略指令。在 LIBERO 上,APT 在多个未见指令子集上的成功率大幅领先,且几乎不牺牲分布内性能。真实世界实验中,单任务泛化准确率保持高位,组合泛化(如“将红色块放到蓝色块旁边”)显示出更强的指令遵循能力,失败案例主要出现在复杂遮挡和歧义表达。

基线对比解读

现有连续动作 VLA(如 π 和 GR00T 风格架构)往往在训练时由于语言数据的稀疏和不平衡,动作专家从随机初始化开始学习,产生的噪声梯度污染了视觉语言主干,导致模型偏向于依赖视觉线索而忽略语言。APT 通过将动作专家预训练为纯视觉-动作先验,冻结 VLM 隔绝语言干扰,从而在第二阶段融合语言条件时,能更好地保持学习到的视觉运动知识。相比离散动作方案依赖视觉语言联合训练来缓和这一问题,APT 填补了连续动作空间下的空白。与未加预训练的基线相比,APT 不仅提升了 OOD 指令的成功率,还使策略对语言指令的响应更加精细化,显著减少了因忽略指令而导致的失败。

行业影响

APT 通过两阶段训练显著提升了 VLA 模型对未见语言指令的泛化能力,在机器人操作领域具备明确的落地潜力。

落地场景

仓储物流机器人可利用 APT 增强现有 VLA 策略,使机械臂在面对新的拣选指令(如“取左上角红色盒子”)时保持高成功率,减少对固定指令模板的依赖。家庭服务机器人在响应多样化口语指令(如“把杯子放到洗碗机顶层”)时也能受益,降低对特定句式的敏感度。此外,工业装配线中,机器人需频繁切换任务描述,APT 可支撑更灵活的交互。

商业价值

  • 降低数据采集成本:传统 VLA 需要大量配对的多样化语言-动作数据,APT 通过第一阶段预训练解耦了视觉动作先验与语言,降低了语言标注的多样性与规模要求。
  • 提高任务成功率与鲁棒性:在 OOD 指令和组合任务上一致提升,直接减少人工介入和停机时间,提升产线吞吐。
  • 加速模型迭代:冻结 VLM 预训练动作专家的方式,可复用已有 VLM 权重,避免全参数重训,缩短开发周期。

与现有工作流的接口

APT 设计为架构无关的两阶段训练流程,可无缝接入主流 VLA 框架(如 π 模型、GR00T 架构)。集成方式:

  1. 使用现有 VLM 作为冻结特征提取器,在机器人操作数据集上预训练动作专家(Stage 1)。
  2. 通过门控融合机制将语言 Token 注入,微调整个策略(Stage 2)。 无需修改推理管线,仅替换训练策略,对已部署的 VLA 系统可做增量式升级。

具体落地用例

  • 电商仓库拣选:当运营人员通过自然语言临时更改拣选顺序(如“先拿最远的盒子”),传统模型常因视觉捷径而失败,APT 训练的机器人可正确解析并执行,减少误拣退货率。
  • 餐饮自动化:后厨机器人接收非标准化菜单指令(如“少加半勺酱料”),APT 让模型更关注语言意图而非死记视觉-动作映射,提升配餐灵活性,无需逐条录制新指令动作对。

局限

  • - **两阶段训练增加开销**:APT 需要预先训练动作专家作为 Vision-Action 先验,这延长了整体训练流程,并引入了额外的门控融合模块。虽然冻结 VLM 降低了显存消耗,但动作专家的独立预训练与第二阶段语言注入仍需要仔细的超参协调,增加了工程复杂度。当视觉场景或动作空间变化时,VA 先验可能需要重新训练,限制了快速迁移的能力。
  • - **语言泛化评估范围有限**:实验主要在 LIBERO 基准和简单真实世界拾放任务上进行,语言指令的多样性仍受限于预定义模板,未覆盖开放文本指令或需要复杂推理的场景。组合任务虽有所涉及,但评测集中在少数属性组合,难以全面衡量模型对真实世界自然语言变体的鲁棒性,可能高估实际 OOD 指令下的表现。
  • - **VLM 依赖与优化耦合弱**:方法始终冻结 VLM 参数,避免噪声梯度破坏语言能力,但也阻碍了视觉编码器与动作先验的联合适应。在某些域差距较大的场景下,固定的视觉特征可能不是最优,且门控融合仅简单加权,未能充分挖掘 VLM 中丰富的语言-视觉对齐信息。与近期通过多模态对齐增强 VLA 的工作相比,APT 在视觉-语言-动作的深度耦合上仍有不足。
论文Kechun Xu2026-06-10原文

相关内容