论文

超越数据扩展:面向 Vision-Language-Action 模型的表征中心持续预训练

超越数据扩展:面向 Vision-Language-Action 模型的表征中心持续预训练

扩展机器人数据对于构建通用 Vision-Language-Action (VLA) 模型至关重要,但机器人轨迹的数据规模难以像网络级图文数据那样扩展,因为具身采集成本高昂且对物理世界的覆盖稀疏。这使得表征质量成为核心瓶颈:在固定的机器人数据预算下,持续预训练必须将有限的轨迹转化为可迁移的视觉-动作知识,而非仅仅拟合动作。我们提出 VLAct,一种面向 VLA 的 VLM 骨干模型,在任务特定微调之前,使用广泛、异构、多具身(multi-embodiment)的机器人数据进行训练。VLAct 通过以下方式保留广泛的 VLM 先验并鼓励跨具身的共享动作语义: - VLM 先验保留(VLM-prior preservation), - 多头连续动作协同监督(multi-head continuous action co-supervision), - 以及部分统一的跨具身动作布局(cross-embodiment action layout),同时在微调阶段允许任务特定的动作头。 在仿真、真实世界和未见具身迁移场景中,VLAct 在固定微调协议下持续提升下游性能。在 LIBERO-Plus 和 RoboTwin 2.0 上,VLAct 超越了 ABot-M0 和 LingBot-VLA 等工业级 VLA 系统,成功率分别达到 82.6% 和 92.5%。在 RoboDojo 上,VLAct 的成功率在所有策略中排名第六,且在两项指标上均优于所有明确指定的世界动作模型(WAM)参赛方案。最值得注意的是,在未见人形具身 RoboCasa-GR1 上,仅使用 20% 下游轨迹的 VLAct 超越了使用完整数据的 GR00T-N1.6 基线。这些结果全部基于开源数据,且仅使用 16 块 GPU 的训练配置,表明以表征为中心的持续预训练能在适度计算预算下带来极具竞争力的性能,是 VLA 进展中独立于数据扩展的重要方向。

论文精读

TL;DR VLAct 提出表征为中心的 VLA 持续预训练,在有限机器人数据下保留 VLM 先验并统一跨 embodiment 动作语义,仅用 20% 轨迹即超越 full-data GR00T-N1.6,证明表征质量是超越数据缩放的独立关键轴。

问题

问题背景

当前机器人学习领域关注构建通用 Vision-Language-Action (VLA) 模型,期望通过扩展机器人数据实现跨任务、跨 embodiment 泛化。

现有方法局限

现有 VLA 持续预训练大多沿用视觉语言模型(VLM)微调思路,直接在机器人轨迹上监督动作预测。但机器人轨迹收集成本高、物理世界覆盖稀疏,数据量远小于网络图文数据。在固定数据预算下,这种“拟合动作”式训练容易破坏 VLM 原有的视觉语言先验,导致表征退化;同时不同 embodiment 的动作空间(如末端位姿、关节角、夹爪等)差异大,简单的多任务混合训练难以共享动作语义,模型易偏向数据量大的 embodiment,迁移到新平台时性能骤降。

为什么这个问题难/重要

技术难点在于:如何在不扩大数据规模的前提下,把有限轨迹转化为可迁移的视觉-动作表征,同时保留 VLM 的泛化能力。多 embodiment 的动作空间异构无法简单统一,需要设计针对性的表征对齐和 head 策略。业界广泛关注 VLA 和世界动作模型(WAM)路线,但计算预算有限,能否用少量训练资源获得高强度表征,决定了通用机器人模型能否务实落地。

行业类比

这与大语言模型在指令数据有限时,通过高质量预训练和表征对齐提升少样本能力,而非单纯堆叠任务数据类似。

核心洞察

  • **表征中心而非数据中心**:VLAct 证明在固定机器人数据预算下,持续预训练应将重心放在表征迁移而非动作拟合。与 GR00T-N1.6 等依赖大规模多 embodiment 数据的路线不同,VLAct 保留 VLM 先验并使用 20% 下游数据超越全量 baseline,表明表征设计可放大有限数据的效用。
  • **跨 embodiment 动作表示统一**:通过多头部连续动作共监督与部分统一的关节空间布局,VLAct 让不同机器人形态共享动作语义,实现未见 humanoid 的迁移。相比完全独立或完全统一的动作头,部分统一策略在可迁移性与任务适配性间取得平衡,提升泛化。
  • **低算力开源可复现的强基线**:仅 16-GPU 训练和完全开源数据,VLAct 在多个 benchmark 上超越 ABot-M0、LingBot-VLA 等工业系统,表明表征中心原则可在有限计算资源下提供高性能 VLA 骨干,挑战了 VLA 必须依赖大规模数据和算力的假设。

方法

方法概览

VLAct 是一种面向视觉-语言-动作(VLA)模型的继续预训练方法,输入为预训练的视觉语言模型(VLM)与异构多具身机器人轨迹数据,输出为可迁移的 VLA 骨干,用于下游任务特定微调。

关键模块

  • VLM 先验保持:在继续预训练中保护 VLM 的浅层视觉-语言表示,通过选择性冻结或约束防止灾难性遗忘,同时混合辅助 VLM 数据共同训练,维持原有的视觉语义理解能力。
  • 多头连续动作协同监督:使用多个动作头(对应不同具身或动作空间)共享主干,以连续动作值而非离散 token 作为监督信号,促使主干学习跨具身共享的动作语义,并降低解码器对单一动作头的过拟合。
  • 部分统一的跨具身动作布局:将不同具身的动作表示映射到部分统一的联合空间,例如通过角度 wrap 处理关节角度,并使用 wrap-aware 损失,在保留各具身差异的同时实现动作特征的对齐与共享。

下游微调时,允许替换或添加任务特定的动作头,但主干表示保持通用。

与以数据扩展为核心的方法不同,VLAct 在固定机器人数据预算下,通过表示中心的设计提升跨仿真、真实场景及未见具身的迁移能力。

行业影响

落地场景

VLAct 的 representation-centric 持续预训练方法适用于多具身机器人操作场景,如电商仓储拣选、物流分拣、家庭服务机器人、医疗辅助操作等。其从预训练 VLM 出发,利用异质多具身数据预训练基础模型,再针对具体任务微调,尤其适合数据稀缺的新硬件形态(如人形机器人),可在有限数据下快速适配。

商业价值

主要降本:减少每类机器人/任务的数据采集成本,用开源数据和 16 GPU 即可训练有竞争力的 backbone,大幅降低进入门槛。同时提升泛化与迁移能力,在未见具身(如 RoboCasa-GR1)上仅用 20% 轨迹即可超过全量数据基线,直接缩短产品迭代周期,加速机器人方案在不同客户场景的部署,提高投资回报率。对机器人初创或云平台,可提供预训练模型授权或 API 服务。

与现有产品/工作流接口

作为即插即用的 VLM backbone,VLAct 可替换现有 VLA 系统中的视觉编码器或整体政策网络,保留原有任务头,只需按论文的 continued pre-training recipe 在自有数据上训练。与真实世界实验验证了与主流框架兼容(如 LIBERO、RoboTwin)。工程上可集成到机器人开发栈,如 Isaac Sim、ROS 2 等,通过配置文件调整 action head 与 layout。开发者可基于 GitHub 代码与预训练权重快速验证。

具体落地 use case

  • 电商仓储拣选:在多种机械臂(Franka、AgileX 等)上部署,通过 VLAct 预训练模型,快速适应新的商品抓取任务,减少每 SKU 的示范数据需求;多具身一致性利于仓库中不同机器人协同。
  • 医疗辅助机器人:用于手术器械操作或康复训练机器人,由于医疗数据收集昂贵且法规严格,VLAct 的强迁移能力允许使用少量专家演示即达到可用性能,同时保留 VLM 的指令理解能力,适合自然语言指令交互。

局限

  • **数据规模与可扩展性未充分验证**:论文使用完全开源数据且仅用 16-GPU 训练,虽然证明了 modest compute 下的竞争力,但对比工业级系统(如 GR00T-N1.6)时,VLAct 仅在下游任务用了 20% 的轨迹就超越了全量基线,这引发对 baseline 实现充分性的疑问。同时,VLAct 预训练数据规模仍远小于 web-scale image-text 数据,当机器人数据量进一步增大时,representation-centric 设计是否仍能带来同等增益,以及 VLM prior 是否会被稀释,均未讨论。
  • **方法组件多且工程落地复杂**:VLAct 同时引入 VLM-prior preservation、multi-head continuous action co-supervision、partially unified cross-embodiment action layout 等多个组件,尽管消融实验在附录中给出,但各组件之间的交互作用以及每个组件对最终性能的独立贡献仍需更系统的分析。实际部署时,需要为不同 embodiment 设计对应 action head 并调整统一布局,增加了开发与维护成本,对快速迭代的机器人团队不够友好。
  • **评估基准偏窄,缺少与主流开源的直接对比**:论文在 LIBERO-Plus、RoboTwin 2.0、RoboDojo、RoboCasa-GR1 上展示了 strong results,且超越了 ABot-M0、LingBot-VLA 等工业系统,但未直接与广泛使用的开源 VLA 基线(如 OpenVLA、Octo、pi0)在相同数据与 fine-tuning 协议下比较。此外,真实世界实验虽被提及,但论文正文摘录未提供详细结果,其真实机器人泛化能力仍需更多证据支持。
论文Senqiao Yang2026-08-27原文

相关内容