论文

ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练

ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练

视觉-语言-动作 (VLA) 模型受益于大规模、多样化的具身数据,但收集机器人轨迹成本高昂且劳动密集。近期进展表明,大规模第一人称人类视频在预训练中提供了互补的真实世界监督。然而,由于动作空间、具身结构、时间动态和监督质量的差异,联合训练人类和机器人数据仍然具有挑战性。 我们提出 ACE-EGO-0,一个统一的 VLA 预训练框架,联合利用异构数据源。为从第一人称人类视频中提取大规模预训练监督,我们构建了一个可扩展的第一人称视频到动作流水线,将原始人类视频转换为机器人格式的伪动作轨迹。为使这些标签与机器人演示可比,ACE-EGO-0 使用基于相机空间动作、形态条件化和时间对齐动作分块的统一动作表示。为稳健地利用来自第一人称人类视频的噪声伪动作监督,我们设计了一个可靠性感知训练目标,并带有人类辅助损失,将监督集中在可靠信号上。 我们在 4.53K 小时的机器人和模拟数据,以及 1.48K 小时的伪动作标记第一人称人类数据上实例化 ACE-EGO-0。实验表明,在可靠性感知加权下纳入大规模人类监督,一致性地改善了统一联合预训练和监督微调。ACE-EGO-0 在 RoboCasa GR1 TableTop 和 RoboTwin 2.0 上达到最先进性能,并展示了对真实世界双臂操作的强迁移能力。

论文精读

TL;DR ACE-Ego-0 通过统一的动作表示与可靠性感知训练,将大规模自我中心人类视频转化为伪动作轨迹,与异构机器人数据联合预训练,显著提升 VLA 模型的具身任务性能。

问题

问题背景

Vision-Language-Action (VLA) 模型当前的突出瓶颈在于大规模、多样化具身数据的获取成本。机器人轨迹收集依赖遥操作或人工标注,难以扩展;而近年兴起的自我中心人类视频(egocentric human videos)提供了丰富的现实世界交互监督,有望成为低成本预训练数据源。

现有方法局限

过往的预训练方案通常仅使用单一数据模态:

  • 纯机器人数据集:成本极高,且场景多样性受限,难以驱动通用操作策略。
  • 简单加入人类视频:由于动作空间(相机坐标系 vs 关节空间)、具身结构(手部形态 vs 末端执行器)、时间动力学(视频帧率 vs 控制频率)和监督质量(精确遥操作 vs 从视频反推的伪标签)的巨大差异,直接在异构数据上联合训练会引入大量噪声,导致动作预测不准确、性能下降甚至灾难性遗忘。

为什么这个问题难且重要

技术挑战集中在三个层面:

  1. 跨具身动作对齐:需要将人类手部动作统一到机器人末端执行器的相机空间动作表示,并考虑不同机器人形态的关节构型差异。
  2. 伪标签噪声处理:从 RGB 视频中估计的 3D 手部轨迹天然存在误差,如何区分可靠与不可靠的监督信号是关键难题。
  3. 异构数据平衡:不同来源的数据在数量、质量和任务分布上差异显著,训练目标必须动态调节以避免负迁移。

业界对此高度关注,因为突破上述限制意味着能够让 VLA 模型从海量互联网级人类视频中获取物理交互常识,极大降低机器人数据采集成本,加速通用操作能力的泛化。

行业类比

这类似于自然语言处理中,利用大规模无标注文本进行自监督预训练后,仅需少量指令微调即可泛化到多任务;ACE-Ego-0 试图让 VLA 模型同样从“免费”的人类视频中学习可迁移的物理操作先验。

核心洞察

  • 从大规模自我中心人类视频中提取**伪动作轨迹**作为机器人预训练监督:现有工作多从人类视频学习表征或 affordance,而 ACE-Ego-0 构建了一套可扩展的视频到动作转换管线,直接生成与机器人数据格式对齐的动作标签。这从根本上克服了机器人数据采集的高成本瓶颈,将人类日常活动视频转化为可供 VLA 模型使用的行动数据,显著扩大训练规模。
  • **可靠性感知训练目标**通过量化伪动作标签质量来引导辅助损失:异构数据混合训练时,直接平均所有样本会受噪声干扰。ACE-Ego-0 提出基于步长平滑度和数据集先验的可靠性权重,使模型聚焦高置信度人类信号,避免低质量伪标签拖累整体表征。这种机制提供了一种处理大规模无监督或弱监督数据的一般性权重分配思路,对融合异构数据训练具有工程参考价值。

方法

输入

ACE-Ego-0 接收两类异构数据:机器人轨迹数据(遥操作演示与仿真 rollout)和以自我为中心的人类视频。人类视频通过一个可扩展的视频到动作(video-to-action)流水线转换为伪动作标签,包括数据集筛选、3D 手部重建、动作参数化与质量校验等步骤。

关键模块

  1. 统一动作表示

    • 将所有动作统一到相机空间动作空间,输出 22 维向量,涵盖末端位置、连续 6D 旋转、夹爪状态等。
    • 引入跨本体形态条件编码:构建机器人运动学图,用消息传递网络提取形态嵌入,使策略能根据本体结构差异生成适配动作。
    • 时间对齐的动作分块将不同频率的动作序列按固定时间窗口分块,统一序列长度与推理时延。
  2. 可靠性感知训练目标

    • 机器人主损失:对精确的机器人数据使用行为克隆损失,提供稳定监督。
    • 人类辅助损失:对带噪的人类伪动作,设计分层可靠性权重(步级平滑度权重数据集级先验时间平滑)。模型在伪动作高度可靠时更多关注辅助损失,否则降低其影响,避免噪声毒化训练。

输出

联合预训练得到的 VLA 策略模型,能够根据视觉观察和自然语言指令在仿真与真实机器人上输出相机空间动作,并展现出对新的双手操作任务的转移能力。

关键差异

与以往只利用人类视频做表征学习的方法不同,ACE-Ego-0 直接端到端预测可执行动作,并通过可靠性感知加权显式建模伪动作噪声,而非简单混合训练。

实验

实验设计

模型在 4.53K 小时机器人/仿真数据与 1.48K 小时经过视频到动作管线处理的人类自我中心视频伪动作轨迹上联合预训练。采用统一动作表示(相机空间动作、形态条件化、时间对齐块)和可靠性感知训练目标(机器人主损失 + 加权人类辅助损失)。评估覆盖仿真基准 RoboCasa GR1 TableTopRoboTwin 2.0,以及真实双机械臂操作任务。消融实验验证了组件贡献、数据源组合和增强微调策略。

关键发现

加入大规模人类监督后,联合预训练与后续微调性能一致提升,在两项仿真基准上达到当前最优。可靠性加权有效抑制了伪动作标签噪声,使异构数据训练可行。统一动作表示成功桥接不同形态间的动作差异,模型展现出对真实世界双机械臂操作的强迁移能力。

基线对比解读

与仅依赖昂贵机器人数据预训练的 VLA 方法相比,ACE-Ego-0 通过被动采集的人类视频大幅降低数据获取成本,并借助可靠性感知训练克服噪声鸿沟。消融显示,直接联合训练将因动作空间不匹配和标签噪声导致性能退化,而提出的人类辅助损失逐样本可靠性权重是核心驱动。该框架为利用海量被动人类数据推动具身智能发展提供了可行路径。

行业影响

落地场景

ACE-Ego-0 通过统一人类自我中心视频和机器人数据预训练 VLA 模型,使机器人能更高效地获取操作技能。可落地的场景包括:

  • 仓储与物流自动化:利用穿戴设备采集的人类拣选、打包视频,快速生成伪动作标签,训练机械臂完成复杂抓取和摆放任务。
  • 服务机器人:将日常人类活动视频转化为机器人可理解的操控序列,用于家庭服务(摆桌、清洁)或医疗辅助操作。
  • 自动驾驶与移动操作:通过自我中心视频理解人类与环境的交互,增强车辆对行人、物体的操控预测。

商业价值

该框架的核心商业价值在于大幅降低机器人数据采集成本。传统遥操作或人工示教数据采集耗时长、人力密集,而利用大规模已有自我中心人类视频,可自动生成带噪监督信号,配合可靠性感知训练,显著减少对昂贵真实机器人数据的依赖。

  • 降本:将数据获取从“定制采集”转变为“互联网级数据利用”,边际成本趋零。
  • 增效:预训练模型泛化能力提升,在新任务上只需少量微调即可达到 SOTA,加快产品迭代。
  • 体验升级:机器人能理解更丰富的场景语义,实现长程任务,提升自动化系统的适用范围和鲁棒性。

集成到现有工作流

ACE-Ego-0 可作为即插即用的预训练模块嵌入当前 VLA 开发管线:

  • 数据平台:在此基础上构建多源数据融合管道,从现有的 RGB 视频流中抽取伪动作,与机器人遥操作数据混合训练。
  • 模型栈:其统一的相机空间动作表示和形态学条件机制可直接兼容主流 VLA 架构(如 RT-2、Octo),无需大幅修改下游推理模块。
  • 任务适配:在新机械臂或任务上,仅需供应少量微调数据,预训练权重即可快速收敛,匹配现有的 MLOps 流程。

具体落地用例

  1. 电商仓储:将仓库员工佩戴头戴相机的拣货视频,通过视频-动作管道转换为伪动作轨迹,预训练抓取模型。随后在少量真实机器人数据上微调,适配不同货架布局和商品形状,实现快速开箱即用的拣选自动化。
  2. 内容平台的数据标注增强:利用海量第一视角创作视频(如烹饪、手工制作),自动生成带动作操控的 3D 标注,用于训练具身 AI 模型,为元宇宙虚拟人动作生成提供底层能力。这些场景均无需地域特定假设,直接面向全球物流、互联网企业。

局限

  • **伪标签质量依赖**:方法从人类自我中心视频生成伪动作轨迹,涉及 3D 手部重建和动作参数化等多阶段流水线。尽管设计了可靠性感知损失来抑制噪声,但在严重遮挡、快速运动或复杂交互场景下,伪标签噪声仍可能损害预训练效果,且可靠性权重的层次化分解依赖先验假设(如数据集级先验、时间平滑),这些假设不一定在所有场景下成立。
  • **实验覆盖范围有限**:评估集中在两个模拟基准(RoboCasa GR1 TableTop 和 RoboTwin 2.0)以及特定的双手操作真实任务,未在更多形态、任务类型或与现有大规模 VLA 基线(如 RT-2、Octo)进行全面对比。真实机器人实验仅展示了迁移到双手操作的潜力,缺乏对单臂、移动操作等常见设置的系统性验证,泛化性证据尚不充分。
  • **形态扩展性与计算成本**:方法需要为每种新机器人形态构建形态-条件嵌入(kinematic graph 与 morphology encoder),虽然提供了跨形态共享的统一动作空间,但当面临全新异质形态时,仍需设计对应的表征和训练,扩展性并非即插即用。此外,联合预训练混合了多种数据源,训练过程中的采样策略和负载均衡可能增加计算开销,论文未提供详细的训练成本对比。
论文Hao Li2026-06-15原文

相关内容