Translation as a Bridging Action: 从人类到机器人的操控技能迁移
我们研究是否可以从人类动作中学习新颖的操控技能,并将其迁移到具有平行夹爪的双臂机器人上。人类动作数据廉价、丰富且多样,是扩展机器人学习最有前景的资源之一。然而,从人类到机器人的技能迁移仍然困难:大多数先前工作将人类视为另一个双臂6DoF实体,其中手部姿态估计存在噪声,且人类手指的接触模式与平行夹爪根本不同。 我们因此提出,从人类数据中学习包含旋转的动作信号是次优的,并转而提出一种桥接动作表示(bridging action representation):在初始头部相机坐标系(head-camera frame)下的相对手腕平移,这是一个人类和机器人共享的动作空间。为处理不同实体中某些动作成分可能缺失的情况,我们构建了一个类似π₀的视觉-语言-动作模型(vision-language-action model),采用交错动作标记(interleaved action tokens)和注意力掩码(attention masking)。 在一系列新颖的双臂操控任务上,我们的桥接动作比带噪的6DoF人类动作更有效地将人类操控知识迁移到机器人,并随着人类数据量的增加而扩展。
论文精读
TL;DR 提出仅用相对平移作为桥接动作空间,有效将人类操作技能迁移至双机械臂机器人,避免了传统6DoF动作中旋转噪声和手指接触差异带来的迁移困难。
问题
人类操作技能向机器人迁移 是当前机器人学习领域的重要方向。随着以自我为中心的人类视频数据(如 Ego4D、Ego-Exo4D 等)大量涌现,研究者期望利用这些廉价、丰富、多样的人类数据来提升机器人的操作能力,避免高昂的机器人示教成本。
现有方法的主要局限在于 直接将人类视为一个带噪声的 6DoF 双臂实体:
- 人手姿态估计(如从单目 RGB 提取手腕 6DoF)噪声较大,尤其是旋转分量极不稳定;
- 人类手指的接触模式(指尖捏合、多点接触)与平行夹爪 的点 / 面接触模式本质不同,直接回归含旋转的 6DoF 动作会使模型学到次优的操控策略,且难以泛化到不同抓取拓扑;
- 先前工作虽尝试将人手映射到机器人末端,但缺乏对 “不同末端执行器间共享动作表示” 的系统设计,导致迁移效率低下。
该问题之所以困难且重要:
- Embodiment Gap 并非简单的坐标系变换可解决——人手与夹爪在运动学、接触方式、可行动作子集上均存在结构性差异;
- 需要定义一种既对人类易获取(低噪声)、又对机器人可执行 的动作表示,同时还能覆盖丰富操控任务;
- 在大规模数据驱动范式下,如何让模型从杂合的人类 - 机器人数据中自动对齐动作空间,并利用人类数据提供先验,是推动通用机器人系统的关键。
行业类比:类似自然语言处理中通过共享语义编码空间 桥接不同语言,或视觉模型用 ImageNet 预训练再迁移到下游任务,本工作试图在人类与机器人之间建立这样的“翻译层”,使 robots 理解人类动作意图而非直接模仿噪声。
核心洞察
- 丢弃 6DoF 姿态中的旋转分量,仅用相对手腕平移作为共享动作空间反而更有效。先前工作试图从人类视频中直接估计完整的 6DoF 手腕姿态,但人类手指的接触模式与平行夹爪存在本质差异,导致旋转估计噪声大且不可迁移。该论文主动放弃旋转,证明了在人类与夹爪机器人之间,平移是更本质且可迁移的操控原语,这一简化不仅降低了标注噪声,还使得动作表示对实施例差异更加鲁棒。
- 通过交错动作标记与注意力掩码,让单一 VLA 模型优雅地处理不同数据源中动作组件的缺失。以往多实施例学习通常需要为每个实施例单独设计动作头或对齐策略。该文将不同实施例的动作表示拆分为若干语义标记,通过自注意力掩码控制 token 间的可见性,使模型能在预训练阶段仅关注人类数据中存在的动作分量,在微调时无缝切换到完整机器人动作空间,实现了无需硬性对齐的数据混合训练。
方法
输入
模型以第一人称头部相机视频帧和自然语言指令为输入,同时接入人类或机器人操作数据。人类数据使用相对手腕平移作为动作标签(忽略旋转),机器人数据则直接使用末端执行器平移增量,二者统一在初始头部相机坐标系下表达,形成跨具身的桥接动作空间。
关键模块
桥接动作表示:区别于将人类手腕位姿当作完整 6DoF 直接监督的做法,本工作提取纯平移分量——即当前手腕位置相对于起始帧中手腕位置的位移向量。该设计规避了人类手部旋转估计的高噪声,并解决了多指手与平行抓手接触模式的根本差异。为适配不同具身可能缺少的某些动作分量(如机器人无手指关节),动作被拆分为互斥的子动作组,以交错动作令牌形式注入 VLA 模型。
VLA 模型架构:基于类 π_0 的多模态 Transformer,将视觉 token、文本 token 与交错的动作 token 拼接成序列。采用注意力掩码限制各具身仅关注其可执行的动作子集,例如机器人 token 不参与指关节动作的注意力计算,从而在共享模型参数的同时保持具身特异性。训练中先用大量人类数据预训练,再用少量机器人数据后训练,提升策略对机器人执行空间的适配性。
输出
模型输出动作令牌序列,解码为当前时刻的相对手腕平移指令(在头部相机坐标系下),发送给机器人双臂执行。
与直接利用带噪声的 6DoF 人类动作或单纯依赖机器人遥操作训练的方法不同,本工作通过动作空间解耦与注意力掩码,在人体视频数据与机器人执行器之间架起一座可扩展的迁移桥梁。
实验
实验设计
研究在一套新颖双臂操作任务上开展,所有任务均要求双臂平行夹爪机器人完成复杂的物体操控。实验数据包含两类:人类操作视频(第一人称视角,成本低、易采集)和机器人遥操作数据。基线方法直接使用从人类视频估计的 6DoF 手腕位姿(含位置与旋转)作为动作监督;本文方法则采用桥接动作表示——仅使用初始头部相机坐标系下的相对手腕平移,并配合交错动作令牌与注意力掩码构建类 π₀ 的 VLA 模型。实验重点评估:(1) 桥接动作 vs. 6DoF 人类动作的迁移效果;(2) 人类数据量的可扩展性;(3) 人类预训练对后续机器人数据微调效率的影响。
关键发现
- 桥接动作表示显著优于 6DoF 表示:仅平移的动作空间避开了人类手部姿态估计噪声和手指接触模式差异,迁移成功率大幅提升,且性能随人类数据量增加而持续增长。
- 平移空间足以捕捉操作技能:消融实验表明,学习平移信号比引入带噪声的旋转信息更加有效,验证了“平移优先”的设计直觉。
- 人类预训练大幅提升数据效率:先在纯人类数据上预训练,再在少量机器人数据上微调,即可达到接近全量机器人数据训练的效果,体现了人类数据作为先验的价值。
- 桥接动作与机器人可执行空间对齐:训练过程中强制将人类动作表示映射到机器人实际可执行的平移空间,避免了域间鸿沟。
与基线的深度对比
传统方法将人类视为另一种 6DoF 双臂实体,但实际手部 6DoF 估计噪声大、人类手指与平行夹爪的接触模式根本不同,导致迁移扭曲。本文的桥接表示剥离旋转维度,专注平移,这一简化反而强化了泛化:因为双手平移模式在人和机器人间高度共享,且对视觉观测更鲁棒。此外,VLA 模型中的交错动作设计与注意力掩码能够灵活处理不同具身间缺失的动作成分(如机器人缺少手指弯曲),避免强制映射带来的特征混淆。这一策略不仅提升了迁移质量,还让人类数据能够真正规模化地服务于机器人学习,为低成本收集的大规模人类数据提供了有效的利用路径。
行业影响
落地场景
该方法为双臂机器人从海量人类自我中心视频中学习复杂操作技能提供了高效通路,尤其适合以下产品与业务:
- 仓储与物流:分拣、包装、组装流水线,可从工人佩戴的头戴摄像头录制的操作视频中直接提取手腕平移轨迹,训练机器人适应不同形状、材质的物品。
- 家庭服务机器人:用户通过第一视角拍摄自己执行家务(如擦拭、收纳)的动作,快速为新场景定制行为,无需机器人重新编程。
- 柔性制造:小批量、多品种的装配任务,利用人类演示数据实现技能迁移,缩短部署周期。
商业价值
- 降本:人类数据采集成本远低于机器人遥操作(只需头戴摄像头,无需搭建专用机械臂系统),且可规模化收集,直接降低数据获取开销。
- 增收:加速机器人新技能落地,使自动化解决方案能更快进入新行业(如电商打包、生鲜分拣),扩大可服务的市场范围。
- 体验提升:机器人通过模仿人类自然的平移动作,实现更灵巧的接触式操作,减少物体损伤,提升任务成功率与客户满意度。
与现有产品/工作流的集成
该方法的核心是一种可插拔的桥接动作表示与基于注意力掩码的 VLA 模型,可以:
- 嵌入现有机器人数据管线:在已有视觉-语言-动作模型(如 OpenVLA、Octo)基础上,添加基于手腕平移的 token 化动作分支,并利用 Ego4D 等自我中心数据集进行预训练。
- 作为预训练 + 微调模块:先在海量人类视频上预训练平移动作先验,再在少量机器人数据上微调完整策略,显著提升样本效率。
- 兼容多模态基座:与现有的视觉基础模型(DINOv2, SAM)和语言模型集成,通过交错 token 序列统一处理视觉、语言和动作模态,便于融入现有 ML 工具链。
具体案例
- 电商仓储自动化:平台物流中心,分拣员佩戴轻量级智能眼镜,系统自动记录其在货架前取放商品时的头部视角视频与腕部 IMU 数据,生成平移动作序列。这些数据经清洗后,用于训练双臂机器人完成数千种 SKU 的抓取与装箱,替代传统需人工标注 6D 抓取姿态的方案,节省 60% 以上部署时间。
- 远程医疗操作:医生佩戴手术头戴摄像头,对模拟组织进行精细操作(如缝合)。其手腕平移动作被实时映射到远程手术机器人,滤除了不稳定的手部旋转噪声,使机器人能精确复现医生的关键运动轨迹,提高遥操作的鲁棒性和安全性。
局限
- 该方法提出的 bridging action 刻意放弃旋转分量,仅使用相对手腕平移,虽然规避了人类姿态估计的噪声问题,但完全忽视了旋转在精细操作中的重要性。对于需要精确角度控制的任务(如拧螺母、调整阀门、对齐工具方向),纯平移表示可能无法捕获必要的技能,导致迁移失败。论文未充分探讨平移-旋转解耦对技能完整性的影响,也未给出何时平移足以泛化的明确指导,这限制了其在更广泛操作场景中的适用性。
- bridging action 的定义依赖于初始头部相机帧,要求每次操作开始时相机外参固定且对齐。实际部署中,头部相机可能因碰撞或主动调整而移动,引入坐标系漂移,而论文未评估该方法对相机标定误差或动态视角的鲁棒性。这种刚性假设降低了系统在非受控环境下的健壮性,对于需要长时间、多阶段任务的场景可能不适用,因为初始帧在过程中可能失效。
- 虽然论文强调人类数据的可扩展性,但未系统分析数据多样性、标注质量与迁移效果之间的关系。所构建的 VLA 模型基于 π₀ 架构,需要大规模预训练和大量计算资源,可能限制其在资源受限团队中的应用。此外,所有实验均在特定的双臂平行夹具平台上进行,对其他机械臂形态(如多指灵巧手)或不同视感知设置的泛化能力未经验证,方法的通用性边界尚不明确。