论文

Play2Perfect: 灵巧操作中玩耍预训练对于精确装配的关键因素

Play2Perfect: 灵巧操作中玩耍预训练对于精确装配的关键因素

多指机器人虽可模拟人手的速度与灵巧性,但在精确装配等接触密集、奖励稀疏的任务上仍面临挑战。接触密集性使模仿学习难以收集数据,稀疏奖励则令强化学习(RL)直接探索不可行。先前工作依赖专用夹爪、工具附件和环境固定装置来简化问题。 本文提出 Play2Perfect,一个任务无关的 RL 预训练框架:先通过与多样物体和目标进行“玩耍”来获取可复用的操作先验(如抓取、手中重定向、位姿到达),再微调适配精确装配。微调阶段聚焦于最终的接触密集、高精度交互,从而高效探索。 系统研究了玩耍预训练中的关键设计选择,包括: 1. 物体多样性 2. 训练目标 3. 轨迹多样性 4. 目标精度 实验表明,即使提供密集的多阶段奖励,Play2Perfect 的样本效率也比从零训练的 RL 高 33 倍。零样本 sim-to-real 迁移中,在仅 0.5 mm 接触间隙的紧插入任务上达到 60% 成功率,在多部件长程装配和拧螺丝任务上超过 50%。

论文精读

TL;DR 让多指手先通过玩多样物体学习通用操控先验,再微调完成精密装配,RL 采样效率提升 33 倍,零样本 sim-to-real 实现 0.5 mm 间隙插入和长序列装配。

问题

问题背景

多指灵巧手在制造业中具备替代人手、执行高速高精度装配任务的潜力,但这类接触密集、容差极小的任务至今仍是机器人控制的难题。

现有方法局限

当前主流方案通过结构化环境或专用夹具降低控制复杂度,例如定制夹爪、工具头或物理导向槽,这牺牲了灵巧手的柔性与泛化性。另一路线基于模仿学习,但其数据采集在接触频繁的装配场景极难实现;而直接使用强化学习端到端探索又会面临奖励极度稀疏的问题——装配成功信号往往只在毫米级对准后才出现,导致探索效率极低,训练几乎不可行。即使引入分段密集奖励,手工设计奖赏函数的过程也十分繁琐,且容易陷入局部最优。

技术挑战与重要性

精密装配任务对位置、力控和时序配合的要求远高于常规抓取,尤其在只有 0.5mm 间隙的紧配合插入中,机器人必须同时处理多点接触、滑动摩擦与弹性形变。业界对样本高效、无需大量人工示教且能零样本迁移到真实环境的灵巧操控方法高度关注,这类技术有望推广至多零件长序列组装、螺丝拧紧等复杂流程。

行业类比

与计算机视觉中通过大规模无监督预训练获得通用表征、再微调适配下游细分任务类似,Play2Perfect 先用无目标的“玩耍”交互习得抓取、旋转等操作先验,再将探索聚焦于精密装配的最终接触阶段,大幅提升样本效率。

核心洞察

  • 游戏式预训练将接触丰富任务从探索困境中解放,显著提升样本效率。传统 RL 在精密装配等稀疏奖励、高精度任务中难以有效探索,而 Play2Perfect 通过在多样化物体上的任务无关“玩耍”学习通用的抓取、手中重定位和位姿调整策略,使下游微调时的探索集中在最终的高精度接触交互上。即使与提供密集多阶段奖励的 RL 从头训练相比,仍然获得 33 倍的样本效率提升,证明了通用操作先验对于复杂接触任务的关键价值。
  • 对预训练设计空间的系统消融揭示了决定下游装配性能的关键因素。不同于以往方法仅关注特定任务设置,本研究系统评估了物体多样性、训练目标分布、轨迹多样性、目标精度等设计选择的影响,发现物体多样性和轨迹多样性是预训练有效性的核心,而目标精度需在探索与最终任务精度间平衡。这些发现为灵巧操作预训练提供了可操作的指导原则,说明“如何玩”比“玩什么”更值得仔细设计,对后续研究具有直接借鉴意义。

方法

方法概述

Play2Perfect 采用两阶段强化学习框架:无任务先验的 Play 预训练装配任务微调

输入:多样化的物体集合(不同形状、尺寸),以及随机采样的目标姿态(6-DoF)。多指灵巧手在物理仿真中直接与这些物体交互,无人类演示或任务专用夹具。


阶段一:Dexterous Play Pretraining

RL 智能体在自由玩法中学习通用操作先验,核心设计要素包括:

  • 物体多样性:训练集包含大量不同几何与物理属性的物体,迫使策略泛化到各种抓取与重定向模式。
  • 训练目标:采用自监督目标达成奖励,鼓励智能体将物体移动到随机指定的目标姿态,同时隐式学习稳定抓取、手中重定向和姿态对齐。
  • 轨迹多样性:通过目标随机化与动作空间探索熵奖励,产生丰富的交互轨迹,避免收敛到单一策略模板。
  • 目标精度:Play 阶段仅要求松散的姿态到达,为后续高精度装配预留学习空间。

这些设计共同构建出操作先验(manipulation prior)——一组可复用的接触动力学知识,不依赖特定任务。


阶段二:RL Finetuning on Assembly

将预训练的策略权重直接作为初始化,在装配任务上继续微调:

  • 奖励工程:装配任务采用多阶段稠密奖励(如接近、对齐、插入),但微调时仍以原 Play 先验为探索起点,大幅降低有效探索难度。
  • 接触优化:重点学习插入阶段微小的力/位姿耦合,通过持续性接触交互完成精密配合(如 0.5 mm 间隙的紧插轴孔)。
  • 训练细节:使用 PPO 算法,域随机化覆盖视觉纹理、动力学参数,策略架构为 Actor-Critic 网络共享视觉-本体感知编码器。

输出:可直接部署到真实机器人的零样本策略,实现从自由玩耍到精密装配的极低样本适应。

与同类工作(如直接端到端 RL 或模仿学习)的差异:Play2Perfect 不依赖结构化环境、专用夹具或人类演示,而是通过非结构化 Play 自主构建可复用操作先验,从而比从零开始的 RL 样本效率提升 33 倍,并在多阶段长序任务中保持高成功率。

实验

实验设计

Play2Perfect 在仿真中用多指手执行装配任务,分为两个阶段:

  • Play Pretraining:在多样化物体和目标上,通过强化学习训练通用操作先验,如抓取、手中重定向、姿态到达。重点研究物体多样性、训练目标、轨迹多样性和目标精度等设计选择的影响。
  • RL Finetuning:在具体的高精度装配任务(如紧配合插入、多部件装配、拧螺丝)上微调,利用接触丰富的交互。

实验对比了从头训练的 RL(即使有密集多阶段奖励),以及消融不同预训练因素。

关键发现

  • 样本效率大幅提升:与从零开始的 RL 相比,使用 play 先验的微调使样本效率提高 33 倍,即使对方有密集奖励。
  • 零样本 sim-to-real 迁移:在仅 0.5 mm 间隙 的紧插入任务上达到 60% 成功率;在长时程多部件装配和拧螺丝上超过 50% 成功率
  • 预训练设计因素至关重要:物体多样性、目标精度和探索策略都会影响下游性能(具体消融结果见论文)。

与基线对比解读

Play2Perfect 的核心优势在于将操作技能分解为通用先验和任务特定适配。相比从头 RL,play 预训练提供了可重用的技能库,将下游探索聚焦于接触丰富的高精度交互,从而极大降低样本复杂度。即使基线获得精心设计的密集多阶段奖励,仍难以匹敌预训练带来的探索引导。这表明,在复杂接触任务中,先验知识的获取比奖励设计更关键。此外,零样本 sim-to-real 的成功证明了该先验的鲁棒性和泛化性,为灵巧手实际执行精密装配铺平了道路。

行业影响

落地场景

  • 精密制造与装配:电子元器件(如 PCB 板、连接器)的紧密插入与组装,尤其在公差小于毫米级的场景中,传统夹爪难以胜任,Play2Perfect 利用多指手零样本 sim-to-real 可快速部署。
  • 实验室自动化:移液、试管搬运、微孔板操作等需精细力控的任务,可由通用机器人工作站完成,减少人工重复劳动。
  • 仓储物流与拣选:异形、易碎物品的抓取与放置,借助玩耍预训练获得的通用抓取和手中重定向技能,提升系统对不同物品的快速适应能力。
  • 远程手术与维护:太空或核环境等高风险场景下,灵巧手通过遥操作结合自监督预训练,可在微重力或狭小空间下完成精密拧螺丝、插拔线缆等维修。

商业价值

  • 降本:通过任务无关的玩耍预训练,免去为每个新装配任务手工设计密集奖励或收集大量演示数据,训练周期和人力成本大幅下降;RL 从零训练采样效率提升 33 倍,直接减少 GPU 机时消耗。
  • 增效:允许在生产线上快速切换产品型号,仅需对已预训练的通用操纵先验做轻量微调,加速新品导入,提高设备利用率。
  • 体验提升:在柔性制造系统(FMS)中,机器人能以人类般灵巧度处理多品种小批量的装配需求,实现真正的无人产线,降低对固定工装的依赖。

与现有产品/工作流的接口

  • 仿真与硬件平台集成:Play2Perfect 基于 Isaac Gym 等流行仿真器,可直接导出策略到物理机器人,与 ROS/ROS2 生态对接,通过标准化消息格式控制多指手(如 Shadow Hand、Allegro Hand)。
  • 感知模块补充:可融合视觉(RGB-D 相机)、触觉(GelSight)输入,形成多模态感知-控制闭环,提升在遮挡或光照变化下的鲁棒性。
  • 技能库扩展:将玩耍预训练得到的抓取、重定向、姿态到达等技能封装为可复用的行为原语(Skill Primitives),供高层任务规划器(如 TAMP)调用,构建更复杂的长周期装配序列。

具体案例

  1. 电子代工服务(EMS):生产线需快速切换手机、电脑、汽车电子等不同产品的装配任务,利用 Play2Perfect 的多对象玩耍预训练,机器人手可像人类工人一样适应新零件抓取与插入,无需重新设计夹爪或工装,大幅缩短换线时间。
  2. 生物制药实验室:在药物筛选过程中,机器人用多指手完成移液头安装、微量试管开盖、微孔板堆叠等操作,预训练模型提供了高精度的力控制先验,确保液体处理无污染、无洒溅,同时零样本迁移避免了生物安全柜内的数据采集风险。

局限

  • **Sim-to-Real 迁移成功率有限且任务扩展性待验证**:在精密插入任务(0.5mm 间隙)上 60% 的成功率与多部件装配、拧螺丝任务上约 50% 的成功率表明,当前框架在复杂真实环境中还未达到工程可靠性。预训练物体的多样性虽然经过消融,但仿真与现实的物理差异(如摩擦、形变)难以完全覆盖,导致微调后的策略对真实扰动敏感。此外,文章仅展示单一多指手平台,策略对其他手部形态或不同装配任务的泛化能力尚未检验。
  • **预训练任务设计与目标装配之间的分布偏移**:Play 阶段的训练目标(抓取、掌中重定向、位姿到达)虽能习得通用操作先验,但未显式涉及装配特有的接触约束与力控行为。微调时仍需大量交互探索以弥合这一差异,可能限制了 sample efficiency 的进一步提升。此外,策略依赖精确的物体姿态估计,真实部署时视觉感知噪声会显著影响表现,而方法未提供对传感不确定性的鲁棒保障。若从感知到控制做端到端训练,则 sim-to-real 差距可能更大。
论文Tyler Ga Wei Lum2026-06-24原文

相关内容