OTRetarget: 通过最优传输的机器人-物体联合运动重定向
将人类运动迁移到人形机器人,需要让演示动作适配机器人形态,同时保持与环境的交互。这在 loco-manipulation 任务中尤其困难:即便身体比例不同,与地面和被操作物体的接触也必须保持一致。但仅靠骨骼运动无法完整描述这些交互,而固定物体轨迹又会限制对新本体的适配。 为此,本文提出 OTRetarget,一种从人类演示中联合重定向机器人及多物体运动的统一方法。该方法用有符号距离、最近表面点和相对方向来表示表面交互,并利用熵最优传输 将这些量在人类、机器人与物体的几何之间迁移。 我们把得到的交互目标纳入带约束的逆运动学 求解中,在接触保持与运动风格之间取得平衡,并逐帧联合优化机器人位姿与物体位姿。该形式无需对场景或演示做重缩放,即可支持机器人-物体以及物体-物体交互。 在 OMOMO 上,该方法取得 87% 的机器人-物体交互 Jaccard 分数与 8.7 mm 的深度误差,而 OmniRetarget 分别为 28% 和 29.3 mm。最后,我们用基于重定向参考、通过强化学习训练的全身策略,将方法迁移到实体 G1 人形机器人上,涵盖双手把箱子取放到桌上等动作。
论文精读
TL;DR OTRetarget 利用最优传输联合重定向机器人与多物体运动,保持接触一致性而不缩放场景,在 OMOMO 上交互 Jaccard 从 28% 提升至 87%。
问题
问题背景 人形机器人从人类演示中学习移动操作(loco-manipulation)技能已成为机器人学习的主流范式,核心环节是将人体运动重定向到机器人参考轨迹,并确保环境交互(地面接触、物体接触)在形态差异下保持一致。
现有方法局限 传统骨骼运动重定向仅优化关节位置或角度,忽略手部与物体的表面接触,导致抓取、搬运等任务中出现穿透或脱开;固定物体轨迹的方法则假设物体运动独立于机器人形态,限制了机器人对新身体比例的自由适应;基于关键点或接触图的方法难以泛化到不同几何形状和多物体交互场景。此外,现有工作往往分别处理机器人与物体运动,割裂了接触耦合关系。
为什么这个问题难/重要 技术挑战在于跨形态表面几何对应:人体、机器人、物体具有不同拓扑和尺度,硬性关键点对应会丢失曲面细节。作者采用熵最优传输建立表面软对应,将符号距离、最近表面点和相对方向等交互描述量从人类映射到机器人和物体,但如何将这些软约束嵌入约束逆运动学求解器、同时平衡接触保持与运动风格,仍需要精心设计。业界对人形机器人在真实世界执行双手搬运、放置等移动操作任务需求迫切,接触一致性直接影响任务成功率与策略训练质量。
行业类比 类似于3D点云配准中利用最优传输寻找源点云与目标点云的软对应,OTRetarget 在人体、机器人、物体几何间迁移表面交互语义,实现接触的跨形态对齐。
核心洞察
- OTRetarget 的核心创新是用**表面交互描述符**(signed distances、closest surface points、relative directions)配合 **entropic optimal transport**,在人体、机器人、物体三类几何之间传递接触信息。这不同于传统方法仅重定向骨架而忽略环境交互,也不同于固定物体轨迹导致的适应受限。通过将接触一致性建模为跨形态的几何匹配问题,它能在身体比例差异显著时依然保持接触的准确性,为 loco-manipulation 任务提供了更完整的交互表征。
- 该工作将**机器人与物体姿态的联合优化**纳入约束逆运动学框架,而非分步处理或仅优化机器人。接触保持被作为优化残差,与运动风格目标加权平衡,每个时刻同时求解机器人关节和物体位姿。这使得机器人-物体和物体-物体交互可被同时保留,且无需对场景或演示进行缩放。相比 OmniRetarget 仅依赖单个目标点的做法,联合求解显著提升了交互精度(Jaccard 87% vs 28%)。
方法
输入:人类演示的骨骼运动序列,以及场景中物体与机器人/人体的几何表示,使用有符号距离、最近表面点和相对方向描述表面接触关系。
关键模块
- 表面邻近度最优传输:将人体、机器人、物体表面的接触特征(
signed distances、closest points、relative directions)视作可迁移量,通过 entropic optimal transport 在人/机器人/物体几何之间建立对应,生成 robot–object 和 object–object 的交互残差。 - 约束逆运动学求解器:把交互残差作为优化目标之一,与运动风格保持项联合,在每一帧同时对机器人关节和物体位姿进行优化;该求解器支持机器人–物体、物体–物体接触,且无需缩放场景或演示。
输出:与目标人形机器人形态一致的关节轨迹,以及多个物体的同步运动轨迹。这些重定向参考可直接用于训练 强化学习 全身跟踪策略,并部署到物理机器人。
与同类方法的差异点:OmniRetarget 等方法通常固定物体轨迹或只重定向人体骨骼,而 OTRetarget 将物体运动纳入优化变量,通过最优传输对齐表面接触,从而在 loco-manipulation 中保持接触一致性。
实验
实验设计
在 OMOMO 数据集上评估运动重定向质量,对比 OmniRetarget 等现有方法。涵盖原生场景重定向、物体形状泛化测试,以及将重定向参考轨迹用于训练 RL 全身策略并部署到实体 G1 人形机器人。
关键发现
OTRetarget 在 robot-object 交互 Jaccard score 达到 87%,深度误差仅 8.7 mm,显著优于基线。该方法无需缩放场景或演示,能同时处理机器人-物体与物体-物体交互,并成功泛化到新物体形状。实体机器人实验验证了双手抓取箱子放置到桌面的任务。
与基线对比深度解读
OmniRetarget 仅重定向机器人骨骼运动,固定物体轨迹,导致身体比例差异下交互不一致;OTRetarget 通过 最优传输 在表面级别传递交互信息,联合优化机器人与物体位姿,从根本上解决了 loco-manipulation 中的接触保持问题。工程启示:在处理交互密集的任务时,必须将物体运动纳入优化变量,而非作为固定输入。
行业影响
落地场景
人形机器人 在仓储物流、家庭服务、医疗辅助等场景中需要模仿人类操作物体的动作。例如电商仓库中的人形机器人搬运纸箱、码垛,或服务机器人整理桌面物品。OTRetarget 实现从人类演示到机器人-物体联合运动的重定向,能适应不同物体形状,支持多物体交互,可用于自动生成大量操作示范,驱动 强化学习 策略训练。
商业价值
核心价值在于降低数据采集成本 与 缩短调参周期。传统方法需要人工调整物体轨迹或重新采集,本项目自动保持接触一致性,减少仿真-现实差距。对机器人厂商,可复用人类动作数据库生成不同形态机器人的参考轨迹,加速新 SKU 的技能部署,提升操作成功率与泛化性,从服务收入和硬件销售两条线增收。
与现有产品 / 工作流的接口
该方法可集成到主流 机器人学习栈:作为动作生成模块,接在人体动捕或视频提取之后,输出关节轨迹与物体位姿序列;再输入 Isaac Gym / MuJoCo 等仿真器进行 RL 训练。也可作为遥操作前处理,将操作员动作实时映射到异构机器人。支持插件形式集成到 ROS 2 节点或现有重定向库(如 motion_imitation、omni_isaac)。
局限
- 方法依赖完整的物体几何模型以及人-物/物-物表面点对应,最优传输求解(Sinkhorn 迭代)的计算开销可能较高,论文未报告每帧求解时间或实时性指标。在实际遥操作或大规模仿真数据生成中,若需要高频重定向,该计算瓶颈会限制部署。同时,对输入演示中物体姿态的准确获取未作深入讨论,如果物体运动来自视频或 VR 演示且存在噪声,表面距离与相对方向特征可能被破坏,导致交互约束失效。
- 实验场景和物体类别相对有限:验证主要集中在 OMOMO 数据集中的盒状物体与桌面拾放任务,对柔软/可变形物体、复杂多指手部操作、多物体密集耦合等场景没有测试。泛化到新物体形状的实验仅覆盖有限几何变化,未证明对拓扑差异大(如有孔、薄壁、非凸)或非刚性物体的鲁棒性。此外,对比基线只有 OmniRetarget,与其他同时期人形机器人重定向方法(如专注操作或全身控制的 pipeline)缺乏横向比较,难以完全确立方法在更广问题上的优势。
- 该工作聚焦几何层面的交互保持,通过表面点距离和方向构造约束,但未显式建模接触力、摩擦锥或动力学一致性。对于需要精确力控的精细操作(如旋拧、插拔),仅靠几何最近点可能无法保证物理可行性,后续 RL 策略仍需大量奖励工程来补偿。另外,方法要求人演示中物体轨迹已知且与机器人场景物体一一对应,这在实际数据采集中需要额外标注或感知模块,可能增加系统复杂度。