论文

CoDance: 从视频中学习反应式且柔顺的人-人形机器人交互

CoDance: 从视频中学习反应式且柔顺的人-人形机器人交互

CoDance 是一个从视频中学习反应式且柔顺的人-人形机器人交互框架。双人的人-人形机器人交互需要将行走移动与持续的身体接触耦合在一起:人形机器人既要配合人的动作,又要对交互力做出响应,同时保持稳定自然的运动。研究以双人舞蹈作为一项具有挑战性的实例:人形机器人需要与移动中的舞伴协调脚步,并维持双手持续接触。 给定一段两名人类舞者的单一视频,CoDance 将其动作重定向为机器人参考动作与一个移动舞伴。方法引入了多连杆柔顺增强(multi-link compliance augmentation),通过在双手施加结构化力、并据此调整机器人参考动作,把运动学示范转化为力感知训练数据。 在该数据上训练的策略能够跟随观察到的舞伴,同时保留示范中的行走风格,并对物理交互做出柔顺响应。在仿真中,策略能根据舞伴的变化调整脚步,并复现增强示范中所编码的约 80% 手腕位移。在实体人形机器人上,CoDance 实现了与人类舞伴持续的双手共舞,包括前进与后退动作之间的反复切换。

论文精读

TL;DR CoDance 从单个双人舞蹈视频学习人形机器人策略,通过多链路柔顺增强将运动学演示转化为力感知数据,实现与人连续双手接触下的反应式、柔顺双人舞,仿真与实物验证。

问题

问题背景

当前人形机器人学习多聚焦于从视频或动捕数据模仿人类运动,但大多数工作只考虑机器人独立执行任务,外部接触常被当作扰动。

现有方法局限

  • 运动模仿(motion imitation) 通常只生成运动学参考轨迹,缺乏接触力信息;策略在物理交互时容易僵硬或失稳。
  • 强化学习训练往往将接触力视为环境扰动,而非任务信号,导致机器人无法主动顺应伙伴动作。
  • 从单一视频 retargeting 到人形机器人缺少力觉数据标注,难以学习连续物理接触下的协调行为。

工程启示:与以往 motion tracking 方法不同,CoDance 在数据阶段引入多链路顺应增强,把纯运动学演示转化为力感知训练样本,这比仅靠策略隐式学习更可控。

为什么难/重要

伙伴交互耦合全身运动与持续接触:机器人需在移动中保持平衡,同时跟随伙伴节奏并对手部接触力做出顺应响应。视频只有视觉信号,没有力标签,从视频到物理机器人存在显著的 sim-to-real 差距。业界对人机协作(引导、搬运、舞蹈) 的需求上升,该问题挑战具身智能的力-运动联合控制。

行业类比

类似于从人类演示视频学习机器人抓取但缺失触觉反馈;CoDance 的 compliance augmentation 相当于在模仿学习中合成力觉监督,与视觉预训练中的数据增强思路相通。

核心洞察

  • 核心创新是通过多链路柔顺增强将运动学视频演示转化为力感知训练数据,解决了从纯运动学数据学习接触丰富任务时缺乏力标签的问题。与大多数模仿学习将接触视为扰动不同,CoDance 在训练时主动在双手施加结构化力,让策略在跟踪演示风格的同时学习顺应外部力,弥合了运动学参考与真实物理交互之间的分布差距。这为从视频学习人机物理协作提供了数据高效且可扩展的范式。
  • CoDance 证明单一视频足以训练人形机器人进行持续双向双手舞蹈,其关键在于将演示分解为机器人参考与移动伙伴参考,并通过 clip-chaining 扩展行为多样性。相比依赖多视角动捕或人工设计力策略的方法,这种从现有视频中自动提取配对交互并生成训练分布的方式,大幅降低了数据获取门槛,同时保留了反应性和风格一致性,对实际部署中快速适应新任务具有工程价值。

方法

输入与数据管线

CoDance 的输入是一段双人舞蹈视频,仅需一个视频片段即可启动训练。数据管线首先对视频进行运动重定向 (retargeting),将两名舞者的动作分别映射到人形机器人的运动学参考轨迹和一名移动伙伴的参考轨迹。重定向后的参考轨迹作为运动学演示,保留了舞蹈风格与步态节律。

关键模块:Multi-link Compliance Augmentation

核心创新是 multi-link compliance augmentation。该模块在运动学演示的基础上,对机器人双手施加结构化交互力,将原本纯运动学的参考轨迹转化为力感知训练数据。具体而言,通过在双手上模拟不同方向、幅度的接触力,动态调整机器人参考姿态,使训练数据同时编码了运动意图与顺应性响应。这一过程无需真实交互数据,即可从视频中构造出大量涵盖接触情形的变体。

策略训练

策略网络在仿真环境中以强化学习方式训练,跟踪增强后的参考轨迹,同时学习对双手接触力的柔顺响应。奖励函数鼓励跟随移动伙伴、保持演示的步态风格,并对接触力做出合理顺应。训练后的策略能够在仿真中适应伙伴运动变化,复现约 80% 的增强演示手腕位移。

硬件部署

训练好的策略可零样本迁移到实物人形机器人上。在硬件实验中,机器人能够与人类伙伴持续进行双手接触的舞蹈,包括前后移动的重复转换,验证了策略的稳定性与泛化能力。

跟同类方法的差异点

与传统方法将接触力视为干扰而被动抵抗不同,CoDance 通过 multi-link compliance augmentation 将接触耦合显式注入训练过程,从单一视频中学得主动顺应与步态协调的交互策略。

实验

实验设计

从单个双人舞蹈视频出发,CoDance 将舞者动作重定向为机器人参考轨迹与移动伙伴模型。引入 multi-link compliance augmentation,在双手施加结构化力,将运动学演示转换为力感知训练数据。训练策略在仿真和真实人形机器人上验证。

关键发现

  • 仿真中,策略能适应伙伴运动变化,复现增强演示中约 80% 的手腕位移。
  • 硬件上,人形机器人实现与人类伙伴持续双手舞蹈,完成前后向运动反复切换。

与基线对比解读

文章未提供明确定量基线对比。从方法定位看,CoDance 区别于传统人机交互控制依赖预先定义的交互模型或简化接触假设,也不同于纯运动模仿缺少力响应。通过视频数据与 compliance augmentation,策略同时具备 reactive 和 compliant 特性,这在人形机器人舞蹈交互场景中尚属少见,但尚需后续工作补充与基线方法的量化比较。

行业影响

落地场景

CoDance 提供的从单段双人舞蹈视频生成人形机器人交互策略的能力,可直接落地于主题公园表演机器人、商场导览伴行机器人、康养舞蹈陪练机器人等产品。具体 use case:

  • 娱乐演出:一家全球主题公园运营方部署人形机器人作为舞蹈演员,只需拍摄当地舞者的双人舞视频,机器人即可与游客共舞,无需每场重新编程。
  • 康复辅助:医疗机构利用人形机器人辅助物理治疗师进行舞蹈动作疗法,机器人能根据患者推力实时调整步态,保持连续手部接触。

商业价值

核心价值在降低人形机器人互动行为开发成本。传统方法需手工设计力控与步态耦合,CoDance 通过视频自动生成训练数据,将开发周期从数周缩短至数天。

  • 降本:减少对专业机器人工程师的依赖,只需普通视频素材。
  • 增收:为娱乐、教育、健康领域提供新的人形机器人应用场景,拓展市场。
  • 体验提升:机器人能柔顺地响应接触力,用户感知更自然、安全,提高客户满意度和复购率。

与现有 stack 的接口

CoDance 可作为模块嵌入人形机器人软件栈:

  1. 数据管道:接收 RGB 视频,输出重定向的机器人参考轨迹与力增强训练数据,可对接现有 motion capture 或视频处理工具。
  2. 策略训练:使用 强化学习 框架(如 Isaac Gym)训练,输出策略可直接部署至 ROS 2 节点,与全身控制器、力传感器接口对接。
  3. 部署:硬件上依赖手部力传感器和足底接触传感器,可与现有 humanoid 平台的传感器驱动兼容。

对工程团队而言,该方法将交互行为学习与柔顺控制统一到一个 pipeline 中,无需单独开发接触响应模块。

局限

  • **泛化范围有限**:CoDance 基于单一视频演示进行重定向,所学的交互行为高度依赖该视频中的舞蹈动作与接触模式(持续双手接触、前后移动)。对于其他类型的双人交互(如单手引导、推拉、非持续接触、复杂舞步),需要重新采集演示并训练,难以直接迁移。虽然方法中提及 clip-chaining 可扩展动作片段,但未系统验证跨动作、跨伙伴的泛化能力。
  • **力建模存在近似误差**:多链路顺应增强将真实物理交互力简化为结构化力施加在双手上,用于生成力感知训练数据。这种近似可能无法准确反映人手接触时的实际力分布(如手指的局部压力、非刚性接触),导致策略在实际部署中对于未建模的力模式响应欠佳,影响顺应性与稳定性。
  • **硬件验证场景较简单**:论文在实体人形机器人上仅演示了持续双手接触的前后移动切换,实验条件相对可控。对于更复杂的动态环境(如外部扰动、伙伴突然改变速度或方向)或不同身高、体型的伙伴,机器人能否保持稳定和自然的交互尚未充分评估,sim-to-real 差距有待进一步缩小。
论文Zhuoqun Chen2026-10-04原文

相关内容