逆向工程演示需硬件、动作捕捉和并行RL训练,介绍HOVER模型
让我们逆向工程这个演示。你需要三样东西:(1)将仿真视为一等公民的稳健硬件和电机设计;(2)人类动作捕捉("mocap")数据集,例如电影和游戏角色的数据集;(3)GPU加速仿真中的大规模并行强化学习训练。去年十月,我们的团队训练了一个名为HOVER的150万参数基础模型,用于实现如此敏捷的运动控制。它大致遵循这个配方(详情见线程):
(1)仿真过去是事后才考虑的事情。现在,它必须成为硬件设计过程的一部分。如果你的机器人仿真效果不好,你就可以和RL说再见了。硬件-仿真协同设计是一个非常有趣的新兴话题,只有在今天的计算能力下才变得有意义。
(2)人类mocap数据集用于产生自然行走和跑步步态。这是使用人形机器人的一个巨大优势——你可以模仿原本为电影或3A游戏捕捉的大量人类运动。至少有三种方式使用这些数据:
- 用于初始化:预训练神经网络模仿人类,然后开启物理约束微调成机器人形态;
- 用于奖励函数:惩罚任何与目标姿态的偏差;
- 用于表示学习:将人类姿态视为“运动先验”来约束机器人行为空间。
(3)将上述内容放入Isaac sim,添加大量随机化,通过PPO运行,投入一堆GPU,然后看Netflix直到损失收敛。
如果你忍不住评论这是CGI,让我省去你几次按键——许多学术实验室现在拥有实体G1机器人。
查看我们团队的HOVER工作在线程中:🧵
(1)仿真过去是事后才考虑的事情。现在,它必须成为硬件设计过程的一部分。如果你的机器人仿真效果不好,你就可以和RL说再见了。硬件-仿真协同设计是一个非常有趣的新兴话题,只有在今天的计算能力下才变得有意义。
(2)人类mocap数据集用于产生自然行走和跑步步态。这是使用人形机器人的一个巨大优势——你可以模仿原本为电影或3A游戏捕捉的大量人类运动。至少有三种方式使用这些数据:
- 用于初始化:预训练神经网络模仿人类,然后开启物理约束微调成机器人形态;
- 用于奖励函数:惩罚任何与目标姿态的偏差;
- 用于表示学习:将人类姿态视为“运动先验”来约束机器人行为空间。
(3)将上述内容放入Isaac sim,添加大量随机化,通过PPO运行,投入一堆GPU,然后看Netflix直到损失收敛。
如果你忍不住评论这是CGI,让我省去你几次按键——许多学术实验室现在拥有实体G1机器人。
查看我们团队的HOVER工作在线程中:🧵