人形机器人从人类视频学习灵巧任务,发现规模定律
我们训练了一个具有22自由度灵巧手的人形机器人,能够组装模型车、操作注射器、分拣扑克牌、折叠/卷起衬衫,所有这些主要从20000多小时的以自我为中心的人类视频中学习,无需机器人参与。
人类是这个星球上最具可扩展性的具身形态。我们发现人类视频量与动作预测损失之间存在近乎完美的对数线性规模定律(R² = 0.998),并且该损失直接预测真实机器人的成功率。
人形机器人将是最终形态,因为它们是实用的形态,且与人类的具身差距最小。称之为机器人硬件的苦涩教训:运动学相似性让我们只需将人类手指运动重定向到灵巧的机器人手部关节。无需学习嵌入,无需复杂的迁移算法。相对手腕运动+重定向的22自由度手指动作作为统一的动作空间,从预训练到机器人执行一直沿用。
我们的方案称为“EgoScale”:
- 在20000小时的人类视频上预训练GR00T N1.5,仅用4小时(!)的带有Sharpa手的机器人操作数据进行中间训练。在5项高度灵巧的任务上,相比从头训练提升54%。
- 最令人惊讶的结果:仅需*一次*遥操作演示就能学会一个从未见过的任务。我们的方案实现了极度的数据效率。
- 尽管我们在22自由度手部关节空间预训练,但策略可迁移到具有7自由度三指手的Unitree G1上。相比仅在G1数据上训练提升30%以上。
通往机器人灵巧性的可扩展路径从来不是更多机器人。一直是我们。
深入探讨见线程:
人类是这个星球上最具可扩展性的具身形态。我们发现人类视频量与动作预测损失之间存在近乎完美的对数线性规模定律(R² = 0.998),并且该损失直接预测真实机器人的成功率。
人形机器人将是最终形态,因为它们是实用的形态,且与人类的具身差距最小。称之为机器人硬件的苦涩教训:运动学相似性让我们只需将人类手指运动重定向到灵巧的机器人手部关节。无需学习嵌入,无需复杂的迁移算法。相对手腕运动+重定向的22自由度手指动作作为统一的动作空间,从预训练到机器人执行一直沿用。
我们的方案称为“EgoScale”:
- 在20000小时的人类视频上预训练GR00T N1.5,仅用4小时(!)的带有Sharpa手的机器人操作数据进行中间训练。在5项高度灵巧的任务上,相比从头训练提升54%。
- 最令人惊讶的结果:仅需*一次*遥操作演示就能学会一个从未见过的任务。我们的方案实现了极度的数据效率。
- 尽管我们在22自由度手部关节空间预训练,但策略可迁移到具有7自由度三指手的Unitree G1上。相比仅在G1数据上训练提升30%以上。
通往机器人灵巧性的可扩展路径从来不是更多机器人。一直是我们。
深入探讨见线程: