机器人体操易而家务难,揭示物理AI能力假象
我观察到机器人学中有一个微型的莫拉维克悖论:对人类来说困难的体操,对机器人来说比烹饪、清洁、组装等“不性感”的任务容易得多。这导致领域外的人产生认知失调:“所以,机器人能跑酷和跳霹雳舞,但为什么不能照顾我的狗?”相信我,我父母问这个问题的次数比你想象的多……
“机器人莫拉维克悖论”还造成一种错觉,以为物理AI的能力远比实际先进。我不是单指Unitree,这广泛适用于行业近期所有杂技演示。这里有一个简单测试:如果在侧空翻机器人面前立一堵墙,它会全速撞上去,场面惨烈。因为它只是过拟合了单个参考动作,完全没感知周围环境。
悖论存在的原因:训练“盲人体操运动员”比训练能看和操作的机器人容易得多。前者完全可以在仿真中训练并零样本迁移到现实,而后者需要极其逼真的渲染、接触物理和混乱的现实物体动力学——这些都难以仿真。
想象一下,如果LLM不是从互联网训练,而是从纯手工制作的文字控制台游戏训练。机器人研究者很幸运。我们恰好生活在一个加速物理引擎足够好的世界,可以不用任何真实数据就实现令人印象深刻的杂技。但对于通用灵巧操作,我们还没找到同样的作弊代码。
在那之前,我们仍会被困惑的父母质问。
“机器人莫拉维克悖论”还造成一种错觉,以为物理AI的能力远比实际先进。我不是单指Unitree,这广泛适用于行业近期所有杂技演示。这里有一个简单测试:如果在侧空翻机器人面前立一堵墙,它会全速撞上去,场面惨烈。因为它只是过拟合了单个参考动作,完全没感知周围环境。
悖论存在的原因:训练“盲人体操运动员”比训练能看和操作的机器人容易得多。前者完全可以在仿真中训练并零样本迁移到现实,而后者需要极其逼真的渲染、接触物理和混乱的现实物体动力学——这些都难以仿真。
想象一下,如果LLM不是从互联网训练,而是从纯手工制作的文字控制台游戏训练。机器人研究者很幸运。我们恰好生活在一个加速物理引擎足够好的世界,可以不用任何真实数据就实现令人印象深刻的杂技。但对于通用灵巧操作,我们还没找到同样的作弊代码。
在那之前,我们仍会被困惑的父母质问。