机器人世界模型应避开像素空间,寻找更紧致的物理语言
机器人世界模型应摒弃像素预测,转而学习紧凑物理表示,避免依赖海量动作标注数据。
像素级世界模型需要大量机器人数据来训练,但若已有足够数据,为何不直接训练策略?这陷入鸡生蛋困境。作者提出,机器人真正需要的是物体交互、接触、因果关系等高层物理语言,而非背景纹理和相机运动。
正文摘录
.632.jpg)  [](https://mp.weixin.qq.com/s/mh8-RFGWHoHzlnc9GmDwHg)最近具身智能很热,world model 也很热。热到什么程度呢?热到大家一说机器人要有 world model,第一反应往往就是:那我们是不是要训练一个更大的视频预测模型,让机器人在 pixel space 里面“做梦”? 这个直觉确实有道理。毕竟互联网最不缺的就是视频。人类开门、倒水、切菜、叠衣服、拧瓶盖、用工具,什么都有。如果语言模型可以从全网文本中学到知识,那机器人是不是也可以从全网视频中学到物理世界? 这个愿景很美。但我们一直有一个挥之不去的疑问: 机器人真的应该在像素里学习物理吗? 像素当然是最直接的数据形式。视频打开就是 pixels,数据量巨大,天然 scalable。但问题也在这里:pixels 太低层了。