行业新闻

机器人世界模型应避开像素空间,寻找更紧致的物理语言

机器人世界模型应摒弃像素预测,转而学习紧凑物理表示,避免依赖海量动作标注数据。

像素级世界模型需要大量机器人数据来训练,但若已有足够数据,为何不直接训练策略?这陷入鸡生蛋困境。作者提出,机器人真正需要的是物体交互、接触、因果关系等高层物理语言,而非背景纹理和相机运动。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/dca11b9b-93b7-490d-961d-6c7231fb1039/0-2026-06-27T221030(2).632.jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) [![](https://image.jiqizhixin.com/uploads/editor/94378392-3cc1-4eef-8e25-a6090ab83f2f/1782569765861.png)](https://mp.weixin.qq.com/s/mh8-RFGWHoHzlnc9GmDwHg)最近具身智能很热,world model 也很热。热到什么程度呢?热到大家一说机器人要有 world model,第一反应往往就是:那我们是不是要训练一个更大的视频预测模型,让机器人在 pixel space 里面“做梦”? 这个直觉确实有道理。毕竟互联网最不缺的就是视频。人类开门、倒水、切菜、叠衣服、拧瓶盖、用工具,什么都有。如果语言模型可以从全网文本中学到知识,那机器人是不是也可以从全网视频中学到物理世界? 这个愿景很美。但我们一直有一个挥之不去的疑问: 机器人真的应该在像素里学习物理吗? 像素当然是最直接的数据形式。视频打开就是 pixels,数据量巨大,天然 scalable。但问题也在这里:pixels 太低层了。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-06-27原文

相关内容