世界模型定义分歧下,朱军团队提出五级能力路线图
同一个词被四类系统混用,这篇梳理李飞飞、LeCun 与朱军的三套定义,并给出一张可逐级检验的路线图。
「世界模型」是 2026 年 AI 圈最没有共识的词之一:视频生成、实时交互、潜空间预测、机器人控制都被叫作世界模型,但能力边界差别很大。李飞飞按功能分出渲染器、模拟器、规划器;LeCun 主张在潜空间学可预测结构;清华朱军团队则从第一性原理把核心能力归纳为理解、想象、行动,并给出 L1 到 L5 的五级进化路线。
正文摘录
.jpg) 编辑|杨文 2026 年,「世界模型」是 AI 圈最没有共识的词之一。 一段能够连续生成的视频,被叫作世界模型;一个随键鼠操作实时变化的数字环境,也被叫作世界模型;在潜空间预测未来状态的系统,以及直接输出机器人动作的策略,同样使用这个名字。 这些模型都在处理世界的信息,能力边界却相去甚远。生成视频里的画面可以足够逼真,却违背真实的物理规律;机器人能够完成一次抓取,也可能只熟悉实验室里的物体、机位和动作轨迹。一个系统究竟学到了视觉相关性、物理结构,还是行动与结果之间的关系,仅靠 Demo 很难回答。 概念混乱增加了技术判断的难度 。画质、几何精度、预测能力和任务成功率被混在一起比较,不同团队看似争夺同一赛道,实际回答的可能是不同问题。 因此,世界模型研究开始回到一个基本问题:模型需要具备哪些能力,才能从生成内容走向理解并改变世界? 李飞飞和 World Labs 按功能将世界模型分为渲染器、模拟器和规划器,分别输出像素、世界状态与动作。