智源发布世界模型悟界·RoboBrain Orca,从预测下一词转向预测下一状态
这篇介绍智源悟界·RoboBrain Orca的文章,展示了世界学习范式从预测具体模态输出转向预测世界状态,为通用世界基础模型打下基础。
悟界·RoboBrain Orca是一种多模态表征世界模型,先通过12.5万小时视频进行无意识学习(观察世界如何自然演化),再通过1.6亿条事件标注进行有意识学习(理解有意义的任务变化),从而构建统一的世界状态表征,让AI能预测物体运动、场景变化和因果关系。
正文摘录
.png) 大语言模型学会了预测“下一个词”,于是有了会写代码、会做题、会对话的 ChatGPT、DeepSeek、Qwen。视频生成模型学会了预测“下一帧”,于是有了越来越逼真的图像和视频生成模型,例如 Seedance、Sora。具身模型学会了预测“下一个动作”,于是机器人开始能完成越来越复杂的任务。而悟界·RoboBrain Orca 的目标是做一件更底层的事:让 AI 在“脑海中”形成一个表征,该表征是对当前世界状态的高度“浓缩”,基于该表征,AI 能够建模向前和向后世界状态的演变。这就是悟界·RoboBrain Orca 作为“多模态表征世界模型”的核心哲学:The World is in Your Mind。 悟界·RoboBrain Orca:从预测“下一个具体模态输出”,走向预测“下一个世界状态” 。 悟界·RoboBrain Orca 在看到一段视频、一张图、一个指令、一段事件描述后,先在内部形成一个统一的世界潜在表征空间。这个世界潜在表征空间就像 AI 的“脑海中的世界”,它把视觉、语言、事件、任务意图等多模态的信号组织起来,学习物体如何运动、场景如何变化、动作会带来什么后果、事件之间有什么因果关系;当前状态如何走向未来状态;甚至在某些条件下,世界会不会朝另一个方向演化。悟界·RoboBrain Orca 的核心变化:从 Next Token/Next Frame/Next Action,走向 Next State Prediction。