行业新闻

智源发布世界模型悟界·RoboBrain Orca,从预测下一词转向预测下一状态

这篇介绍智源悟界·RoboBrain Orca的文章,展示了世界学习范式从预测具体模态输出转向预测世界状态,为通用世界基础模型打下基础。

悟界·RoboBrain Orca是一种多模态表征世界模型,先通过12.5万小时视频进行无意识学习(观察世界如何自然演化),再通过1.6亿条事件标注进行有意识学习(理解有意义的任务变化),从而构建统一的世界状态表征,让AI能预测物体运动、场景变化和因果关系。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/f55ed9ac-81e9-42b6-b711-c5d0e1ca4be4/%E5%9B%BE%E7%89%871(2).png) 大语言模型学会了预测“下一个词”,于是有了会写代码、会做题、会对话的 ChatGPT、DeepSeek、Qwen。视频生成模型学会了预测“下一帧”,于是有了越来越逼真的图像和视频生成模型,例如 Seedance、Sora。具身模型学会了预测“下一个动作”,于是机器人开始能完成越来越复杂的任务。而悟界·RoboBrain Orca 的目标是做一件更底层的事:让 AI 在“脑海中”形成一个表征,该表征是对当前世界状态的高度“浓缩”,基于该表征,AI 能够建模向前和向后世界状态的演变。这就是悟界·RoboBrain Orca 作为“多模态表征世界模型”的核心哲学:The World is in Your Mind。 悟界·RoboBrain Orca:从预测“下一个具体模态输出”,走向预测“下一个世界状态” 。 悟界·RoboBrain Orca 在看到一段视频、一张图、一个指令、一段事件描述后,先在内部形成一个统一的世界潜在表征空间。这个世界潜在表征空间就像 AI 的“脑海中的世界”,它把视觉、语言、事件、任务意图等多模态的信号组织起来,学习物体如何运动、场景如何变化、动作会带来什么后果、事件之间有什么因果关系;当前状态如何走向未来状态;甚至在某些条件下,世界会不会朝另一个方向演化。悟界·RoboBrain Orca 的核心变化:从 Next Token/Next Frame/Next Action,走向 Next State Prediction。

阅读原文(jiqizhixin.com)→

行业新闻新闻资讯2026-07-07原文

相关内容