智源悟界发布Orca世界模型,从预测下一词转向预测下一状态
Orca让AI先学习世界状态如何变化的多模态统一表征,再从中读出理解与行动能力。
现有AI擅长预测下一个词或帧,但不一定理解世界状态变化。智源悟界Orca先学习多模态世界表征——文本、图像、视频和动作的统一内部表示——再从此表征中输出理解、预测和行动能力。团队用12.5万小时视频、1.6亿事件标注等数据训练,让模型学会物体下落、事件推进等真实世界变化规律。
正文摘录
 新智元报道  【新智元导读】 AI 已经会生成答案,却未必理解世界。智源 Orca 尝试让模型学习真实世界状态变化,从「预测下一个词」走向「预测下一状态」,探索通用智能新路径。 今天的 AI,已经拥有了很多令人惊讶的能力:它可以回答问题、生成图像,也可以接入机器人系统完成操作任务。 但如果把这些能力拆开来看,会发现它们往往仍然围绕着某一种具体输出展开: 语言模型预测下一个词,视频模型预测下一帧,机器人模型预测下一步动作。 这些能力很强,但它们共同留下了一个更底层的问题: 模型到底是在完成任务,还是已经理解了世界状态本身如何变化? - 当一个杯子被推倒,水会不会洒出来? - 当机器人第一次抓取失败,物体是否还在原处? - 当一段做饭视频从洗菜进入切菜,模型是否知道这不是简单的画面变化,而是一个事件状态的推进? - 当一个动作发生之后,环境、物体关系和任务进度会发生什么改变? 智源研究院悟界·RoboBrain Orca Team 发布的技术报告 Orca: The World is in Your Mind,正是围绕这个问题展开。 Orca 并不是一个更会聊天的大模型,也不是一个单纯追求画面真实感的视频生成模型,更不是一个直接模仿动作轨迹的机器人策略模型。 它想探索的是一条更基础的路线: 先让模型学习世界表征,再从这个表征中读出理解、预测和行动能力。