行业新闻

智源Orca报告:让AI先学习世界状态变化再执行任务

智源Orca报告:让AI先学习世界状态变化再执行任务

智源Orca用“世界表征预训练”取代直接任务训练,先让模型理解状态转移,再用小样本适配多种任务。

Orca先教模型理解世界如何变化,而非直接“打螺丝”——在统一世界潜空间中学习文本、图像、视频、动作背后的共同演化规律,再轻量适配下游任务。

正文摘录

别让AI一上来就“进厂打螺丝”:智源悟界·Orca要先教模型理解世界如何变化 来源:量子位 但这些能力背后,仍然有一个更底层的问题: 模型到底是在学会某一种输出,还是已经理解了世界状态本身如何变化? 智源研究院悟界·RoboBrain Orca Team 发布的技术报告 Orca: The World is in Your Mind,想探索的正是这个问题。 项目主页:https://orca-wm.github.io 技术报告:https://arxiv.org/abs/2606.30534 Orca 并不是把文本、图像、视频、动作简单拼接在一起,而是 尝试在统一的世界潜空间中,学习它们背后的共同状态与演化规律。 也有评论认为, Orca 更接近早期通用世界模型的形态,即先学习世界如何变化,再将这种世界表征读出到理解、预测和行动任务中。 与此同时,Orca 也登上了 Daily Papers 月度榜单,并在 Hugging Face、X 等社区获得持续关注。 悟界·RoboBrain Orca 并非一个更会聊天的大模型,也不是一个单纯追求视觉真实感的视频生成模型,更不是一个只面向机器人的动作策略模型。 换句话说,Orca 关注的是: 当前世界处于什么状态,以及这个状态在自然演化、事件条件或外部干预下,会如何转移到另一个状态。 “我们不会让一个 3 岁小孩进工厂,打 10 万小时螺丝。”这是 Orca Team 解释这项工作时,用过的一个比喻。 这句话不只是在说机器人,也是在说今天很多 AI 模型的共同处境:语言模型被训练去预测下一个词,视频模型被训练去生成下一帧,具身模型被训练去模仿下一步动作。 它们看起来任务不同,但底层逻辑很像——一上来就把模型放进某个具体工位,让它围绕某一种输出反复练习。

阅读原文(qbitai.com)→

行业新闻思邈2026-07-08原文

相关内容