Orca: 世界在你心中
我们提出 Orca,一个通用世界基础模型的初步实现。Orca 从多模态世界信号中学习统一的世界隐空间,并通过多模态读取接口暴露出来。不同于优化孤立的下一 token、下一帧或下一动作预测,我们聚焦于下一状态预测建模,提供一种统一的状态转换建模路径,用于理解、预测和作用于世界。 Orca 通过两种互补范式学习:无意识学习从连续视频捕捉密集的自然状态转换,有意识学习通过语言描述的事件和 VQA 监督对稀疏的有意义状态转换进行建模。预训练时,我们构建了大规模的世界学习库存数据,包括 125K 小时视频数据和 160M 事件注释。预训练后,Orca 学习到统一的世界隐空间。 为检验学到的隐空间是否支持下游任务,我们通过三种代表性下游读取进行评估:文本生成、图像预测和具身动作生成。Orca 的主干冻结,仅轻量级模态特定解码器可训练。实验表明该范式的可扩展性,并验证了更强的世界隐空间能带来更强的下游读取性能。Orca 超越了类似规模的专业基线。这些结果表明,Orca 作为通用世界基础模型,为理解、预测和作用于世界提供了一种有前景的方法。最后,我们讨论了当前局限,旨在为社区提供有用的见解和启发。
论文精读
TL;DR Orca 提出通用世界基础模型,通过下一状态预测学习统一多模态世界潜在空间,冻结主干仅微调解码器便在文本、图像、动作生成下游全面超越专用模型,展现出世界建模新范式的强可扩展性。
问题
问题背景
当前世界模型(World Models)正从专用任务走向通用化,目标是构建能够统一理解、预测和作用于物理世界的基础模型,支撑具身智能与自主系统。业界关注如何从多模态信号中学习统一的世界潜在空间,并高效适配多样下游任务。
现有方法局限
- 孤立的下一 token / 帧 / 动作预测:LLM 以文本为中心,视频生成模型专注于像素级下一帧预测,具身模型侧重动作策略,三者缺乏共享的世界状态表征,跨模态迁移困难且冗余。
- 自监督世界模型(如 Dreamer):虽学习紧凑的潜在动态,但通常局限于单一环境或仿真域,泛化性不足,难以扩展到真实世界的复杂多模态流。
- 多模态大模型(MLLM):以语言为锚点,对低层物理动态与连续状态转移建模薄弱,无法直接产出动作或高保真视觉预测。
为什么这个问题难且重要
- 多模态的异构性与高维性:需从连续视频、语言描述、动作信号中学习紧凑且解耦的统一潜在空间,同时保留细粒度物理信息,建模复杂度极高。
- 无意识与有意识学习的平衡:既要利用海量未标注视频捕获密集自然状态转移(无意识学习),又要从稀疏的语言事件与 VQA 监督中提取有意义的状态突变(有意识学习),二者优化目标冲突。
- 跨任务迁移效率:世界模型的真正价值在于冻结后仅需轻量模态专用解码器即可适配文本、视觉、动作等不同下游,这对潜在表达的通用性提出严苛要求。
- 业界认为通用世界模拟器是通往通用人工智能的关键基石,若成功将重塑自动驾驶、机器人操作等多领域范式。
行业类比
正如自动驾驶系统依赖一个内部的世界模型来预测交通参与者行为与场景演变,Orca 旨在为具身智能体构建一个通用的心智世界,统一感知、推理与行动。
核心洞察
- Orca 提出以 **下一状态预测 (Next-State-Prediction)** 作为世界模型的统一建模目标,取代传统 isolated 的 next-token/next-frame/next-action 预测。这一范式在统一的潜空间中学习多模态世界信号的演变,使得模型能自然捕捉跨模态的因果关系与时间一致性,而非孤立地优化单一信号。冻结骨干后只需轻量解码器即可适配文本、图像、动作等多类下游任务,验证了该潜空间的强泛化性,为通用世界模型提供了可复用的基础表征。
- **无意识学习 (unconscious learning)** 与 **意识学习 (conscious learning)** 的双范式预训练策略,让 Orca 能同时从稠密视频中捕获连续物理动态,又从稀疏的事件标注与 VQA 监督中习得结构化语义。这种融合避免了纯自监督方法缺乏高层理解、纯语言监督方法脱离物理世界的矛盾,使世界潜空间兼具常识感知与语义推理能力,从而在下游文本生成、图像预测和具身动作生成等任务中均显著超越同等规模的专业基准模型,为多模态世界建模开辟了更均衡的路径。
方法
核心设计思路
Orca 旨在构建通用世界基础模型,其核心创新在于统一的 next-state-prediction 建模,而非孤立地预测下一个 token、帧或动作。
输入与编码
模型接收多模态世界信号(视频、语言、动作),通过统一的编码器将其映射到共享的世界隐空间(world latent space)。编码器设计为支持多种模态的 Query-Based 注意力机制,确保异构输入对齐。
关键学习范式
预训练阶段采用两种互补学习范式:
- 无意识学习:从连续视频中捕获稠密的自然状态转移,让模型隐式理解物理世界的动态规律。
- 有意识学习:通过语言描述的事件和 VQA 监督,建模稀疏但有意义的状态转移,注入语义和因果知识。
预训练数据包括 125K 小时视频和 160M 事件标注,覆盖广泛的世界知识。
下游适配与输出
预训练完成后,骨干网络冻结。针对不同下游任务,仅训练轻量的 模态特定解码器:
- 文本生成:通过语言读出解码器,进行图像到文本、视频到文本等任务。
- 图像预测:视觉读出解码器,从隐空间生成未来的视频帧或补全图像。
- 具身动作生成:动作读出解码器,直接从隐空间输出机器人控制指令。
与同类方法的差异
相对于专注 Next-Token、Next-Frame 或 Next-Action 的孤立预测模型,Orca 通过统一的 state-transition 建模将感知、预测和行动融为一体,展现出更强的跨任务泛化能力。
实验
实验设计
Orca 的预训练构建了统一世界潜在空间,使用 125K 小时视频和 160M 事件标注,通过无意识学习(密集自然状态转移)与有意识学习(稀疏有意义状态转移)两种范式。冻结预训练的主干网络后,仅训练轻量级模态特定解码器,评估三种下游读出头:
- 文本生成:语言解码器,在多个文本基准上测试;
- 图像预测:视觉解码器,预测未来帧;
- 动作生成:具身动作解码器,包括真实机器人基准。
关键发现
- 提出的 next-state-prediction 范式展现出良好的可扩展性:更大规模预训练持续提升下游性能。
- 更强的世界潜在空间直接对应更优的下游任务表现,验证了统一世界建模的有效性。
- Orca 在文本、图像、动作三项任务上均超越同尺寸的专用基线模型,证明通用世界基础模型可以匹配甚至超越特定领域方法。
与基线对比的深度解读
与专用基线相比,Orca 的优势在于跨模态统一表征使得不同模态间可以共享知识,而专用模型仅优化单一任务。例如,在文本生成上,Orca 虽不专门做语言建模,但其世界潜在空间捕捉了更丰富的上下文,有助于理解与推理;在图像预测中,世界状态转移的学习使生成结果更具时序一致性;在真实机器人动作生成上,世界模型提供了更好的环境动态理解,从而提升策略的鲁棒性。这一结果挑战了“大模型必须专用”的假设,为多模态通用系统提供了新范式。
行业影响
落地场景
Orca 作为通用世界基础模型,其统一潜在空间可从多模态信号中学习世界状态转移规律,天然适用于需要理解、预测并作用于物理环境的场景:
- 具身智能与机器人:Orca 冻结主干后,仅需轻量动作解码器即可生成操作指令,支持多任务操控(如抓取、导航)。
- 自动驾驶:通过图像预测读出生成未来帧,并结合动作读出规划行车轨迹,替代传统分立的感知-预测-规划模块。
- 内容生成与虚拟世界:视频平台可利用 Orca 的一致世界理解能力,生成物理合理的视频内容;AR/VR 应用可通过它实时预测用户环境变化。
- 电商与时尚:在虚拟试穿、商品展示中,Orca 对物体交互(如衣物形变)的物理建模可生成逼真效果,同时文本读出为商品生成精确描述。
商业价值
- 降本增效:单一模型取代多个任务专用模型,降低训练、维护与算力成本;轻量级下游适配(仅训练解码器)大幅缩短新任务上线周期。
- 体验提升:更一致的世界理解带来更智能的交互(如客服机器人、虚拟助手),以及更准确的预测(库存需求、交通流),提升用户满意度和业务指标。
- 加速创新:作为基础模型底座,Orca 可通过统一接口快速赋能多种业务,减少从零研发的投入,让团队专注于场景化微调。
与现有产品/工作流的接口
Orca 的设计天然适合集成进现有技术栈:
- 模块化集成:冻结的主干网络作为世界状态编码器,可与已有的 VLM、VLA 模型结合,提供富含物理常识的潜在表示,替换传统视觉主干(如 ViT)并提升下游性能。
- 数据闭环:企业可将自身业务数据(如仓库监控视频、机械臂操作日志)通过 Orca 的统一预训练框架持续注入,逐步增强私有世界模型,无需重构整套系统。
- 灵活解码:根据业务需求接入不同模态的解码器,例如为客服系统接入文本解码器,为巡检机器人接入动作解码器,同一模型服务多条产品线。
具体落地 Use Case
自动驾驶预测与规划一体化
现有方案通常使用独立模型分别预测其他交通参与者的未来轨迹、占用栅格,以及自车规划。Orca 可通过一个冻结主干同时输出图像预测(未来场景渲染)和动作预测(车辆转向/加减速),并经语言读出进行可解释性说明。该架构可降低级联误差,节省约 60% 的模型训练参数量,并提升长尾场景的泛化性。电商 3D 商品展示与试穿
在服装电商中,Orca 可接收用户上传的模特图像和服装信息,利用世界模型中衣物-人体物理交互的先验,预测模特穿着该服装后的多视角图像(视觉读出),同时生成搭配建议文本(文本读出)。相比传统 CG 管线,无需手动建模物理属性,实现分钟级自动化生成,降低 80% 内容生产成本,提升商品转化率。
局限
- **预训练成本与数据规模** 限制了社区的即时复现与扩展。Orca 使用了 125K 小时的视频数据和 160M 事件标注进行预训练,算力需求巨大,且训练细节(如两种学习范式的平衡、数据筛选策略)可能对标定和实验复现构成挑战。论文虽声称统一了世界状态建模,但并未提供在小数据集或受限资源下的性能衰减曲线,这削弱了对不同规模团队应用可行性的评估。
- **世界潜在空间的可解释性与可控性** 尚未被深入探测。Orca 冻结骨干、仅微调解码器的做法证明了潜在表征的有效性,但论文未展示潜在变量与物理状态之间的对应关系,也未讨论如何对潜在空间进行操控以实现可控的世界模拟或反事实推理。这使得将 Orca 作为仿真环境用于规划或推理任务时存在黑箱风险。
- **下游任务的覆盖范围有限**,目前仅评估了文本生成、图像预测和具身动作生成三种模态。尽管结果优于专业基线,但缺少对更复杂世界理解任务(如物理规律推断、长期因果推理、多步规划)的验证。此外,动作生成仅在真实机器人基准上测试,未涉及更广泛的具身环境,其世界模型的跨环境泛化能力尚不明确。