论文

Cosmos 3: 面向物理AI的全模态世界模型

Cosmos 3: 面向物理AI的全模态世界模型

我们介绍 Cosmos 3,一个全模态世界模型系列,旨在统一的混合Transformer架构中联合处理和生成语言、图像、视频、音频和动作序列。通过支持高度灵活的输入输出配置,Cosmos 3 无缝统一了物理AI的关键模态——有效将视觉语言模型、视频生成器、世界模拟器和世界动作模型纳入单一框架。 我们的评估表明,Cosmos 3 在多种理解和生成任务中树立了新的最先进水平,展示了全模态世界模型作为具身智能体可扩展的通用骨干网络。后训练Cosmos 3 模型在技术报告撰写时被 Artificial Analysis 评为最佳开源文生图和图生视频模型,被 RoboArena 评为最佳策略模型。 为加速物理AI的开放研究和部署,我们在 Linux 基金会 OpenMDW-1.1 许可下提供代码、模型检查点、精选合成数据集和评估基准。

论文精读

TL;DR Cosmos 3 是一个全模态世界模型,通过混合 Transformer 统一处理语言、图像、视频、音频与动作序列,将多种模型整合为单一框架,在理解与生成任务中全面达到新 state-of-the-art,并开源了最佳文生图、图生视频及策略模型。

问题

问题背景

物理 AI(Physical AI)领域正寻求能统一理解与生成语言、图像、视频、音频及动作序列的通用世界模型,以驱动具身智能体在复杂环境中感知、推理与行动。

现有方法局限

当前模型呈现碎片化:视觉语言模型(VLM)擅长跨模态理解但缺乏精细的时空生成能力,视频生成器虽能产生逼真画面却无法与动作控制闭环,世界模拟器动作规划器更是独立训练、接口异构。这种分立导致:

  • 多模型拼接时信息损失大,系统延迟高,难以实时交互;
  • 各模型模态覆盖不全,不能灵活组合输入输出(例如同时输入语音指令与图像,输出未来视频与动作序列);
  • 模型间缺乏共享表征,每引入一种新任务或新模态需重新设计架构和训练流程,工程冗余严重。

为什么这个问题难且重要

统一多模态理解与生成意味着模型要同时处理离散符号(语言)、连续信号(视觉、音频)和时序决策(动作),其表征空间的异质性、动态特性的跨度(从静态图像到长程视频预测)对架构设计提出极高要求。技术上需解决:

  • 跨模态信息融合与解耦,避免模态间相互干扰;
  • 高效处理混合序列长度与维度的大规模训练;
  • 保持生成与控制精度的平衡。
    从工程角度看,一旦实现,这类全模态世界模型将成为具身智能的通用骨干,大幅降低机器人、自动驾驶等系统的搭建成本与部署门槛,因此被业界看作迈向通用人工智能的关键一环。

行业类比

如同大型语言模型成为文本应用的统一后端,全模态世界模型有望成为物理 AI 领域的“单一智能引擎”,取代当前多种定制化模型的拼凑方案。

核心洞察

  • 全模态统一架构消除了多模型串行带来的累积误差与集成开销,实现感知、推理和规划的一体化。与主流做法将视觉-语言模型、视频生成器和策略模型分开训练部署不同,Cosmos 3 在单一 Mixture-of-Transformers 中联合处理文本、图像、视频、音频和动作序列,支持任意输入输出组合。这种设计将模块化管线压缩为可扩展骨干,避免了跨模型语义对齐损失,并通过联合训练强化跨模态因果关系,为具身智能体提供更简洁高效的方案。
  • 将世界模型重新定义为“理解+生成+行动”的统一体,直接输出可执行动作,架起从仿真到真实控制的桥梁。以往世界模型多作为视频生成器或状态预测器,输出仍需额外策略网络映射到动作。Cosmos 3 的世界-动作模型将动作视为与视觉、语言同等的模态,可以从多模态上下文中自回归生成动作序列,使同一模型既能模拟环境动态又能输出控制指令,为端到端机器人学习和在线决策提供最小化延迟与最大化模态一致性。

方法

输入与多模态标记化

Cosmos 3 接受高度灵活的输入组合:语言(文本)、图像视频音频 以及 动作序列。每种模态通过专用 tokenizer 映射为统一的 token 序列,例如图像采用 VAE 压缩为离散 token,音频使用声学 tokenizer,动作序列则通过连续值编码器嵌入。这种设计使模型能一次性读入异构传感器数据,无需为不同输入组合训练独立编码器。

核心架构:混合 Transformer

模型主体是一组 混合 Transformer(mixture-of-transformers),并非简单的多分支堆叠。每一层包含多个专用 Transformer 子模块(如视觉注意力模块、语言自回归模块、跨模态融合模块),并通过动态路由机制选择激活哪些子模块处理当前 token 序列。关键创新在于 全模态共享表示空间:所有模态 token 在同一嵌入空间中交互,自注意力可跨越图像块、文本词和动作时间步,从而建立细粒度的感官-行为关联。

训练与生成流程

训练采用多任务自监督策略:去噪扩散损失用于视频/图像生成,交叉熵损失用于语言建模和动作预测,对比损失对齐跨模态表示。推理时,根据输入-输出配置自动选择解码头:若要求输出视频帧,则通过视频解码器生成像素;若输出为动作序列,则直接回归连续值或采样离散动作 token。模型支持同时预测多模态输出,例如给定图像+文本指令,生成未来视频帧和对应机械臂动作。

与同类方法的差异

相比现有通用模型(如仅限图文的多模态 LLM 或单独的视频扩散模型),Cosmos 3 首次在单一框架内统一了视觉语言理解、视频生成、世界模拟和具身动作输出,并以开放权重形式提供了可直接用于物理 AI 任务的通用骨干,减少了工程中为不同任务拼接管线的不一致性。

实验

实验设计

Cosmos 3 的实验围绕全模态统一架构展开,旨在验证单一模型处理语言、图像、视频、音频和动作序列等多模态输入输出的可行性。作者将多个专用能力(视觉语言理解、视频生成、世界仿真、动作策略)整合到一个 mixture-of-transformers 框架中,通过灵活的 token 化策略和路由机制支持任意输入输出配置。评测覆盖广泛的理解与生成任务,包括视觉问答、文本到图像/视频生成、具身策略学习等。为促进开放研究,团队还构建了精选的合成数据集并开源评测基准

关键发现

  1. 单一骨干超越专用模型:Cosmos 3 在多个基准上取得 state-of-the-art 结果,证明全模态模型可以省去传统异构系统集成的复杂度。
  2. 开放评测表现:后训练版本在 Artificial Analysis 排行榜上被评为最佳开源文本到图像图像到视频模型,同时在 RoboArena 上获得最佳策略模型称号。
  3. 可扩展性:该架构能够随数据与算力增长持续提升,为具身智能体提供统一的感知与控制后端。

与基线对比的深度解读

相较于传统的视觉语言模型 (VLM)视频生成器世界仿真器世界-动作模型各自独立发展的范式,Cosmos 3 通过单一模型统一了这些功能。这一差异带来的工程收益显著:

  • 减少模块间通信开销:无需在多个专用模型间传递中间表示,降低了系统延迟和错误累积。
  • 训练与部署简化:只需维护一套权重和推理管线,大幅降低 MLops 成本。
  • 跨模态知识迁移:统一训练过程使视觉、语言与动作信号相互增强,可能提升小样本场景下的泛化能力。 实验结果表明,这种统一设计并未牺牲单任务性能,反而在部分任务上超越了针对性的专用模型,验证了通用骨干在 Physical AI 领域的可行性。

行业影响

落地场景

Cosmos 3 作为统一的多模态世界模型,可服务于需要同时理解与生成语言、视觉、音频和动作序列的物理 AI 系统。典型场景包括:

  • 具身智能机器人:直接输出动作指令的 world-action model,替代传统感知-规划-控制流水线。
  • 自动驾驶仿真:从文本或地图输入生成 corner-case 场景视频,丰富训练数据。
  • 视频内容生产:在电影、广告、游戏中根据脚本一键生成多角色交互视频与音效。
  • 工业数字孪生:生成设备故障、环境突变等稀有事件模拟,训练预测性维护模型。

商业价值

  • 降本:通过合成数据替代昂贵的物理采集与标注,尤其对机器人操作、极端驾驶场景等长尾问题。
  • 增收/体验提升:内容平台可提供个性化视频生成服务,电商商家能快速制作商品多角度展示视频,提升转化率。
  • 加速迭代:在虚拟环境中低成本试错,缩短具身智能模型的训练-验证周期。

与现有产品/工作流的接口

Cosmos 3 提供开放权重与代码,可作为 foundation model 嵌入现有技术栈:

  • 通过 Hugging FaceNVIDIA NGC 直接调用,与 PyTorch 生态无缝对接。
  • 在具身智能中,可作为 world-action model 替换传统 MPC 或 RL-based policy,接受传感器序列输入、输出未来动作,与 ROS 等中间件集成。
  • 对于视频生成场景,提供标准 REST API 接口,可快速集成到媒体编辑管线或云服务。
  • 合成数据集与评估基准可直接用于下游任务 fine-tuning,降低迁移成本。

具体落地案例

  1. 电商商品视频生成:某服装零售商使用 Cosmos 3,输入文本描述与商品图片,自动生成模特试穿走秀视频。相比传统拍摄,制作成本降低 80% 以上,更快响应季节性款式更新,显著提升线上转化率。

  2. 自动驾驶 corner-case 模拟:自动驾驶公司利用 Cosmos 3 从自然语言描述(如“雨天夜间,行人突然横穿马路”)生成逼真驾驶场景视频,用作感知系统的对抗性测试。该方式将稀有场景数据获取效率提升数倍,且覆盖更丰富的变化,减少实车路测里程依赖。

局限

  • - **多模态训练与推理的计算资源需求极高**:Cosmos 3 采用混合 Transformer 架构同时处理语言、图像、视频、音频和动作序列,导致模型参数量巨大、训练数据规模庞大,推理延迟高。对于实时性要求强的 Physical AI 应用(如机器人即时决策),当前框架可能需要在云端部署大模型,难以在边缘设备上高效运行,限制了现场部署的可行性。
  • - **物理世界模拟的保真度与长期一致性仍有不足**:尽管模型声称模拟世界,但其生成的视频和动作序列并未显式编码物理定律(如刚体动力学、流体力学),在复杂交互场景下可能出现违反常识的视觉假象或动作偏差。长期推演时的累积误差容易导致模拟“漂移”,难以支撑高精度的物理推理和机器人规划。
  • - **评估基准对具身代理的泛化性覆盖不全**:论文在多个理解和生成任务上报告 SOTA,但在具身智能领域,真实环境中的可执行性、安全性、持续学习能力等关键维度尚未被综合评估。RoboArena 等基准主要基于模拟环境,与真实世界部署之间存在现实差距,模型在物理不确定性下的鲁棒性仍待验证。
论文Aditi2026-06-01原文

相关内容