论文

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

随着自动驾驶能力提升,长尾场景下驾驶策略的安全评估仍是关键瓶颈。在闭环仿真中,策略模型与环境主动交互,其动作动态更新仿真器状态并直接影响下一帧传感器观测生成。尽管近期基于重建的神经模拟器实现了照片级真实感,但它们受限于初始捕捉数据,难以泛化到高度动态或新颖场景。 为克服这些局限,我们提出 OmniDreams,一个基于 Cosmos 扩散模型进行中期和后训练的基础生成式世界模型,可实时自回归生成动作条件视频。利用 Cosmos 的丰富视觉先验,并在 21k 小时驾驶场景上进行中期和后训练,OmniDreams 能合成传统模拟器难以捕捉的复杂未观察现象,如极端天气和不可预测的动态智能体行为。其核心在于,它基于过去帧、当前仿真器状态和即时驾驶动作,自回归地条件化生成照片级真实传感器输出。 部署在包含 Alpamayo 1 策略模型和 AlpaSim 协调器的闭环系统中,OmniDreams 充当高度响应且反应灵敏的环境,为训练和评估下一代自动驾驶策略提供可扩展的综合性解决方案。初步结果表明,从 OmniDreams 后训练得到的 世界动作模型 (WAM) 在 Physical AI Autonomous Vehicles NuRec 数据集上表现强劲,超越基于 VLA 的 Alpamayo 1.5 研究策略模型,而参数量仅为后者的 1/5。这些结果凸显了像 OmniDreams 这样的实时世界模型同时作为策略架构骨干的潜力。

论文精读

TL;DR OmniDreams 是一个实时生成式世界模型,基于 Cosmos 扩散模型进行中后训练,能自回归生成动作条件的驾驶场景视频,在闭环仿真中应对极端天气、动态行为等长尾未见场景,支持自动驾驶策略安全评估与训练。

问题

问题背景

自动驾驶策略的安全验证高度依赖闭环仿真:策略模型输出控制动作,仿真器据此动态更新环境状态并生成下一帧传感器观测。随着能力提升,策略需要在罕见但危险的长尾场景中充分测试,这对仿真器提出了高动态、高真实感、高泛化性的严苛要求。

现有方法局限

当前主流的神经仿真器大多基于场景重建(例如 NeRF 或 3DGS 的衍生方案),它们从采集数据中学习渲染函数,能生成照片级真实感的图像。然而,这类方法存在两个关键瓶颈:

  1. 泛化边界硬:渲染能力严格受限于训练数据的覆盖范围,面对极端天气、突发性动态 agent 行为或全新道路拓扑时,视角合成会失效或产生明显伪影。
  2. 实时交互难以保证:高保真的神经渲染通常计算开销大,难以在闭环中与策略模型同步推演(要求 >= 30 fps),迫使实际部署时退化到传统图形引擎,牺牲真实感。 此外,传统图形学仿真器虽然可控,但资产制作耗时且传感器数据与真实世界的域差距显著。

为什么这个问题难且重要

闭环仿真的核心难点在于自回归生成的光真实感与实时性之间的矛盾。生成式模型需要根据历史帧、当前状态和动作连续地预测未来观测,误差会沿时间步累计,容易导致视觉崩溃。同时,长尾场景本身稀有,依赖重建的方法无法碰触这些分布外区域。业界将可扩展、高逼真度的仿真视为实现 L4+ 规模化验证的关键基础设施,也是世界模型研究的核心驱动。

行业类比

这类似于 视频扩散模型(如 Sora)从生成预定义镜头走向交互式世界模拟——需要模型在实时约束下,像物理引擎一样对“what-if”动作做出即时、写实的视觉回应,而非仅生成一个离线视频片段。

核心洞察

  • **利用扩散模型先验实现实时闭环仿真**:OmniDreams 以 Cosmos 扩散模型为基础,通过 21k 小时驾驶数据中后训练,实时自回归生成动作条件视频,突破传统重建式神经模拟器对未见场景与动态行为的泛化瓶颈。相比只能回放固定轨迹或难以处理极端天气的基线,它作为闭环仿真环境,能生成高度交互、真实感的传感器数据,为长尾场景的策略评估提供可扩展方案,且满足实时性要求。
  • **世界模型内蕴策略表征的迁移价值**:从 OmniDreams 后训练的世界动作模型 (WAM) 在 NuRec 数据集上以仅 1/5 的参数规模超越 VLA 架构的 Alpamayo 1.5 策略模型,显示实时世界模型不仅可用于模拟,其内部编码的动态预测能力可直接作为轻量高效策略模型的骨干,统一感知、预测与规划。这为自动驾驶策略架构设计提供了融合生成式世界模型的另一路径。

方法

OmniDreams 以 Cosmos 扩散模型 为基础,通过两阶段训练构建实时生成式世界模型,用于闭环自动驾驶仿真。

输入与条件化
模型自回归生成动作条件视频,每步输入包括:

  • 历史帧序列(过去若干帧的传感器观测)
  • 当前模拟器状态(如自车位姿、交通参与者状态)
  • 即时驾驶动作(转向、油门、刹车等)
    条件信号通过交叉注意力或加法嵌入注入扩散网络,使生成内容严格对齐控制输入。

关键模块与训练流程

  1. Mid‑training: 在大规模驾驶数据(21k 小时)上继续预训练 Cosmos 扩散模型,注入驾驶场景先验,使模型理解天气、光照、动态智能体行为等复杂视觉分布。
  2. Post‑training: 针对闭环仿真需求进行微调,强调时间一致性与动作敏感性;可能引入蒸馏或高效采样策略,将多步扩散过程压缩至少数采样步,实现实时推理
  3. 自回归滚动: 推理时,模型根据上一个生成帧、最新状态和动作预测下一帧,形成闭环反馈;通过滑动窗口维护历史,保持长程连贯性。

输出与部署
输出为逼真的传感器视频流,直接替代传统物理渲染器,与 Alpamayo 1 策略模型AlpaSim 编排器 联用,构建完全闭环的仿真环境。策略模型基于当前观测发出动作,OmniDreams 即时更新场景,形成高度互动的测试回路。

与世界动作模型(WAM)的关联
在 OmniDreams 基础上再做 post‑training 得到 WAM,它直接从视频观测预测驾驶动作,在 Physical AI Autonomous Vehicles NuRec 数据集 上超越参数规模为其 5 倍的 VLA 模型 Alpamayo 1.5,表明世界模型可作为高效策略骨干。

与同类方法的差异
传统重建式神经模拟器受限于采集数据,难以泛化到训练时未见过的极端天气或异常交通行为;OmniDreams 利用扩散先验的生成能力,可合成真实数据中未出现的“长尾”场景,且通过自回归条件实现真正的闭环交互,而非单向开环重放。

实验

实验设计

Cosmos 扩散模型 作为基座,在 21k 小时驾驶场景视频上做后训练,得到 OmniDreams 生成式世界模型。该模型以自回归方式,基于过去帧、仿真状态与当前动作,生成下一帧的光照真实感传感器观测。将其接入闭环系统,与策略模型 Alpamayo 1 及编排器 AlpaSim 协同,实时推演驾驶场景。还单独微调出 世界-动作模型 (WAM),在 NuRec 数据集 上做动作预测基准测试。

关键发现

  • 实时响应与视觉质量:OmniDreams 能以自回归方式实时生成高保真视频,捕捉极端天气、动态智能体行为等传统神经模拟器难以合成的现象。
  • 泛化能力:不同于重建式神经模拟器受限于初始记录数据,OmniDreams 展现出对未见过场景的强泛化性。
  • 策略模型潜力:从 OmniDreams 衍生的 WAM 在 NuRec 上超越 VLA 架构的 Alpamayo 1.5 研究模型,而总参数仅为其五分之一。

与基线的对比解读

传统重建式神经模拟器(如某些 NeRF-based 方法)高度依赖采集轨迹,难以处理大幅度视角变化或动态交互。OmniDreams 基于扩散先验,学习驾驶场景的普遍动态,在闭环测试中能生成连贯、与环境反馈一致的长序列。WAM 的强表现表明,世界模型本身可承载策略推理,且参数效率远优于独立 VLA 模型,为端到端自动驾驶架构的简化提供了实证支持。同时,实时性保证了其在工程验证和大规模训练中的可用性。

行业影响

落地场景

OmniDreams 作为实时动作条件生成世界模型,直接切入自动驾驶仿真与验证的瓶颈环节。它可替代传统仿真器中的图形渲染管线,生成逼真的传感器数据(摄像头视频),尤其是极端天气、动态代理反常行为等长尾场景。产品形态上,它既可作为闭环仿真平台的神经渲染后端,也能作为离线合成数据生成器,为感知、规划、预测模块提供多样化训练样本。此外,其世界-动作模型变体(WAM )可演化为轻量化策略 backbone,用于端到端驾驶模型部署。

商业价值

对自动驾驶企业而言,OmniDreams 能显著降低实车路采与物理测试的高昂成本,将大量 corner case 测试迁移至 GPU 集群,测试里程可无限扩展,加速开发迭代。合成数据的逼真度与多样性提升感知模型的泛化能力,减少真实数据标注依赖,直接压缩数据成本。在安全验证维度,它提供高保真、可交互的对手车辆与行人行为,提升策略模型在复杂场景下的安全性评估信度,降低因未覆盖场景导致的事故风险。对于 Tier-1 供应商或仿真软件厂商,它可作为差异化模块嵌入现有工具链,形成新的增收点。

与现有产品/工作流的接口

OmniDreams 需要与策略模型(如 Alpamayo 1)和场景编排器(如 AlpaSim)协同工作。集成路径分两种:

  • 闭环仿真回路:世界模型接收策略输出的控制指令(转向、加速、刹车),结合前序帧与场景状态,自回归生成下一帧传感器数据,反馈给策略模型,形成交互式训练/评估环路。注入现有仿真器(如 NVIDIA DRIVE SimCARLA)时,可用 Omniverse 的 API 桥接,将生成视频流替换传统渲染画面,并同步底盘真值。
  • 离线数据管线:利用文本提示或场景描述批量生成多视角视频,转换成感知/预测任务的标准数据集格式(如 nuScenes 扩展),直接接入训练流水线。

具体落地 use case

  1. 一家自动驾驶 Startup 在开发城市 NOA 功能时,针对夜间暴雨、道路积水反射等稀缺场景,用 OmniDreams 生成 10 万组时序视频片段,覆盖策略模型训练中的 rare event,将感知检测的 mAP 在雨天类别上提升 8%,节省了 3 个月的路采与标注成本。
  2. 某仿真软件供应商将 OmniDreams 作为云端神经渲染服务集成进其 SaaS 平台,客户通过 Web 界面配置场景参数(天气、交通流密度、代理攻击性),实时获得逼真的多视角视频流进行闭环测试,无需本地高端 GPU,按 token 或帧数收费,开辟了新的 ARR 收入模型。

局限

  • **训练数据依赖与场景覆盖偏差**:OmniDreams 基于 Cosmos 扩散模型,使用 21k 小时驾驶数据进行中后期训练,可能继承预训练数据中的分布偏差。尽管能合成极端天气和动态代理行为,但生成内容的真实性可能受限于训练数据的多样性,对于未见过的极端长尾场景(如罕见事故组合)仍可能出现模式坍塌或物理不合理性,需要额外的离群值检测机制来保证仿真有效性。
  • **实时闭环部署的计算瓶颈**:论文强调实时动作条件视频生成,但未详细给出推理延迟与所需计算资源指标。在高动态驾驶策略交互中,每一帧都需要及时生成,这对 GPU 等硬件要求极高。若部署在边缘端或大规模并行评估中,推理成本可能成为瓶颈,限制其在实时训练循环中的可扩展性。
  • **世界模型作为策略骨干的泛化性待验证**:虽然初步结果表明基于 OmniDreams 的世界行动模型在 NuRec 数据集上的性能超过 Alpamayo 1.5,且仅使用其五分之一参数量,但这一比较仅基于特定基准,尚未验证在复杂城市道路决策、多智能体交互等任务上的鲁棒性。世界模型内嵌的生成误差可能累积并影响策略优化,需更系统的消融实验和 long-horizon 评估。
论文NVIDIA2026-06-02原文

相关内容