SimWAM:用于端到端自动驾驶的简单世界动作模型
世界动作模型(WAMs)通过将视频动态先验迁移到动作预测中,提升了端到端自动驾驶的性能,但现有方法在推理时需要昂贵的前向生成。我们提出 SimWAM,一种简单而有效的 WAM,它纯粹将视频生成作为训练信号。SimWAM 联合训练一个预训练的视频专家和一个轻量级动作专家,采用联合流匹配(joint flow matching)。 隔离注意力掩码(isolated attention mask)使动作预测不依赖未来帧,从而在训练后可丢弃视频分支,留下一个直接预测轨迹的自包含规划器。由于两个专家不共享参数,仅通过统一注意力接口交互,因此可以替换视频骨干网络、独立扩展动作专家,而无需修改学习目标或推理流程。此外,我们应用强化学习来优化超越轨迹模仿的组合式驾驶奖励。 我们的 SimWAM 在 NAVSIM 上达到 91.5 PDMS,超越了基于 WAM 的最先进规划器,且延迟大幅降低,并零样本迁移到 nuScenes。这些结果使 SimWAM 成为简单而稳健的基线,能够直接受益于视频生成的进展,实现高效的自动驾驶。代码和模型权重可在 https://github.com/H-EmbodVis/SimWAM/ 获取。
论文精读
TL;DR SimWAM 将视频生成仅作为训练信号,通过联合流匹配与隔离注意力机制,推理时丢弃视频分支,结合 RL 实现高效端到端规划,在 NAVSIM 上达到 91.5 PDMS。
问题
问题背景
端到端自动驾驶将传感器输入直接映射为规划轨迹,用统一网络替代传统“感知-预测-规划”流水线,减少误差传播。但当前主流模型本质仍是模仿学习 (imitation learning),仅复现专家轨迹,对交通动态、场景语义和环境交互的建模能力有限。
现有方法的局限
为了引入更丰富的环境动态先验,世界-行动模型 (World-Action Models, WAMs) 将视频生成能力注入动作预测,展示了显著的性能提升。然而,已有方法存在关键瓶颈:
- 推理时依赖未来帧生成:模型必须在推理阶段运行视频生成分支,产生高额计算开销与延迟,难以满足实时驾驶需求(例如 GAIA-1 的推理延迟远超 100ms)。
- 架构耦合导致扩展不灵活:视频与动作分支参数深度绑定,任意一方的改进都需要重新设计整体学习目标与推理管线,阻碍了模块化迭代。
- 纯模仿训练的泛化上限:仅拟合历史轨迹,缺乏对驾驶安全性、舒适性等复合目标的优化,模型在复杂场景下的决策质量受限。
问题的重要性与技术挑战
该问题的核心挑战在于:如何在保持 WAM 视频先验优势的同时,彻底消除推理阶段的视频生成依赖,并实现模块解耦,使视频生成技术仅作为训练辅助信号。这需要:
- 精心设计隔离的注意力机制,确保动作预测不泄露未来信息,保证因果性;
- 构建完全参数独立的双专家架构,让视频主干和动作规划器可通过统一接口交互,但推理时分离,便于分别缩放和替换;
- 将学习目标从单纯模仿扩展至强化学习优化复合奖励,进一步提升规划的安全边界。
业界正高度关注端到端模型的轻量化部署与性能上限突破,WAM 作为新兴范式,其推理效率与灵活性直接影响技术落地。
行业类比
这与多模态大模型通过跨模态对比学习将视觉知识迁移到语言模型,但推理时仅用语言模型解码的做法相似;同样追求“训练时充分感知,推理时轻装快行”。
核心洞察
- SimWAM 将视频生成限定为训练期辅助信号,而非推理必需品。与现有 WAM 需在推理时生成未来帧、导致高延迟不同,它通过**隔离注意力掩码**让动作预测完全独立于未来帧,训练后即可丢弃视频分支,留下一个直接输出轨迹的轻量规划器。这一设计使模型兼具视频先验迁移的优点与实时推理的效率,从根本上避免了推理时生成未来帧带来的计算开销,对端到端自动驾驶的部署极为友好。
- 模型采用**双专家结构**,视频专家与动作专家共享统一注意力接口但参数完全独立,训练后两者可随意解耦。这种设计使得视频骨干可被替换、动作专家可独立缩放,而不改变学习目标或推理管线,降低了模型迭代成本,也使 SimWAM 可随时借助视频生成领域的新进展,成为灵活且持久的基线。
- 在模仿学习基础上引入**强化学习**优化复合驾驶奖励,超越单纯轨迹模仿。SimWAM 不只复现记录轨迹,而是通过组合式奖励信号直接优化驾驶行为,缓解了模仿学习无法捕捉场景真实动态和意图的局限。这种将视频先验、轻量推理与 RL 优化融合的路径,为安全、高效的端到端自动驾驶提供了可工程化的范式。
方法
输入与整体设计
SimWAM 接收 多视图相机图像序列 作为输入,直接输出 未来自车轨迹(waypoints)。其核心思想是将视频生成仅作为训练信号使用,而非推理时的必要组件。训练时联合一个预训练的视频专家(video expert)和一个轻量化的动作专家(action expert),两者通过联合流匹配(joint flow matching)协同学习,但推理时动作专家可独立工作,视频分支被完全丢弃。
关键模块:隔离注意力掩码
为了保证视频生成不泄露未来信息给动作预测,SimWAM 引入隔离注意力掩码(isolated attention mask)。在联合 Transformer 中,动作专家的 token 只能关注历史帧的视觉 token,而视频专家的 token 可以关注所有帧(包括未来帧)。这种约束使动作专家学会从历史上下文推断规划,而不依赖未来视觉监督,从而在推理时脱离视频专家后依旧能直接预测轨迹。
联合流匹配与专家解耦
训练时,视频专家和动作专家不共享参数,仅通过一个统一的注意力接口进行交互。视频专家负责将高维视频分布的先验通过流匹配传递,动作专家则专注于将观察映射到动作。由于两个专家完全解耦,视频骨干可任意替换(如更强的视频生成模型),动作专家也可独立缩放,无需改动学习目标或推理管线。这种灵活性显著降低了后续迭代的工程成本。
强化学习微调
在模仿学习获得基础规划能力后,SimWAM 进一步采用强化学习对组合驾驶奖励进行优化,包括安全性、舒适度、交通规则遵守等指标,使规划超越简单的轨迹复现,更能处理复杂交通博弈。
输出与部署效率
最终推理仅需动作专家,模型体量小、延迟低,在 NAVSIM 上以 91.5 PDMS 超越同类 WAM 方案,并零样本迁移至 nuScenes。
与同类方法的差异: 现有 WAM 方法(如 Drive-WM)必须在推理时生成未来视频才能预测动作,计算开销大;SimWAM 首次将视频生成完全剥离为训练辅助,推理时仅用纯规划器,在性能与效率之间取得更优平衡。
实验
实验设计与设定
SimWAM 在 NAVSIM 仿真基准与 nuScenes 真实数据集上进行端到端规划评估。模型采用联合流匹配 同时训练一个预训练视频专家和一个轻量动作专家,训练时动作专家通过隔离注意力掩码 保持对当前帧的依赖,不访问未来帧;推理时完全丢弃视频分支,仅保留动作专家直接预测轨迹。此外,应用强化学习 优化组合驾驶奖励(包括安全性、舒适性等),超越单纯的轨迹模仿。
关键发现
- NAVSIM PDMS 达到 91.5,超越所有先前基于世界-动作模型(WAM)的规划器。
- 推理延迟大幅降低:去除未来视频生成,动作专家仅需少量参数,实测延迟远低于需要生成未来帧的 WAM 方法。
- 零样本迁移 到 nuScenes 验证了泛化能力,无需额外微调。
- 结构简洁性:仅将视频生成作为训练信号,提供了一个即插即用的基线,未来视频生成模型的进步可直接惠及本框架。
与基线的深度对比
与 GAIA-1、DriveDreamer 等需要推理时生成未来视频的 WAM 方法相比,SimWAM 的核心差异在于:
- 解耦训练与推理:将视频先验的转移限制在训练阶段,推理时不引入额外计算,从而在保持规划质量的同时大幅降低实时系统部署成本。
- 模块化设计:动作专家与视频专家无参数共享,仅通过注意力交互,使得视频骨干可被替换(如更强的视频模型),动作专家可独立扩展,无需改变学习目标或推理管线。
- 模仿与强化互补:在模仿学习的基础上加入 RL 微调,直接优化驾驶指标,解决了纯模仿策略难以捕捉隐式动态语义的问题。
这一设计将 WAM 从一个重推理系统转变为一个高效、可扩展的端到端规划基线,为自动驾驶社区提供了清晰的改进方向。
行业影响
落地场景
SimWAM 将端到端规划解耦为一个可丢弃的视频生成专家和一个轻量动作专家,推理时仅用动作专家输出轨迹,延迟极低。这一特性使其特别适合车规级芯片上的实时自动驾驶规划,尤其是城市 NOA、高速巡航等场景。同时,该架构可泛化至任何需从连续视觉输入直接决策的具身智能任务,如仓储机器人导航、无人机自主避障、室外配送小车等,这些场景中利用视频预测预训练可大幅提升场景理解,但推理时无需承受生成开销。
商业价值
- 降低硬件成本:去掉视频生成模块使模型可在低算力边缘设备运行,避免昂贵 GPU 依赖,直接降低单车/单机部署成本。
- 提升运营效率:91.5 PDMS 的规划精度与零样本迁移能力减少了场景适配的数据采集和标注投入;强化学习阶段的组合奖励优化可提升安全性、舒适性,减少事故率和用户投诉,间接增加商业运营收益。
- 加速上市周期:作为可复用的基线模型,SimWAM 可快速集成进现有自动驾驶或机器人产品流水线,缩短研发周期,抢占市场窗口。
与现有工作流的接口
SimWAM 的动作专家可作为一个独立规划头,直接接入已有的模块化自动驾驶堆栈。它接受来自感知模块(如目标检测、BEV 特征)的输出或端到端视觉编码特征,输出未来轨迹点,替换传统的决策规划器。由于其结构独立于视频骨干,团队可自由更换视频专家(如从预训练 Stable Video Diffusion 切换到更高效的工作),而无需修改推理管线。RL 调优阶段可与任意驾驶模拟器(如 CARLA、MetaDrive)对接,利用仿真生成大量交互数据强化优化。与现有端到端模型(UniAD、VAD)相比,SimWAM 的训练即服务思路更易于企业私有化迭代。
具体应用场景
- 某全球自动驾驶解决方案商:在开发面向乘用车的低成本辅助驾驶系统时,面临车规级 MCU/SoC 算力限制。采用 SimWAM,在云端用大规模驾驶视频联合训练视频专家和动作专家,然后将轻量动作专家(参数量 < 20 M)部署在车辆 Orin-X 或同等芯片上,实现实时(<50 ms)轨迹规划,并通过 RL 在虚拟环境中优化变道平顺性,最终将系统集成进 ADAS 量产方案。
- 一家跨国物流公司的仓储机器人团队:需要让机器人在动态仓库中安全穿梭。使用历史运动视频和专家示范路径,用 SimWAM 进行预训练,使机器人学会如何根据场景流预测未来运动,并在推理时仅用动作专家实时生成避障路径,支持多机协同,有效降低碰撞率且无需机载 GPU。
局限
- - **训练依赖视频专家质量**:SimWAM 将视频生成完全作为训练信号,因此动作专家的学习效果严重依赖视频专家对动态场景的建模能力。若视频生成质量不高或未能覆盖所有关键驾驶语义,可能直接误导动作预测。此外,预训练视频模型的选择与规模会显著影响最终性能,但论文未深入探讨不同视频骨干带来的差异,也未明确视频专家需要达到何种保真度才能保证动作分支充分收受益。
- - **零样本迁移适应性有限**:SimWAM 在 nuScenes 上的零样本迁移结果虽被提及,但缺乏详细分析。当传感器设置、数据分布或驾驶场景分布与训练集(NAVSIM)差异较大时,直接迁移可能导致性能退化,尤其是动作专家并未接触过目标域的未来帧监督信号。模型可能需要针对具体部署平台进行微调,而论文未探讨这种适配的代价与方法。
- - **强化学习部分的必要性与稳定性未充分验证**:论文引入 RL 来优化超越轨迹模仿的组合奖励,但 RL 训练本身会引入额外的超参调节和训练不稳定性。实验部分未明确消融 RL 带来的独立增益,也缺乏与纯 RL 或纯模仿学习 baselines 的充分对比,RL 是否持续贡献于性能提升、是否在所有场景下都值得额外成本,尚存疑问。