论文

Discrete-WAM:面向世界-策略学习的统一离散视觉-动作令牌编辑

Discrete-WAM:面向世界-策略学习的统一离散视觉-动作令牌编辑

自动驾驶需要推理自车行为如何影响周围世界的演变。然而,大多数端到端方法依赖直接的状态到动作映射,仅捕捉相关性而未显式建模动作条件动力学。相反,连续潜在世界模型通常缺乏用于跨反事实未来进行因果推理的组合结构。 我们提出 Discrete-WAM,一种统一的潜在视觉-动作世界策略,将未来视觉状态和自车行为表示为对齐的离散令牌,从而支持跨替代未来的组合因果推理。基于这种统一离散对齐,Discrete-WAM 构建了一个共享的离散扩散框架,包含统一的生成任务,共同制定世界建模、世界-动作策略以及分层决策策略,支持多样驾驶场景下的组合泛化。 在大型自动驾驶基准上的实验表明,Discrete-WAM 在实现可控生成和反事实推理的同时,取得了有竞争力的性能,为更可靠的决策提供了一条原则性路径。

论文精读

TL;DR Discrete-WAM 将视觉与动作统一为离散令牌,在共享扩散框架中联合世界建模与策略学习,实现可组合的因果与反事实推理,提升自动驾驶决策可靠性。

问题

问题背景

自动驾驶系统需要显式推理自车动作如何导致周围世界状态演变,以便在安全关键场景中做出可靠决策。传统端到端方法仅学习状态到动作的直接映射,忽略了对动作条件化未来状态的建模,限制了系统对长期后果的前瞻能力。

现有方法局限

  • 端到端策略网络(如模仿学习、强化学习)直接拟合观测到控制信号的映射,缺乏对动态过程的显式建模,难以回答“若执行不同动作,未来将如何变化?”的反事实问题。
  • 连续潜在世界模型(如 Dreamer、SEM2)虽能建模未来状态,但其潜在空间缺乏组合化与离散化结构,无法便捷地进行跨场景、跨动作的因果推理,且生成可控性差。
  • 二者常独立设计,世界建模与策略学习割裂,导致知识共享低效,且难以在统一框架下优化。

技术挑战与重要性

将世界模型与策略统一到离散潜在空间面临三个核心挑战:

  1. 视觉与动作模态对齐:如何将高维视觉与低维动作映射为共享的离散 token 集合,同时保留各自模态结构。
  2. 组合式因果推理:如何在统一的离散扩散框架下,支持对“改变动作序列 → 重编辑未来状态”这一操作的显式建模,从而支持反事实推演。
  3. 泛化性与实时性平衡:自动驾驶场景多样性高,统一模型需在保持生成质量的同时满足推理延迟约束(通常 < 100ms),这对模型架构和采样调度提出极高要求。

这一问题直接关乎自动驾驶的安全决策——能否通过“想象”不同动作的未来后果来规避风险,是当前业界从感知智能迈向认知智能的关键一步。

行业类比

这类似于大语言模型中的“自回归预测 + 可控文本生成”:不仅需要预测下一个 token,更要能根据不同的上下文动作(如 prompt 干预)生成合理且多样的未来序列,从而在交互式决策中实现可靠的规划。

核心洞察

  • 将视觉状态和自车动作统一为对齐的离散 token,使世界模型具备组合因果推理能力:传统连续潜空间世界模型难以在反事实未来上进行组合式推理,而 Discrete-WAM 通过把视觉与动作离散化为共享词表的 token,让不同未来分支的因果链可以像自然语言组合那样被离散扩散过程统一建模,从而支持跨场景的泛化推理。
  • 以统一的离散扩散框架同时建模世界演化、策略先验和层级决策,实现端到端的可编辑决策链路:与分别训练世界模型和策略模型的做法不同,Discrete-WAM 在一个共享的离散扩散模型中统一了世界模型和策略学习,并通过 token 编辑和置信度调度等机制,支持可控的世界生成和反事实仿真,为可靠决策提供可解释的因果推断路径。

方法

输入与 Tokenization

Discrete-WAM 将自动驾驶的决策过程建模为统一的离散视觉-动作世界策略,输入包含当前与历史的多视角图像序列、自车动作(速度、转向等)以及可选的高层决策(如变道意图)。系统通过两个并行 Tokenization 模块将异构输入映射到共享的离散潜空间:

  • 视觉 Tokenization:利用预训练的视觉编码器(如 VQ-VAE 架构)将多帧环绕视图压缩为离散的视觉 token 序列,每个 token 对应一个可学习的码本索引,保留帧间的时空一致性。
  • 动作 Tokenization:将连续动作向量(加速度、转向角)通过分桶或矢量量化转化为离散的动作 token,并与视觉 token 在时间维度上严格对齐——即同一未来时刻的视觉状态与自车动作共享相同的离散索引位置。

核心模块:统一离散扩散框架

预训练阶段,Discrete-WAM 在一个共享 Masked Diffusion Transformer 中执行多个生成式任务,通过任务特定的注意力掩码(task-specific attention masks) 控制信息流动:

  • 世界建模:给定当前 token 序列,随机掩码未来视觉 token,模型需从上下文预测被掩码的视觉 token,学习动作条件下的场景演化规律。
  • 世界-动作策略建模:掩码未来动作 token 或视觉 token,迫使模型根据部分观测推断完整的“视觉-动作”联合分布,建立从感知到决策的因果映射。
  • 分层决策建模:引入高层决策 token(如目标车道),模型需在给定决策下生成一致的未来视觉与底层动作序列,实现可控的规划生成。

所有任务统一为离散扩散的“去掩码”过程:从纯掩码状态开始,通过迭代置信度替换(confidence-based scheduling)逐步揭开 token,推理时支持无分类器引导(classifier-free guidance)以增强生成的可控性。训练目标为加权交叉熵损失,针对不同任务和 token 类型分配不同权重,并引入辅助位置分类损失强化 token 的时空结构。

后训练策略优化

预训练完成后,Discrete-WAM 仅提取策略相关的 token 进行轻量后训练,使用强化学习风格的策略梯度或回放数据上的行为克隆微调动作预测头,而无需重新训练整个模型。这种解耦设计使世界知识与驾驶策略能够独立进化。

输出与推理

给定当前观测与可选的高层决策,模型输出未来视觉状态的离散 token 序列及对应的自车动作 token,最终通过视觉解码器和动作反量化器恢复为图像与连续控制命令。该统一表征天然支持反事实推理:固定相同的起始状态,为模型提供不同的高层决策 token,即可生成多条互斥的未来轨迹(如左转 vs. 直行),并比较各自产生的视觉后果。

与同类方法的差异:相较于连续潜世界模型(如 DreamerV3)只进行隐状态的前向想象,或端到端策略(如 UniAD)缺乏显式世界建模,Discrete-WAM 通过离散 token 对齐将视觉世界与动作策略耦合在统一的生成式框架下,利用离散扩散的组合泛化能力实现因果反事实推理,这是大多数基准方法不具备的特性。

实验

实验设计

Discrete-WAM 在多个大规模自动驾驶基准上评估,覆盖规划任务、未来视觉状态生成以及反事实推理场景。实验设置包括统一预训练阶段(同时进行世界建模、策略建模和世界-策略联合建模)以及后训练阶段(针对性优化规划策略)。对比基线涉及端到端规划器、连续隐空间世界模型及离散扩散模型,同时通过消融实验检验统一预训练、决策建模、调度策略等模块的贡献。

关键发现

模型在规划任务中取得与现有方法相竞争的结果,同时首次实现了基于离散 token 的未来视觉世界生成和反事实因果推理。统一离散对齐使得模型能够在相同潜在空间中编辑视觉与动作 token,从而支持“如果采取不同动作,世界将如何变化”的推理。这种能力对于安全关键决策至关重要。此外,层次化的决策策略和置信度替换调度机制有效提升了生成质量和推理效率。

基线对比解读

与传统端到端方法仅学习状态-动作相关性不同,Discrete-WAM 显式建模动作条件动态,提供了更强的因果结构。与连续世界模型相比,离散表征更利于符号化推理和组合泛化。实验表明,在规划精度相当的前提下,Discrete-WAM 额外提供了可解释的反事实推理能力,这是多数基线所不具备的,为可靠决策开辟了路径。

行业影响

落地场景

Discrete-WAM 将未来视觉状态与自车动作对齐为离散 token,通过统一的离散扩散模型实现 世界建模、动作策略与层级决策 的联合学习。其主要落地场景包括:

  • 自动驾驶仿真与闭环训练:模型可生成多样化、动作条件化的未来场景,替代传统规则仿真器,用于端到端模型的离线训练和反事实评估。
  • 预测与规划集成模块:在量产自动驾驶系统中,作为世界模型前置模块,输出动作条件化的占用栅格或场景语义,供下游规划器做树搜索。
  • 数据增强与边缘案例挖掘:生成真实数据分布未覆盖的危险场景,提升感知与预测模型的鲁棒性。

商业价值

  • 降低数据采集与标注成本:利用扩散模型可控生成多模态驾驶场景,减少对昂贵路测数据的依赖,尤其适用于长尾场景的覆盖。
  • 提升决策可靠性与安全性:显式建模动作-结果因果链,支持反事实推理,可提前剔除高风险动作,降低事故率,进而节约保险与赔偿支出,提升用户信任和品牌溢价。
  • 缩短开发周期:统一的 token 编辑框架将世界模型、策略和决策后训练合为一体,减少模块间接口误差,加速模型迭代。

与现有产品/工作流的接口

  • 感知-规划-控制流水线嵌入:Discrete-WAM 可直接替代现有世界模型或预测模块,输出 token 序列经解码器得到未来占用或轨迹,对接 Optimization-based 或 Learning-based 规划器。
  • 基于 token 的 API 集成:离散 token 便于与基于 Transformer 的架构(如 VADUniAD)对接,通过交叉注意力注入动作条件,实现端到端训练。
  • 数据闭环系统:可与回灌测试平台(如 CARLAnuPlan 仿真器)联动,将生成的场景 token 导入渲染引擎,重建图像/点云供感知模型验证。

具体落地用例

  1. 自动驾驶公司模型训练平台:某自动驾驶企业部署 Discrete-WAM 作为其世界仿真引擎,给定规划器输出的候选轨迹,迅速生成未来 5 秒的多模态场景 token,经由 VQ 解码器还原为多视角图像和障碍物轨迹,用于在线兜底安全校验。相比传统基于 GAN 或 NeRF 的方法,扩散过程可提供更细粒度的置信度,实现逐步去噪的可控生成,并能在单一 GPU 上批量处理数百条轨迹的反事实对比。

  2. 企业级自动驾驶数据服务:数据服务提供商使用 Discrete-WAM 生成带动作标签的合成驾驶数据,弥补特定区域或天气条件下的数据缺口。由于模型支持动作 token 与视觉 token 联合编辑,客户可指定“紧急制动”“变道”等命令,生成对应场景片段,注入现有数据湖,用于感知和预测模型的预训练,大幅降低采集车队的运营成本。

局限

  • **推理延迟较高**:Discrete-WAM 基于离散扩散模型,解码未来视觉状态需要多步去噪迭代,虽通过调度策略(如置信度替换)加速,但单步推理耗时仍显著高于单步回归或连续潜变量滚动预测。正文中提及的推理延迟分析可能暴露其在实时闭环控制中的瓶颈,尤其对于需要高频重规划的高速场景,实际部署可能受限。
  • **离散化信息损失**:将视觉状态和动作量化为有限码本的离散令牌,不可避免地丢失细粒度空间细节(如远处小目标、纹理),可能降低世界模型的长时预测精度。与连续潜变量方法(如 DreamerV3)相比,离散表示在生成高保真未来帧或罕见场景时可能出现模糊或模式坍塌,限制了反事实推理的可信度。
  • **场景泛化未充分验证**:实验基于现有大规模自动驾驶基准(如 nuPlan),但缺少在分布外条件(极端天气、非结构化道路、激进交互)下的定量评估。统一离散世界-策略框架对长尾安全攸关情形的组合因果推理能力尚未得到可靠证明,可能影响其在开放世界中的安全性论证。
论文Ziyang Yao2026-06-04原文

相关内容