RISE: 世界动作模型的自适应想象
世界动作模型 (World Action Models, WAMs) 通过将未来的世界演化融入动作生成来提升规划性能,但现有方法为每个场景分配固定的想象预算。我们提出 RISE(Refining Imagination through SElective Rollout),一种系统级的自适应想象框架,根据持续展开的预期规划收益,按顺序做出 Roll/Stop 决策。 在每一步中,潜在评估器 (Latent Evaluator) 估计当前前缀所揭示的风险,以及如果继续想象,规划可能改进的程度;展开门控 (Rollout Gate) 则权衡这一预期收益与额外的计算成本。由于真实驾驶日志仅暴露一种已实现的未来,我们进一步构建了 CounterDrive,一个包含多种结局和风险水平的反事实数据集,以丰富未来动态并提供局部风险监督。每个保留样本都经过专家验证,并标注轨迹有效性、事故起始点和因果类别,为安全关键的世界建模研究提供了可复用的资源。 在 NAVSIM 和 nuScenes 上的实验表明,RISE 在减少不必要展开的同时实现了最佳的整体规划性能,额外的迁移结果支持其作为插件在多种 WAM 架构中的通用性。
论文精读
TL;DR RISE 让世界动作模型按场景风险自适应决定想象步数,配合反事实数据集训练评估器,在规划性能与算力间取得最佳平衡。
问题
问题背景
世界动作模型 (World Action Models, WAMs) 在具身智能与自动驾驶规划中受到关注,核心思想是让模型在生成动作前“想象”未来世界演化,以提高决策质量。
现有方法局限
现有 WAM 方法对每个场景分配固定的 imagination budget(如固定 rollout 深度或固定推理步数)。这种静态策略存在明显缺陷:
- 简单场景(如空旷直道)可能只需要浅层想象,但固定深度造成冗余计算;
- 复杂或高风险场景(如密集交互、突发障碍)需要更深的想象,但固定预算导致 rollout 不足,规划器无法充分感知未来风险。 此外,训练数据通常只包含单一真实未来轨迹,模型难以学习丰富多样的未来演化,缺乏对反事实结果和风险等级的直接监督。
为什么这个问题难/重要
自适应决定何时继续 rollout 是一个序列决策问题:每一步都要估计继续想象的预期收益(如风险降低、规划改进)与额外计算成本。难点在于未来信息增益难以量化,且缺乏多未来 ground-truth 数据来训练可靠的评估器。在安全关键的自动驾驶场景中,推理时算力有限,如何把计算花在“刀刃上”直接影响系统实时性与安全性,因此业界对自适应推理机制的需求日益增长。
行业类比
类似 LLM 推理中的 early exit / adaptive depth 机制:根据 token 置信度动态决定是否提前退出,在保证输出质量的同时节省计算,RISE 将其思想迁移到世界模型的 rollout 控制上。
核心洞察
- 将固定想象预算转化为基于预期规划收益的自适应决策过程。RISE 在每个 rollout 步骤用 Latent Evaluator 估计继续想象可能揭示的风险,并由 Rollout Gate 权衡该风险对应的规划提升潜力与额外计算成本,做出序贯 Roll/Stop 决策。这直接跳出了现有 WAM 对所有场景分配相同 rollout 深度的范式,让计算资源集中于高不确定性、高风险的关键片段,在提升规划性能的同时避免了不必要的推理开销。
- CounterDrive 数据集填补了反事实驾驶场景的空白,为风险监督提供局部化信号。真实驾驶日志只暴露一条实际轨迹,无法监督模型对未发生但可能危险的想象。CounterDrive 生成多样反事实结果,并由专家验证轨迹有效性、事故起始点和因果类别,可为 Latent Evaluator 提供时间上局部化的风险校准,同时作为安全关键世界建模研究的可复用基准,这比简单的数据增强更具工程价值。
- RISE 的模块化设计使其成为 WAM 的即插即用插件,而非绑定特定架构。通过将风险估计(Latent Evaluator)与成本决策(Rollout Gate)解耦,RISE 能利用不同 WAM 骨干的潜在中间表示进行自适应 rollout,无需改动原有网络结构。实验在多种 WAM 架构上验证迁移性,说明该框架可被广泛集成到现有系统中,大幅降低采用门槛,对实际部署中的动态计算分配具有直接指导意义。
方法
输入与流程
RISE 输入为驾驶场景的感知特征(历史轨迹、地图上下文等),输出自适应的 rollout 深度序列 和最终规划轨迹。
关键模块
- Predictor 基于当前 latent 前缀预测未来世界状态;
- Planner 根据预测的未来状态生成候选动作;
- Latent Evaluator 估计当前前缀暴露的风险以及继续 rollout 能带来的规划增益;
- Rollout Gate 将期望增益与额外计算成本比较,做出 Roll/Stop 决策,控制 rollout 继续或停止。
训练三阶段
- Stage I:单独训练 Predictor 和初始 Planner,使用固定长度的 rollout;
- Stage II:引入 CounterDrive 反事实数据集,为 Latent Evaluator 提供局部风险监督和反事实风险排序,同时用风险引导的 latent 细化训练 Planner;
- Stage III:训练 Rollout Gate,以 cost-adjusted continuation target 为监督信号,学习在哪些场景继续 rollout 更有价值。
数据集支持
CounterDrive 通过反事实视频生成、轨迹标注和专家验证,提供多样结果与风险等级,弥补真实驾驶日志只有单一未来的不足。
与同类方法的差异
区别于固定 imagination budget 的 WAM,RISE 将 rollout 深度建模为逐场景的序列决策问题,根据期望规划收益动态分配计算。
实验
实验设计
论文在 NAVSIM 和 nuScenes 两个自动驾驶规划基准上评估 RISE,并与固定想象力预算的 WAM 方法对比。同时构建 CounterDrive 反事实数据集,用于提供多样化未来结果和局部风险监督。实验覆盖规划性能、安全关键场景评估、自适应 rollout 必要性以及跨架构迁移性。
关键发现
- RISE 达到最佳整体规划性能,同时显著减少不必要的 rollout 计算。
- 消融实验表明,Latent Evaluator 和 Rollout Gate 对性能均有贡献,且自适应 rollout 优于固定深度策略。
- 引入 CounterDrive 后,安全关键场景下的评估更全面,模型对风险的识别和响应能力提升。
- 跨架构实验显示 RISE 可作为插件式模块,提升多种 WAM 架构的规划能力。
基线对比解读
相比固定想象力预算的基线(如统一 rollout 深度),RISE 通过每步权衡预期规划收益与计算成本,实现了计算资源从简单场景向复杂高风险场景的动态转移。这一设计避免了在容易场景上的浪费,同时在需要深度推理的场景保留足够想象力,从而在保持或提升规划质量的同时降低平均 rollout 步数。CounterDrive 的引入弥补了现有驾驶日志只含单条真实未来轨迹的缺陷,为风险监督提供了更丰富的对比信号,是提升安全关键性能的关键因素。
行业影响
落地场景
RISE 面向自动驾驶 World Action Models 规划栈,适合 L2+ / L4 实时决策。在复杂路口、事故多发地等场景,系统不再固定步数展开未来轨迹,而是按需想象:风险低时提前停止,风险高时深入展开。该思路可迁移至机器人操作、无人机路径规划等依赖 rollout 评估的动作生成任务。
商业价值
- 降本:自适应 rollout 减少冗余想象步骤,直接降低车载 / 云端推理算力成本。
- 安全体验:通过 CounterDrive 反事实数据集增强罕见高风险场景覆盖,减少规划失误,提升系统可信度。
- 数据资产:专家标注数据集可作为安全评估基准,提供额外数据服务收入。
与现有产品/工作流集成
RISE 可作为插件式调度器插入现有 WAM 架构,无需重训底层预测器。集成路径:
- 将 Latent Evaluator 与 Rollout Gate 作为旁路模块加载;
- 推理时替换固定 rollouts 循环,输入当前 latent state 与 prefix;
- 根据 Gate 输出决定继续或停止。RISE 代码 提供参考实现。
具体 use case
- 自动驾驶公司:在量产车型城市 NOA 规划模块中,用 RISE 动态控制世界模型 rollout 深度,高峰时段算力压力下降,同时对 cut-in、鬼探头等场景保持高敏感。
- 机器人仿真测试:云端大规模场景仿真中,用自适应 rollout 筛选高价值场景,优先渲染危险交互,降低仿真集群 GPU 占用。
局限
- **自适应 rollout 决策的监督依赖 CounterDrive 反事实数据集**,该数据集通过视频扩散模型与 VLM 提示构造生成,其反事实轨迹的真实性与覆盖范围受生成模型能力限制。虽然专家人工验证保证了样本质量,但大规模扩展成本高,难以覆盖极端罕见场景;这可能导致 Latent Evaluator 在某些分布外状态下给出不准确的风险估计,影响 Roll/Stop 决策的鲁棒性。
- **Rollout Gate 中的计算成本权重 λ 是关键超参数**,论文虽分析了 λ 的影响,但在不同算力预算或部署场景下需要重新调参,缺少自适应调节机制。此外,RISE 在推理时额外引入 Latent Evaluator 与 Rollout Gate 的在线计算,对简单场景可能产生不必要的延迟,论文未讨论在严格实时约束下的实现优化。
- **实验主要在 NAVSIM 和 nuScenes 两个自动驾驶规划基准上开展**,均为仿真或记录数据,缺少真实车辆闭环验证。跨 WAM 架构的迁移结果显示了初步通用性,但未涉及更广泛的任务(如机器人操作、具身智能),自适应想象机制在其他控制领域的适用性尚待检验。