论文

Fast LeWorldModel

Fast LeWorldModel

联合嵌入预测架构(JEPAs),包括最近的 LeWorldModel(LeWM),已成为无重建视觉世界模型的有前景基础。然而,在视觉规划中,LeWM 通过反复应用局部单步潜在转移模型来评估候选动作序列。这种自回归展开使得规划计算昂贵,并且随着规划视界增长,预测轨迹会累积潜在误差。 我们提出 Fast LeWorldModel(Fast-LeWM),一种快速潜在世界模型,用动作前缀预测替代重复的局部展开。给定当前潜在状态和候选动作序列,Fast-LeWM 编码其前缀并并行预测执行这些前缀后到达的未来潜在状态。通过将动作前缀作为基本预测单元,Fast-LeWM 直接建模不同视界下累积的不同程度动作效应。这种前缀级监督迫使模型学习状态如何在不同动作前缀下持续演化,而不仅仅是拟合单步状态转换。在规划期间,预测器可以使用编码动作序列中的最后一个前缀令牌来评估对应的未来潜在状态,无需显式遍历每个中间想象状态。 在多个任务上,Fast-LeWM 在提高 LeWM 平均成功率的同时,大幅减少了规划时间,实现了更低的 开环潜在损失,且其增长随着展开视界增加而显著变慢。

论文精读

TL;DR Fast-LeWM 将逐步自回归 rollout 替换为并行动作前缀预测,直接建模动作的累积效应,在长程规划中显著降低计算成本与潜伏误差增长。

问题

视觉世界模型正从重建式向重建无关的联合嵌入预测架构(JEPA) 演进,LeWorldModel (LeWM) 等系统已展示出基于潜在表示的奖励无关目标条件规划能力。然而,自回归式 rollout 成为了效率瓶颈:每次评估候选动作序列时,LeWM 需反复调用一个局部单步隐状态转移模型,序列中每步都依赖前一步的预测结果。这种串行计算不仅导致规划耗时急剧增加,更关键的是,随着规划时域增长,累积隐空间误差 会持续放大,使长时域任务的成功率显著下降。

该问题的技术难点在于:既要保证世界模型的单步预测精度,又要兼顾多步预测的全局一致性。自回归范式天然将多步预测解耦为单步转移的组合,虽然训练简单,但无法显式建模动作在不同时延下的累积效应,导致开环预测误差快速增大。业界对高效精准的视觉规划需求强烈——无论是机器人操作还是自动驾驶仿真,世界模型的推理速度与长时域可靠性直接决定了是否存在“仿真-现实”鸿沟和决策安全性。

一个可类比的场景是 NLP 中自回归解码与并行预测的权衡:早期机器翻译采用逐词生成,而非自回归模型通过一次输出整个序列大幅提升推理速度,尽管需要更精细的训练目标(如长度预测、迭代精修)。Fast-LeWM 的动作前缀并行预测正类似这一思路,用前缀级监督引导模型学习不同时间尺度的状态演变,从而在规划时避免逐步展开。

核心洞察

  • Action-prefix prediction 将动作序列的累积效应建模为核心预测单元,替代传统 world model 中单步自回归循环。LeWM 等模型依赖一个 local one-step latent transition model 重复展开,每一步只预测下一个隐状态,导致预测耗时随规划长度线性增长,且单步误差沿时间轴累积。Fast-LeWM 直接把动作序列编码为前缀令牌,输入并行的 latent predictor 一次性得到多个未来隐状态。这种设计使得模型能够直接学习不同时间跨度的状态演化,而非仅拟合相邻状态的一步映射,从根本上改变了 latent world model 的推理范式。
  • Prefix-level dense supervision 显著抑制了长期开环预测的误差增长。LeWM 仅按单步转移进行监督,误差在自回归过程中逐步放大,长范围规划时隐状态偏离严重。Fast-LeWM 对每个动作前缀均施加预测监督,迫使模型理解连续动态下状态的累积变化规律。实验表明,随着 rollout horizon 增加,Fast-LeWM 的 open-loop latent loss 增长明显更慢,这意味着模型学到的潜在空间在长时间跨度的预测中更稳定。这一特性使得在相同隐状态空间中进行的规划更可靠,直接支撑了后续更高成功率且更快速的 visual planning。

方法

方法核心:从自回归潜状态演进到并行前缀预测

Fast LeWorldModel (Fast-LeWM) 将传统潜世界模型中的串行自治回归过程重构为动作前缀并行预测,其工作流程如下:

  1. 输入:当前时刻的潜在状态编码 z_t,以及一条候选动作序列 a_{0:T-1}
  2. 动作前缀编码器 (Action-Prefix Encoder):将动作序列 a_{0:T-1} 转换为一组前缀表征 p_k, k=1..T,每个 p_k 编码了从起始到第 k 步的动作累积信息,而非单步动作。
  3. 并行潜状态预测器 (Parallel Latent Predictor):接收 z_t 与所有 p_k,一次性并行输出各时间步对应的未来潜在状态 z_{t+k}。这一过程无需像 LeWM 那样反复应用单步转移模型进行串行展开。
  4. 训练目标:采用密集前缀预测损失 (Dense Prefix Prediction Objective)。模型在所有前缀长度上同时监督,迫使它学习不同时间跨度下状态的连续演化规律,而不仅仅是拟合相邻时刻的转移。这抑制了潜空间中误差随推演步长而快速累积的现象。
  5. 规划阶段:对于每条候选动作序列,只需提取其最后一个前缀token对应的预测 z_{t+T},即可评估目标可达性。此外,通过自一致性 (Self-Consistency) 机制——例如对同一策略多次随机前向采样并取平均投票——进一步提升了规划稳健性。

关键差异:相较于 LeWM 的局部单步转移+自回归展开,Fast-LeWM 将预测基本单元从“下一步”提升为“任意长度前缀”,从而实现了并行计算、降低计算开销,并有效减缓了长推演误差增长。这种设计将“短期动态拟合”转变为“累积效应建模”,在保持重建自由特性的同时大幅提升了规划效率。

代码实现见 Fast-LeWM 仓库

实验

实验设计

论文在多个视觉规划任务(具体环境未在摘录中列出)上对比 Fast-LeWMLeWM,统一采用 reward‑free 的目标条件规划协议。模型架构基于 JEPA,核心差异在于潜空间转移预测模块:LeWM 使用单步潜状态转移模型进行自回归 rollout,Fast‑LeWM 则通过 动作前缀编码器并行潜状态预测器,将候选动作序列的前缀作为基本预测单元。评估指标包括:(1) 平均规划成功率;(2) 单次规划耗时;(3) 开环潜状态预测损失随 rollout 步长的变化;(4) 物理状态探测精度(probe);(5) 多项消融实验验证关键设计。

关键发现

  • 成功率与效率同步提升:Fast‑LeWM 在所有任务上平均成功率超越 LeWM,同时显著缩短规划时间,得益于并行预测免去逐步 rollout 的计算开销。
  • 开环潜在损失更低且增长平缓:随着规划 horizon 增加,Fast‑LeWM 的潜在状态累积误差较 LeWM 明显更慢,显示前缀级监督迫使模型学习连续状态演化,而非仅拟合单步转移。
  • 物理状态探测精度 表明该潜空间保留了可解释的物理量,验证了世界模型的表征质量。
  • 消融实验证实动作前缀编码与密集前缀预测目标均为性能提升的关键因子。

与基线的深度对比

LeWM 的自回归 rollout 带来两个根本缺陷:每一步推理都依赖前一步的潜在预测,形成 误差累积(累积误差随 horizon 线性放大);同时,计算代价与规划步数成正比,在长序列中极不经济。Fast‑LeWM 将粒度提升为 动作前缀,单次前向传播即可生成未来多步的潜状态,直接输出不同前缀对应的累积效应。这不仅是工程加速,更通过前缀级监督重构了训练目标——模型必须理解连续的动作影响,而非仅记忆局部转移。因此,Fast‑LeWM 的潜状态预测在长 horizon 下仍保持低偏移,同时并行能力大幅降低延迟,为实时视觉规划提供了可行路径。

行业影响

落地场景

Fast-LeWorldModel (Fast-LeWM) 可直接用于需要实时视觉规划的 AI 系统:

  • 自动驾驶与移动机器人 – 从相机输入快速评估多条候选轨迹,支持长程决策,避免自回归展开带来的延迟和误差累积。
  • 仓储与物流机器人 – 在动态环境中快速规划取放路径,缩短每步决策时间,提高任务吞吐量。
  • 无人机与 AR/VR – 要求低延迟的未来状态预测,以保持交互流畅性和安全性。
  • 游戏 AI 与仿真 – 用并行前缀预测替代逐步展开,加速 NPC 行为规划或物理仿真中的未来状态查询。

商业价值

  • 降本:规划阶段的计算量大幅减少,可使算力资源复用或让模型部署在更低成本的边缘硬件上。
  • 增收/体验提升:规划延迟降低(论文指出 Fast-LeWM 在保持成功率提升的同时显著缩短规划时间),直接转换为更流畅的用户交互或更高的机器人作业效率;开放环潜在误差增长更慢,意味着更可靠的长程预测,降低因模型累积错误导致的失败重试成本。
  • 安全性增益:在对安全敏感的决策(如自动驾驶紧急避障)中,快速且更准确的长程预测能更早筛选出危险动作序列,提升整体系统安全裕度。

与现有产品/工作流的接口

Fast-LeWM 可作为即插即用的加速模块嵌入已有的基于模型的强化学习或规划流水线:

  • 在现有 JEPA 类世界模型(如 LeWM、Dreamer 系列)中,直接用 Action-Prefix Encoder + Parallel Latent Predictor 替换单步潜过渡模型,保持与原有策略、价值网络的接口不变。
  • 适应现有 MLOps:训练时额外引入密集前缀预测目标,但仅需修改损失函数;推理时单次前向即可评估动作序列,无需调整部署环境。
  • 与常见机器人中间件(如 ROS)或自动驾驶规划栈(如贝塞尔曲线生成 + 碰撞检测)配合,只需将视觉编码后的隐状态和候选动作前缀传入预测器,即可输出未来隐状态用于代价评估。

具体落地用例

  1. 电商仓储机器人臂视规划 – 视觉世界模型基于相机画面预测 “拿取”“放置” 动作的结果。Fast-LeWM 对多个抓取姿态候选进行并行评估,将规划延迟从秒级压缩至毫秒级,使机械臂能实时适应货物位置变动。
  2. 无人配送车十字路口决策 – 需要在极短时间内评估多条未来行驶路径(直行、左转、右转、停车)。Fast-LeWM 编码动作前缀(如 [直行 2s, 左转 1s])并一次性预测所有对应未来隐状态,替代逐步推演,保证在算力受限的嵌入式计算盒上实现安全、及时的轨迹选择。

局限

  • - **动作前缀依赖固定结构**:Fast-LeWM 将候选动作序列编码为固定长度前缀,要求规划时动作序列长度与训练时的前缀数一致,这限制了规划 horizon 的灵活性。若需评估变长动作序列,可能需要 padding 或截断,可能引入分布外问题,且无法自然处理可变步数规划。该方法假设前缀 token 数量与最大规划步数绑定,对于需要动态调整规划深度的任务不够友好,可能需要额外机制支持。
  • - **训练开销与可扩展性**:论文提出的密集前缀预测目标要求模型对每个动作前缀计算并监督未来潜在表示,训练时的计算复杂度随前缀数量线性增长,当最大 horizon 较长时,内存和计算开销显著增加。虽然推理时并行预测加速,但训练代价可能限制其扩展到极长规划任务。此外,实验仅在 DeepMind Control 等低维动作空间环境中验证,向高维离散动作空间或更复杂的真实世界任务扩展时,动作前缀的编码效率和泛化能力尚不明确。
  • - **重建自由范式的固有局限**:Fast-LeWM 延续了 LeWM 重建自由的设计,仅预测潜在嵌入而非像素,虽然提高了效率,但在需要视觉解释、调试或人机交互的场景中,缺乏可读的预测图像。与基于重建的世界模型(如 Dreamer 系列)相比,模型内部状态的物理可解释性较弱,物理状态探测实验虽显示一定 align,但完全无像素监督可能导致长期 rollout 中潜在表示出现概念漂移,且这类漂移难以仅通过开放环潜在损失被检测。
论文Yuntian Gao2026-06-24原文

相关内容