Looped World Models
当前世界模型面临一个基本矛盾:忠实的长程模拟需要深度计算,但深层模型部署成本高且容易产生累积误差。我们通过引入 Looped World Models (LoopWM) 来解决这一问题,这是首个用于世界建模的循环架构。 我们的方法通过一个参数共享的 transformer 块迭代地精炼潜在环境状态。相比传统方法,这实现了高达 100 倍的参数效率,并具有自适应计算能力,能够自动调整深度以匹配每个预测步骤的复杂度。 与缩放模型大小和训练数据正交,LoopWM 将迭代潜在深度确立为世界模拟的一个新缩放轴,这可能显著推动社区向前发展。
论文精读
TL;DR Looped World Models (LoopWM) 通过共享参数的 Transformer 块迭代细化潜在状态,以自适应计算深度和 100 倍参数效率,解决世界模型长程仿真中深度计算与误差累积的矛盾。
问题
问题背景
世界模型(World Models)通过学习环境的状态转移规律,已成为强化学习和具身智能中提升样本效率的核心组件。当前社区关注的焦点是:如何在保证长时域模拟精度的同时,控制推理成本与累积误差。
现有方法局限
主流世界模型(如 PlaNet、Dreamer 系列)通常采用单次前向的深度神经网络(如 CNN + RNN / Transformer)逐步预测下一状态。这类设计存在两个刚性缺陷:
- 参数效率低下:每一层专用的参数使模型体量随深度线性膨胀,部署成本高昂。
- 深度不可调节:所有预测步骤共享固定计算深度,而环境转移的复杂度是动态变化的(例如“开门”比“走过走廊”需要更多推理),固定深度导致简单场景算力浪费、复杂场景模拟不足。
- 累积误差敏感:长序列预测中,深层的单步误差会迅速放大,缺乏自我修正机制。
为什么这个问题难 / 重要
长时域模拟对计算资源极度苛刻,单纯扩大模型尺寸会加剧延迟,并无法解决累积误差问题。业界亟需一种能动态分配计算的架构:根据预测步的局部复杂度自适应选择深度,同时让参数在不同深度间复用,实现算力与精度的最优平衡。这不仅是算法优化,更关系到世界模型能否从研究原型走向大规模部署——例如在实时交互式应用(具身机器人、游戏 AI)中,延迟和吞吐量是硬约束。此外,深度可扩展性若能与模型大小、数据规模解耦,就能开辟一个全新的**“迭代深度”**缩放维度,为社区提供成本可控的模拟能力提升路径。
行业类比
这类似于视频压缩中的可变码率编码:平稳画面用低码率节省带宽,剧烈变化场景才分配高码率;LoopWM 让世界模型按需分配计算深度,复杂交互多做几步迭代,简单帧只做浅层变换。
核心洞察
- 将循环深度(iterative depth)作为世界模型的新缩放维度,与模型参数量、训练数据量完全正交。传统世界模型通过堆叠更深的静态网络来提升长程预测质量,但参数膨胀、累积误差严重。LoopWM 用参数共享的 transformer 块反复精化潜在状态,深度可在推理时自适应调整,从而在参数量极低(100× 参数效率)的前提下获得深层模拟能力,为世界模型的 scaling law 开辟了第三条道路。
- 延迟解码(Deferred Decoding)将预测误差的积累从观测空间转移到潜在空间,让模型在潜在状态上执行多步推理后才解码到观测,显著抑制了长程 rollout 中的误差爆发。与标准逐步解码相比,它通过课程学习逐步增长延迟步数,训练更稳定,且在推理时支持规划模式与监控模式切换,这对需要长程一致性模拟的 MBRL 和具身智能极具工程价值。
- 自适应计算深度使得同一模型能根据每个预测步的难度动态分配算力:简单过渡浅层即可,复杂交互或关键决策自动加深。这种按需计算特性在部署时大幅降低平均推理成本,同时保持关键步的高精度模拟。相比固定深度的世界模型或早期退出方案,LoopWM 的深度选择由熵正则化端到端学习,无需人工阈值,更贴合开放环境下的自主智能体需求。
方法
输入编码
感知观测 o_t 与动作 a_t 分别经 Observation Encoder ℰ_ϕ 和 Action Embedder 𝒜_ψ 映射到共享的隐空间,得到初始隐状态 h_t^(0) 和动作嵌入。
循环动力学核心 (Looped Dynamics Core)
这是 LoopWM 的核心,由参数共享的 Recurrent Block ℛ 构成,以迭代方式逐步精化隐状态:
- 前奏 (Prelude):将动作嵌入与当前隐状态融合,提供上下文。
- 递归块 (Recurrent Block):一个 Transformer 块,循环应用多次,每次输入上一步隐状态
h_t^(k-1),输出精化后的h_t^(k)。通过共享参数,不同深度共享知识,极大降低参数量(可达 100× 效率提升)。 - 频谱稳定性约束 (Spectral Stability Constraint):对循环块的权重施加谱范数正则,防止迭代过程发散或震荡,保证长期 rollout 的稳定性。
- 尾声 (Coda):对最终隐状态进行投影,生成供预测头使用的表示。
- 跨时间步状态传播 (Cross-Timestep State Propagation):下一时间步的初始隐状态
h_{t+1}^(0)由当前步的最终循环输出经线性变换后与新的动作嵌入结合得到,实现时间维度上的状态传递。
自适应计算与训练
- 可变深度训练:每次前向随机采样迭代次数
K,迫使网络在不同深度下都能给出合理预测。 - 世界模型损失:包含重建、奖励预测等常规项,鼓励精化后的状态准确预测未来。
- 熵正则化自适应深度:额外训练一个 深度预测器,根据每个状态对的信息量动态决定所需迭代轮数。推理时通过 自适应早退 (Adaptive Early Exit) 选择退出点,避免浪费计算。
延迟解码 (Deferred Decoding)
传统方法每个虚拟步都要解码到观测空间,计算昂贵。LoopWM 支持在隐空间内直接进行多步 rollout(“内循环”),仅在最终预测时或按需进行解码(“外循环”),并通过隐轨迹正则化保证隐空间动态的可靠性。这进一步节省解码器开销,适合长程想象。
差异点
与 Dreamer 等固定深度或浅层世界模型不同,LoopWM 将迭代隐深度作为独立可扩展轴,通过参数共享的循环 Transformer 实现自适应计算,在保持或提升预测质量的同时获得数量级的参数效率。
实验
实验设计
在两个具身交互文本环境 ScienceWorld 与 AlfWorld 上评估 LoopWM,这两个环境要求智能体根据自然语言指令执行多步动作,是对世界模型长期预测能力的严格测试。基线方法包括固定深度的标准 Transformer 世界模型。LoopWM 使用参数共享的循环 Transformer 块,并通过 variable‑depth training 与 entropy‑regularised adaptive depth 学习何时停止迭代。实验还专门设计了 deferred decoding(延迟解码)消融,以考察在 latent 空间中先行多步 rollout 再解码的效果。
关键发现
- 参数效率飞跃:通过循环块复用,LoopWM 达到 100 倍参数效率,在模型容量与固定深度基线相当时,预测质量相当或更优。
- 自适应计算:循环深度根据每一步预测的复杂度自动调整,简单状态转换仅需少量迭代,复杂因果链则自动加深,无需人工预设深度上限。
- 延迟解码缓解累积误差:在 latent 空间中推迟观测解码,允许模型聚焦于状态转移本身,显著降低长序列 rollout 的累积误差。
- 全新缩放轴:研究发现,与增大模型尺寸或训练数据正交,iterative latent depth 是提升世界模拟质量的独立有效维度。
与基线对比解读
传统固定深度世界模型在处理长程仿真时面临两难:深度不足导致预测失真,深度过大则计算成本高且更易产生复合错误。LoopWM 的循环范式打破了这一折中,它通过少量共享参数匹配甚至超越大容量固定深度模型的性能,同时将推理计算重新分配到真正需要的时刻。在 ScienceWorld 和 AlfWorld 上,LoopWM 用 1% 的参数取得了可比或更好的环境动态建模,且自适应深度使对复杂指令的 rollout 更为稳健。这一结果表明,世界模型的改进不应仅局限于扩大模型,架构层面的动态深度 是一个被低估的高效方向。
行业影响
落地场景
Looped World Models (LoopWM) 为需要长期环境模拟的应用提供了高效基础,典型场景包括:
- 自动驾驶仿真:在高保真交通流模拟中,LoopWM 可将连续预测的计算开销降低约两个数量级,支持端侧实时规划与安全性验证。
- 机器人操作与移动:在物体抓取、导航训练中,世界模型是样本高效 RL 的核心组件;LoopWM 的自适应深度可自动匹配简单动作(如直线移动)与复杂操作的计算资源,减少 GPU 浪费。
- 游戏 AI 与内容生成:开放世界游戏中 NPC 行为预测、物理交互生成,LoopWM 能以更小的模型体积实现同等级别的环境一致性。
- 企业级数字孪生:供应链、制造流程的长期推演与 what-if 分析,需要世界模型快速回滚与分支模拟,LoopWM 的参数效率优势显著。
商业价值
LoopWM 主要沿降本增效路径创造价值:
- 推理成本大幅下降:通过参数共享,同一模型可在不同预测步长动态分配计算,平均推理 FLOPs 较固定深度模型降低 10–100 倍,适合大规模部署(如云游戏、千万级用户推荐环境模拟)。
- 加速开发迭代:自适应深度训练允许使用更轻量的基础设施完成长周期建模实验,缩短从仿真到真机部署的周期,降低研发试错成本。
- 体验提升:在实时交互应用中(如 AR 辅助、对话式 AI 中对物理世界的理解),LoopWM 的早期退出机制可在低延迟下维持预测精度,避免用户可感知的卡顿。
与现有产品/工作流的接口
LoopWM 可作为即插即用的世界模型后端替换现有方案:
- 与 Dreamer、PlaNet 等强化学习框架集成:只需将原世界模型的核心动力学网络替换为
Looped Dynamics Core,同时复用已有的编码器、解码器、奖励预测头。 - 提供
adaptive-exit推理 API,支持设置延迟阈值或 FLOPs 预算,便于在不同硬件(边缘设备、云 GPU)上动态调整精度-效率平衡。 - 与现有的模型预测控制(MPC)管线结合,直接用作规划器中的环境模拟模块,利用 deferred decoding 减少单步推理的次数依赖。
具体落地用例
电商平台的动态库存与定价模拟
在百万级 SKU 场景中,世界模型需要模拟市场对价格和库存变化的响应。LoopWM 可根据商品热度自适应计算深度(爆款商品使用更深模拟,长尾商品快速跳过),在相同云成本下支持更多并行模拟实例,使价格优化频率提升 5–10 倍。机器人在非结构化环境中的操纵训练
面向物流分拣、实验室操作等任务,LoopWM 可部署在机器人边缘计算单元上,按步骤的视觉复杂度(如“抓取透明物体” vs “放置到空旷区”)动态调整推理深度,降低整体功耗,使电池续航延长的同时保持高成功率 sim-to-real 迁移。
局限
- **评估环境有限**:论文仅在 ScienceWorld 和 AlfWorld 两个文本交互式环境上验证 LoopWM,缺乏对连续控制、高维视觉输入或开源通用 benchmark(如 DMControl、Atari)的测试。虽然声称「世界模型」的通用性,但文本环境的动态相对简单,难以证明该方法在复杂物理模拟或长期决策任务中的鲁棒性。
- **自适应深度的训练开销与调参成本**:虽然推理时动态深度可以节省计算,但训练阶段需引入熵正则化来鼓励非零退出概率,并配合课程学习与 deferral horizon K 的调度。这种多阶段训练策略引入了额外超参数(如正则化系数 λ、depth budget 等),可能对敏感任务需大量调参,且未与固定深度 baseline 在同等训练预算下公平对比收敛速度。
- **循环架构的稳定性与扩展性未充分验证**:尽管提出了谱稳定性约束缓解梯度问题,但论文未提供在极长序列(>1000 步)或高随机环境下是否出现状态崩溃或信息遗忘的分析。参数共享 transformer 块虽提升效率,但其表达力瓶颈可能限制模型在需要高度异质计算的任务上的上限,且未与基于 SSM 或线性 attention 的循环世界模型(如 S4WM)对比。