论文

ForgeWM: 面向少步动作条件视频世界模型的渐进式因果训练

ForgeWM: 面向少步动作条件视频世界模型的渐进式因果训练

动作条件视频世界模型需要低延迟因果生成,以及对游戏原生控制的可靠响应。虽然因果蒸馏可以实现单步或少步视频合成,但将其扩展到交互式世界模型仍有挑战,因为离散键盘状态和连续鼠标运动必须在因果训练和自回归 rollout 期间与时间压缩的潜变量块保持对齐。 我们提出 ForgeWM,一个渐进式框架,通过领域自适应、教师强迫因果训练、因果一致性蒸馏,以及与双向教师进行在线策略分布匹配,将双向动作条件视频生成器转化为高效的少步世界模型。得到的预算专用学生模型在稳态去噪预算 1、2、4 步下运行。ForgeWM 还支持双路径部署协议,将延迟关键交互与可选的回放时细化相结合,其中单步学生对其保存的草稿重新加噪并细化。 在配对的 Minecraft 轨迹上,ForgeWM 在成像质量、参考对齐的运动一致性、动作信号准确性和鼠标控制准确性方面领先于评估系统,同时取得最低的参考 LPIPS;同一四阶段方案也适用于手柄控制的 FPS 游戏。回放时细化达到四步参考质量,同时比从噪声重新生成更接近实际轨迹约三倍。这些结果证明了 ForgeWM 在可控少步视频生成中的有效性。

论文精读

TL;DR ForgeWM 通过渐进因果训练把双向视频生成器蒸馏成 1/2/4 步动作条件世界模型,在保持键鼠/手柄控制对齐的同时实现低延迟交互与回放精修。

问题

动作条件视频世界模型正成为具身智能与交互式内容生成的重要基础,业界追求在低延迟下产生因果一致的视频响应,以支撑游戏、机器人仿真等实时闭环任务。

现有方法局限:因果蒸馏已可将扩散模型压缩到 1-4 步推理,但其迁移到交互世界模型时遇到两类具体障碍:一是控制信号对齐——离散键盘状态与连续鼠标运动需和压缩后的 latent chunks 在时间轴上严格对应,teacher-forced 训练中简单的空间拼接无法保证动作语义注入到正确帧;二是自回归误差累积——训练与推理不一致导致 rollout 时的分布偏移,离线蒸馏方法缺少 on-policy 校正,长程控制精度随步数下降。

为什么难/重要:实时交互要求稳态去噪预算极低(1-4 步),而动作响应语义必须可验证,这使延迟与可控性形成强耦合:压缩越多,对齐越难。该问题直接决定世界模型能否作为可交互环境模拟器用于策略学习与游戏 AI,工程上需要同时改善 teacher-forced 训练、因果一致性初始化和在线分布匹配,而现有单阶段方案难以覆盖。

行业类比:类似于自动驾驶闭环仿真 中需要把端到端视觉生成压缩到毫秒级推理,同时保证方向盘 / 踏板信号与生成画面同步。

核心洞察

  • - ForgeWM 提出因果一致性蒸馏,解决 action-conditioned few-step 世界模型中离散键盘状态/连续鼠标运动与时间压缩 latent chunks 的对齐难题。与现有因果蒸馏仅依赖 teacher forcing 不同,该方法在 teacher-forced causal training 后额外约束学生输出的因果特征与双向教师对齐,确保自回归 rollout 中控制信号不漂移,这是低延迟交互可靠性的关键。
  • - ForgeWM 采用 on-policy 分布匹配与双向教师,缓解自回归 rollout 的曝光偏差。传统蒸馏只在教师轨迹上做 teacher forcing,学生一旦进入自身生成的 latent 状态便产生分布偏移;ForgeWM 让学生分布逼近双向教师的 on-policy 输出,提升长程 rollout 稳定性,使 1/2/4 步预算学生在 Minecraft 与 FPS 场景中保持控制精度。
  • - ForgeWM 的双路径部署协议将低延迟交互与重放精化解耦:一步学生负责实时草稿生成,重放时对保存的 draft 重新加噪并精化,在保持轨迹一致性的前提下逼近四步参考质量。相比从噪声重新生成,该 draft-preserving 路径更接近实际 experienced trajectory,且避免为不同阶段分别维护多个预算模型。

方法

输入与任务定义

ForgeWM 以 双向动作条件视频生成器 为起点,输入包含离散键盘状态 和 连续鼠标运动 的游戏原生控制信号,以及历史帧的潜变量块。目标是训练出支持少步去噪 的因果世界模型,能在自回归 rollout 中保持动作与潜变量块的时间对齐。

四阶段渐进训练

  1. 域适应:在目标游戏数据上微调双向教师模型,使其适应交互式视频分布。
  2. 教师强制因果训练:将双向教师转换为因果学生初始化,使用教师强制方式在时间上对齐动作和潜变量块。
  3. 因果一致性蒸馏:通过一致性损失让学生少步去噪输出逼近教师多步去噪结果,同时保持因果性。
  4. 在策略分布匹配:使用双向教师作为评判,通过对抗或分布匹配损失让学生在自己生成的轨迹上进一步对齐真实数据分布。

最终输出预算专用学生模型,支持 1、2、4 步稳态去噪。

双路径部署

低延迟交互路径使用 1 步学生快速生成草稿帧;可选回放时细化路径则将草稿重加噪并迭代细化,在保持轨迹一致性的同时提升质量。

与同类因果蒸馏方法相比,ForgeWM 的关键差异在于显式分离因果一致性蒸馏 与 在策略分布匹配,并用双向教师指导在策略匹配,从而同时保证动作对齐和生成质量。

实验

实验设计

在 Minecraft 键盘–鼠标控制与 FPS 游戏手柄控制两个域上进行评估,使用配对的轨迹数据。评估指标包括 成像质量、参考对齐的运动轮廓一致性、动作信号准确度、鼠标控制准确度 以及 参考 LPIPS。同时进行了人类偏好研究,并对比了多个评估系统。

关键发现

ForgeWM 在所列指标上均领先于评估系统,并取得了最低的 参考 LPIPS。在低延迟交互与可选的重放时细化双路径部署中,一步学生通过重加噪并细化保存的草稿,实现与四步参考质量匹配,同时保持比从噪声重新生成更接近原始轨迹约三倍。

与基线对比解读

通过渐进式因果训练(域适应、教师强制因果训练、因果一致性蒸馏、在线策略分布匹配),ForgeWM 解决了离散键盘状态与连续鼠标运动在时间压缩潜在块中的对齐难题,从而在极少步数下实现高保真且控制精准的视频生成。与直接从双向教师蒸馏的方法相比,因果一致性和在线策略匹配减少了自回归 rollout 中的误差累积,使得低步数学生能够在交互场景中保持稳定。

行业影响

落地场景

ForgeWM 将双向动作条件视频生成器蒸馏为 1/2/4 步因果世界模型,核心价值是把高成本视频扩散模型转化为实时交互引擎。主要落地场景:

  • 游戏开发与云游戏:为 Minecraft、FPS 等游戏提供实时画面预测,实现低延迟云渲染,降低终端 GPU 需求。
  • 具身智能与自动驾驶仿真:用动作条件视频生成替代部分物理仿真,快速生成驾驶策略训练数据,尤其适合需要视觉反馈的端到端模型。
  • 虚拟人 / 数字孪生:在交互式直播、虚拟客服中,根据用户操作实时生成场景视频响应。

商业价值

  • 降本:推理步数从数十步降至 1 步,GPU 成本与延迟大幅下降,使云端实时视频生成具备经济性。
  • 增收:提升云游戏体验流畅度,减少用户流失;加速游戏内容迭代,缩短开发周期。
  • 体验提升:因果生成保证动作与画面时序对齐,支持鼠标/键盘/手柄等原生控制,提升沉浸感。

具体案例:某电商平台的虚拟试衣间,用户通过鼠标拖动旋转衣物,ForgeWM 可根据连续鼠标动作实时生成多角度视频,替代预渲染,降低内容生产成本 90% 以上,并支持个性化交互。

与现有工作流的接口

ForgeWM 的训练流程(领域适应 → 教师强制因果训练 → 因果一致性蒸馏 → on-policy 分布匹配)可融入现有扩散模型训练框架:

  1. 基于 DiT 或 UNet 架构的动作条件生成器可直接加载预训练权重进行 Stage 0 适应;
  2. 采用类似 SDXL-Lightning 的对抗蒸馏思路,用双向教师提供软标签;
  3. 部署时采用双路径协议:低延迟场景使用 1 步学生,高保真场景触发回放时细化(replay-time refinement),可直接集成到现有视频推理服务(如 Triton)中。

工程启示:四阶段渐进训练避免了直接一步蒸馏的分布崩溃,为其他交互式视频生成任务(如视频编辑、AI 相机)提供了可复用的因果对齐方案;与 RLHF 类似,Stage 3 的 on-policy 匹配可进一步与人类反馈结合。

局限

  • - **域泛化有限**:论文仅在 Minecraft(键盘-鼠标离散/连续混合控制)和 FPS(游戏手柄)两个游戏域上验证了 ForgeWM。虽然四阶段配方在 FPS 上成功迁移,但未涉及更广泛的动作模态(如关节扭矩、触觉反馈)或非游戏场景(如机器人操作、自动驾驶)。因此,模型在处理高维连续动作或物理交互时的表现仍是未知数,离通用世界模型尚有距离。
  • - **训练流程复杂且成本高**:ForgeWM 采用四阶段渐进训练,包括域适应、教师强制因果训练、因果一致性蒸馏和在线策略分布匹配,需要维护双向教师模型并在多个阶段间精心调度超参。这大幅增加了训练时间和显存占用,对资源受限的研究团队不够友好。论文未给出完整的训练成本分析,难以评估其在大规模数据上的可扩展性。
  • - **动作编码的时序压缩风险**:将离散键盘状态和连续鼠标运动映射到时间压缩的 latent chunks,可能在高动态场景中丢失关键的帧级动作信息。论文未深入分析长程 autoregressive rollout 中的误差累积,也未评估动作-帧对齐的长期稳定性。另外,replay-time refinement 虽然提升了质量,但引入了额外的推理延迟,如何权衡交互实时性与体验质量仍需进一步研究。
论文Xinye Li2026-08-14原文

相关内容