论文

WorldCycle: 面向长视界视频世界模型的自验证强化学习

WorldCycle: 面向长视界视频世界模型的自验证强化学习

交互式视频世界模型对于长期规划与探索至关重要,但会累积复合误差。后训练方法(如强化学习)能改善此类模型,却遭遇验证瓶颈:对任意动作序列,不存在真实未来状态可用于衡量长期漂移。 关键洞察在于可逆动作周期 使验证成为可能:由正反动作复合的序列必须解析地回到初始状态,从而提供无标注的长期正确性监督。基于此,我们提出 WorldCycle — 一个自验证强化学习框架。它从普通动作序列构造闭合动作周期并与重复执行相结合,并优化两个互补奖励:空间闭合奖励(强制镜像前向与反向段之间的对称性)与 时间一致性奖励(对齐重复周期执行中的状态)。这些奖励迫使模型将动作视为一致的状态算子,而非记忆化的时间模式,并且能自然扩展到基础模型难以处理的分布外复合动作周期。 我们发布 CycleBench,一个针对复杂动作结构下状态返回能力的诊断基准。WorldCycle 将状态返回漂移最高减少 44% ,复合动作准确率较基础模型提升近 4 倍,为物理基座世界模型提供了关键基础。

论文精读

TL;DR WorldCycle 利用可逆动作循环实现自验证 RL,无需标注即可为视频世界模型提供长程一致性监督,将状态返回漂移降低 44%,复合动作准确率提升近 4 倍。

问题

问题背景

交互式视频世界模型(IWMs)将生成式视频模型拓展为可交互的模拟器,能根据初始观测和动作序列预测未来帧,是长期规划、智能体探索等任务的核心组件。然而,随着 rollout 步数增加,累积误差导致的状态漂移 严重制约了其可靠性。

现有方法局限

后训练强化学习(RL)被用于微调 IWM 以缓解漂移,但存在根本性的验证瓶颈:open-loop 条件下没有 ground-truth 未来状态,难以对任意动作序列的长期预测生成有效的奖励信号。当前方法多采用预测帧与预训练判别器的相似度或重建误差作为奖励,这类代理指标(proxy)无法提供“应精确返回起点”这类动态一致性 的硬约束,导致模型倾向于记忆视觉模式而非学习真正的状态转移算子。这使模型在面对训练分布外的动作组合(composite actions)时性能骤降。

技术挑战与重要性

该问题的核心挑战在于:如何在不依赖人类标注的情况下,构建自监督信号来验证可逆物理过程——即任意动作序列与其逆序列的复合应恒等于单位变换。这要求模型捕捉动作的群操作属性(group operation),而非仅作时序外推。这一能力对机器人重规划、仿真实时的“回退-重试”流程,以及高风险场景(如自动驾驶)的闭环仿真至关重要:若世界模型无法保证状态返回精度,长期规划的展开将迅速偏离真实物理,导致决策失效。业界亟需一种自验证的 RL 范式来突破这一瓶颈。

行业类比

类似自动驾驶仿真依赖闭环验证(closed-loop validation)来保证场景演化自洽,世界模型也需要一种“圈回原点”的自检机制,确保其预测服从物理约束,而非仅仅视觉合理。

核心洞察

  • **自验证闭环机制** 通过可逆动作循环为视频世界模型提供无需标注的长期一致性监督,突破了现有方法仅依赖短期预测或人工评判的瓶颈。 传统强化学习微调因缺乏未来时刻的 ground-truth 状态而难以衡量长程漂移,WorldCycle 利用“动作序列与其逆序列组合必返回初始状态”的分析性约束,构建闭环奖励与时间一致性奖励,使模型能在任意动作序列下进行自我验证,这是首次将循环一致性作为可微分训练信号引入交互式视频世界模型。
  • **动作作为一致状态算子** 重新定义了世界模型的学习目标——从记忆时序模式转向学习可组合、可逆的动作效应,从根本上缓解复合动作场景下的分布外退化。 通过重复执行动作闭环并施加空间对称性与时间稳定性双重约束,模型被迫将每个动作视为对状态空间的确定性变换,从而在未见过的级联或组合动作循环上泛化能力提升近 4 倍。 这一视角与基于像素重建或单步对比损失的预训练范式形成鲜明对比,为构建物理上可解释、可组合的长程交互仿真提供了新方向。

方法

方法脉络:输入 → 循环构建 → 自验证RL → 输出

输入
交互视频世界模型接收一个初始视频帧(或状态)以及一段动作序列(如智能体控制指令)。

核心模块

  1. 闭合动作循环构建
    从任意动作序列出发,自动构造可验证的闭环轨迹。例如,将序列 [a1, a2, ..., aT] 与其可逆动作序列 [aT_inv, ..., a1_inv] 拼接,形成空间闭环;或让同一闭环重复执行多次,形成时间重复循环。这种构造无需人工标注,天然提供“必须返回起点”的解析性约束。

  2. 交互视频世界模型
    基础模型是一个条件生成模型(如扩散模型或Transformer),根据当前帧和动作序列逐帧预测未来视频。它是强化学习优化的主体。

  3. 双奖励自验证RL
    训练采用强化学习,以两类闭环奖励作为无监督信号:

    • 空间闭合奖励:强制正向路径与反向路径的中间对称帧在状态上一致,迫使动作学习为可逆算子。
    • 时间一致性奖励:要求重复执行同一循环时,不同轮次中相同相对时间步的状态彼此对齐,抑制长程漂移,让模型将动作视作稳定的状态变换,而非记忆时序模式。 奖励可在潜空间或像素空间计算(如使用RoMa对应距离),训练过程与原始生成损失(如视频预测损失)联合进行,避免灾难性遗忘。

输出
模型输出长程闭环一致的未来视频帧序列,显著减少复合误差,并能在未见过的复合动作循环(如级联多个不同循环)上保持高保真度。

与同类方法的本质差异
现有长程世界模型后训练多依赖外部分类器、手工奖励或固定编码器,缺少自洽验证手段。WorldCycle 利用动作循环的解析闭合性,首次实现了无需任何外部监督、与动作结构自洽的自验证强化学习,使一致性驱动成为模型内在的归纳偏置。

实验

实验在 CycleBench 基准上评估 WorldCycle 方法,该基准包含四类任务:可逆循环 (Reversible-Cycle)、闭合循环 (Closed-Cycle)、重复循环 (Repeated-Cycle) 和 级联循环 (Cascaded-Cycle),覆盖短期、中期、长期及复合动作场景。评估指标包括 端点状态闭合 (ESC)、反向路径对称 (RPS) 和 重复循环稳定性 (RCS),着重测量模型在长程动作序列后的状态返回能力。

关键发现

  • 长程漂移大幅降低:WorldCycle 将状态返回漂移最多减少 44%,表明自验证 RL 能有效抑制累积误差。
  • 复合动作泛化能力飞跃:在组合动作上准确率提升近 4 倍,证明了模型学习到动作作为一致状态算子,而非机械记忆时间模式。
  • 无需额外标注:通过构造动作循环自动生成监督信号,避免了真实未来状态缺失的验证瓶颈。

与基线对比深度解读

相较于基类交互视频世界模型(如扩散模型),WorldCycle 的空间闭合奖励强制前后向状态对称,时间一致性奖励对齐重复执行,从根本上改变了学习目标:模型必须理解动作的实际效果,而非简单预测下一帧。这使得 WorldCycle 不仅在闭环精确性上显著占优,更能泛化到训练中未见过的复杂动作组合,为物理级世界模型的一致性提供了更坚实的基础。

行业影响

落地场景

WorldCycle 主要赋能交互式视频世界模型(IWMs),适用于需要长期一致推演的虚拟环境仿真,如机器人训练 simulator、自动驾驶感知闭环测试、游戏 NPC 行为生成及视频内容创作工具。通过自验证强化学习减少累积误差,让模型在无需人工标注的情况下提升长时间动作序列的物理合理性。

商业价值

  • 降本:消除对海量人工标注长时序数据的依赖,大幅降低构建高保真世界模型的数据成本。
  • 增收:增强仿真环境的可信度,加速 RL 策略训练,间接提升具身智能产品落地速度,创造先发优势。
  • 体验提升:在视频生成应用中,实现更自然的长期交互连贯性,例如影视级预览、虚拟主播持久动作控制,减少“崩坏”现象。

与现有产品/工作流的接口

WorldCycle 提出的是模型无关的后训练框架,可直接嵌入现有基于扩散/自回归的视频生成模型微调管道(如 Stable Video Diffusion、VideoPoet 等)。其奖励函数(空间闭环、时序一致性)可与标准的 RLHF/PPO 训练栈兼容,只需在动作序列采样时构建闭环路径,无需改动模型架构。

具体落地 use case

  1. 自动驾驶仿真:在 corner-case 测试中,车辆执行“左转-直行-右转-倒车”等复合动作后需回到原位。WorldCycle 训练的 IWM 能更精确预测状态回归,避免传统模型长距偏离真实物理,直接提升仿真在感知-规控闭环测试中的有效性。
  2. 电商虚拟试穿/试戴:用户对虚拟模特施加“抬起手臂-放下-转身”等操作序列,要求模型在动作循环中保持衣物纹理、光影一致性。WorldCycle 可减少动作序列累积的纹理扭曲,使交互式展示更可信,降低退货率。

局限

  • **可逆动作假设的适用性受限**: 论文的核心机制依赖于从任意动作序列构造出可逆的闭环动作循环, 这对动作空间提出了严格可逆性要求。在真实世界的交互任务中(如物理不可逆操作、破坏性动作、具有延迟效应的控制), 动作的逆可能不存在或不精确, 从而无法生成分析意义上的闭环。该方法在动作空间非完全对称的场景下可能会失效, 限制了从视频生成向更广泛具身智能任务的迁移。
  • **实验环境较为狭窄**: 尽管在 CycleBench 上展示了显著提升, 实验仅覆盖了基于视频的世界模型生成任务, 未在机器人操作仿真或真实机器人平台等更复杂的交互环境中进行验证。视觉生成模型的误差度量(如 RoMa 距离)能否完全反映物理状态一致性仍存疑, 方法的泛化性和鲁棒性需要更多样的环境检验。另外, 长序列采样的计算开销和循环构造的工程复杂度未详细分析, 可能影响大规模应用。
  • **漂移消除与极端情况的处理**: 方法将状态返回漂移降低了 44%, 但残留漂移仍然存在, 对于极长时序或高度随机的动态系统, 累积误差可能依然显著。论文未讨论模型在零概率过渡、组合动作分布外等边缘场景下的表现, 也未与基于模型的控制或规划方法联合评估, 其在实际决策中的下游效用尚不明确。
论文Bohai Gu2026-08-05原文

相关内容