论文

当前 World Models 缺乏持久状态核心

当前 World Models 缺乏持久状态核心

世界模型正被视为通向人工通用智能的关键一步,但建模物理世界不仅需要按需生成令人信服的帧,更需要一个随事件推进、与观测解耦的内部世界状态,使物体和事件在无人注视时仍持续演化——正如月球在不被观测时仍沿轨道运行。现有基准存在盲点:它们奖励保真度、运动与相机可控性等表面属性,却从未询问生成的世界在未被观测时是否持续演变。 我们提出 WRBench,首个系统性诊断基准,将相机运动视为可观测性干预,并将评估分解为经人工校准的三层链:①相机是否执行请求的交互;②场景在视野内是否保持连续与可识别;③返回的目标是否与已启动的事件保持一致。在横跨 4 种控制范式的 23 个模型所生成的 9,600 个视频上,一个发现尤为顽固:当前系统将观测到的世界维持为“跟踪镜头”——当目标离开视野再返回时,它恢复的是被遗弃时的状态,而非在未被观测期间继续推进的事件。 这一失败在控制范式、模型家族与规模扩展中反复出现,表明稳健的世界状态演化并非来自更清晰的图像、更精细的控制、更丰富的几何先验或单纯的参数增长。因此,我们主张 物理状态核 的稳定性与 世界线一致性(worldline consistency)应成为世界模型设计的一类首要目标,使模型能捕捉世界将如何展开,而非下一帧如何呈现。

论文精读

TL;DR 当前世界模型缺乏持久状态核心:相机移开后再返回,世界冻结而非自然演化。**WRBench** 首次系统诊断此缺陷,揭示模型只追踪可见帧,而非模拟物理世界的持续变迁。

问题

问题背景

世界模型被视为通往 AGI 的关键路径,其目标是构建能够模拟物理世界随时间演化的内部表征,而不仅仅是生成逼真视频帧。业界高度关注这类模型在具身智能、自主决策和数字孪生中的潜力。

现有方法局限

当前的世界模型(如基于扩散或自回归的视频生成模型)主要围绕短期视觉保真度运动平滑度相机可控性设计。主流基准(如 VBench、EvalCrafter)只评估表面属性,忽略了世界在不被观察时是否持续演化。实验表明,现有模型普遍将世界视为“跟踪镜头”:相机离开后返回,物体状态被冻结而非自然演进(例如,一个被推倒的瓶子在相机移开再回来后仍然保持倾倒瞬间的姿势)。这种缺陷源于模型缺乏解耦于感知的持久状态核心,其隐式状态仅在需要渲染下一帧时才被更新,而无法自主推进事件。

技术挑战与重要性

维持跨时间的物理状态核心要求模型能够(1)从稀疏观测中推断不可见过程的动态,(2)在无观测区间内持续推进对象世界线,(3)在重观测时保证状态与因果链一致。这与纯粹的画面插补有本质不同:必须学习物理规律而非像素关联。现有的架构(如 3D 几何先验、条件视频生成、测试时优化)均未解决此问题,甚至增大模型规模也无明显改善。这项能力对长期自主系统至关重要:例如,机器人需要推测被遮挡物体的位置,数字孪生要求模拟在不间断运行。因此,世界模型的设计应从“下一帧长什么样”转向“世界将如何演变”。

行业类比

类似自动驾驶中的目标跟踪:车辆必须持续预测被短暂遮挡的行人轨迹,而不是在遮挡消失时将行人“拉回”到消失前的坐标。世界模型同样需要这种世界线一致性才能应用于实际物理交互。

核心洞察

  • 可观测性盲点:现有世界模型基准仅评估外观、运动与摄像机控制,从未检查不可见时段内物理世界是否持续演化。WRBench 首次将摄像机运动视为对观测的干预,通过离开再返回的“重观测一致性”检验,揭露模型只在被观看时渲染场景,丢失了独立的时间持续性。
  • 规模化无效论:实验覆盖 23 个模型、四种控制范式,图像质量、控制精度或参数量提升均无法解决重观测时的状态冻结——目标回归时保持离开时的样子,而非继续推进事件。这表明单纯扩大模型与数据无法自行涌现持久状态核心,设计目标应从预测下一帧转向维护物理状态内核的稳定性。

方法

方法架构

WRBench 将世界模型评估建模为可观测性干预实验,核心输入是来自 Natural-25 的自然语言提示集,每条提示描述一个物理事件和一条可自由移动的摄像机轨迹。方法通过 WRBenchLib 统一工具包将提示转化为精确可复现的模拟设定,控制事件时间线、物理参数与摄像机路径,保证各模型获得相同的观测条件。

关键模块与评估链
  1. WRBenchLib 场景引擎
    以提示为种子,生成事件-视图记录(event-view records),将摄像机运动、物理事件与画面帧的时间对应关系固化为标准输入。
  2. 多层诊断维度链
    每条生成视频按六项指标串行检验:
    • 相机控制 (i-ii):验证摄像机是否执行请求的平移、旋转等指令;
    • 视觉完整性 (iii):检查画面在视野内是否连续、无崩坏;
    • 可见一致性 (iv):场景内容在可见时本体是否稳定;
    • 重观测支持与一致性 (v-vi):摄像机离开再返回后,目标物体是否按物理规律继续演变,而非停留在被放弃时的状态。
      六项指标通过大规模人类偏好标注校准,聚合成人类对齐的复合分数
  3. 诊断归因框架
    支持按控制范式、模型家族、规模增量进行分层失效分析,定位共性缺陷。
输出与差异

输出为世界模型状态持久性 (persistent state core) 的诊断报告,重点衡量模型在无观测期间能否自主推进物理世界的因果演化,而非仅渲染视觉忠实的下一帧。
与现有基准(如 FVD、IS)仅评估画面保真度或相机可控性不同,WRBench 首次将摄像机视点干预作为分离“世界状态演化”与“外观渲染”的核心工具,直接度量物理内核的稳定性。

实验

实验设计:以相机运动为干预的持久世界状态诊断

WRBench 构建了一套系统性诊断基准,将相机运动视为对可观测性的干预,并采用人工校准的评估链路。实验覆盖 9,600 段视频,来自 23 个模型,横跨 4 种控制范式(源视频条件、几何缓存条件、模型推断条件、纯文本条件)。评估维度包括相机控制执行度、视线内的场景连续性与可辨识性(视觉完整性/可见一致性),以及相机返场后目标是否与已启动的事件保持连贯(再观察支持度与再观察一致性)。通过人类偏好标注校准各维度权重,聚合为全局得分,以此暴露观测间断时世界状态的演进缺陷。

关键发现:观测断层下物理状态不会自主演进

一个顽固且跨模型的失败模式浮现:当前世界模型将已观测的世界视为跟踪镜头,当相机返场时,目标仍停留在被放弃时的状态,而未在不可见期间推进事件。例如,一个被推动的物体在相机离开并返回后仍保持在原位,仿佛时间停滞。该缺陷跨越控制范式、模型家族和规模增量,表明更清晰的影像、更紧密的控制、更丰富的几何先验或参数量的增加,都不足以自动催生稳固的物理状态演进。实验还识别出多种典型的逐帧失败模式,如顶级相机控制模型(HyDRA)返回的世界状态最差,说明视觉质量并不能保证正确的返回结果。

对比基线:重画面轻状态的范式需结构性改变

与侧重保真度、动态、相机可控性的既有基准(如视频生成评测)不同,WRBench 直接测量 “无人注视时世界是否继续运转”。对比发现,即使模型在表面指标(FID、FVD)上表现优异,一旦引入可观测性干预,物理状态的一致性和世界线的连续性即告崩溃。这揭示了当前世界模型设计的盲区:模型被训练为预测下一帧的外表,而非模拟世界的内在因果。因此,作者主张将物理状态核的稳定性视点干预下的世界线一致性提升为模型设计的第一性目标,推动世界模型从“渲染漂亮帧”转向“理解世界如何演变”。

行业影响

落地场景

世界模型(world models)被视为通往通用人工智能的关键步骤,已经在视频生成(如 Sora)、自动驾驶仿真机器人训练数字孪生和物理模拟中逐步落地。然而,现有模型在观测中断时无法维持对象状态的持续演化——例如,摄像机移开后,场景中的事件停止推进,等镜头切回时,物体仍然停留在之前的状态。这一根本缺陷直接限制了其在需要长期一致性的场景中的可用性,如:

  • 交互式视频内容生成(游戏引擎、虚拟制作):摄像机切换后,物体应继续遵循物理规律运动。
  • 自动驾驶与机器人仿真:传感器数据流可能短暂中断,世界模型必须在未观测的时段内仍能正确推演交通参与者或环境变化。
  • 动态环境数字孪生:工厂、仓储、城市模拟中,离线推演的物理状态必须与现实一致。

商业价值

改进世界模型的状态持久性可同时实现降本增收体验提升

  • 降本:更准确的长时间仿真可以大幅减少物理测试次数,例如自动驾驶领域,一次真实路测成本可达数千美元,而逼真的离线仿真能替代大量边缘场景验证。
  • 增收:在内容创作平台(如 AI 视频编辑、互动叙事工具)中,提供“摄像机走后世界仍在运行”的能力,可显著提升画面一致性,从而提高创作者付费意愿和平台留存。
  • 体验提升:机器人训练中,若世界模型能够正确预测未观测时段的状态,策略迁移到真实环境的成功率将大大增加,加速产品迭代。

与现有产品/工作流的接口

目前主流的世界模型多基于扩散生成自回归架构,其对持久状态的建模大多隐式依赖帧间运动估计,缺乏显式的物理状态核。集成改进需考虑:

  1. 模型架构:在现有视频生成管线中插入状态记忆模块(如可微分物理引擎或持久化隐式状态缓存),使生成过程与观测解耦。
  2. 评估体系:将 WRBench 这一类诊断基准集成到 CI/CD 流程中,作为衡量模型“物理真值化”程度的核心指标,与现有的 FID/FVD 等保真度指标互补。
  3. 训练数据与交互范式:需要包含可中断观测序列的数据集,以及支持摄像机干预控制的接口,让模型学会从部分观测中推断完整的世界线。

具体用例

  • 自动驾驶仿真平台(如 Waymo、Cruise)使用世界模型生成 continuous driving scenes 时,加入“传感器关闭 5 秒后重新打开”的测试用例,要求所有移动物体(行人、车辆)在消失期间按物理规律继续运动,若不通过则模型不达准则,从而避免决策系统在真实路测时因模拟不真实而失效。
  • AI 视频生成 SaaS 工具(如 Runway、Pika)可提供“摄像机离开后场景自主演化”模式,用在交互式广告或叙事短片中:摄像机摇开,再回到原目标时,目标对象已完成一个自然动作(如倒水、行走),显著提升内容连贯性与创意可能性,吸引专业创作者订阅高级功能。

局限

  • **基准覆盖范围有限**:WRBench 仅包含 25 个手工设计的自然场景提示,虽经精心挑选以覆盖事件连续性与摄像机操控类型,但数量偏少,可能无法充分代表真实世界物理交互的多样性,对泛化能力的评估存在局限。
  • **评估可扩展性不足**:核心指标依赖人类偏好标注,成本高、周期长,难以支持大规模自动化评测;人工标注的主观性也可能引入偏差,尽管论文进行了校准,但在跨批次比较时仍可能有波动。
  • **诊断性质而非解决方案**:论文专注于揭示现有世界模型在持久状态核心上的缺陷,并未提出新的模型架构、训练策略或损失函数来直接解决所暴露的问题,对工程落地的直接推动作用有限。
论文Jinpeng Lu2026-06-18原文

相关内容