在世界模型中训练客体永久性
客体永久性(object permanence)与固体性是人类认知先验的重要标志。近期研究表明,视频生成模型作为当前世界模型的典型代表,已开始展现出涌现的推理能力,是构建类人物理智能的理想候选。那么,视频模型中是否已涌现出客体永久性?若没有,我们能否用受核心认知启发的数据集来训练它们? 我们提出 WROP(World Reasoning with Object Permanence),一套由 150 个手工设计、受认知科学启发的任务构成的数据基础设施,划分为六大认知类别。我们构建了 Blender 生成器,在保留每个任务认知结构的同时随机化速度、光照、相机角度等无关参数,每任务可生成 10,000+ 样本,并发布了包含 1.5M 样本的训练语料库与一套 300 题 的评测试卷。 在该评测上,我们评估了 14 个视频模型:3 个 reference-to-video、7 个 edit、4 个 continuation,其中包含我们 16B 的世界模型 PWM-WROP 。在盲测成对 Elo 研究中,PWM-WROP 在 continuation 模型中排名第一、总榜第三,仅落后于两个 reference-to-video 模型之间的统计平局。 我们发布了数据、评测、模型答案、分数、权重,以及 PWM —— 我们基于 AWS Trainium2 的原生 PyTorch 训练栈。
论文精读
TL;DR 用认知科学启发的 WROP 数据集(1.5M 样本)训练视频世界模型 PWM-WROP,让模型学会物体永久性与实体性;在盲测 Elo 中该模型居 continuation 类第一,证明可注入核心物理常识。
问题
问题背景
当前视频生成模型作为世界模型的候选,已展现出一定的涌现推理能力,但关于物体持久性(object permanence)与固体性(solidity)这类核心认知先验是否真正内建于模型中,仍有待检验。
现有方法局限
现有视频世界模型大多依赖大规模互联网视频预训练或通用生成目标,缺乏针对物体恒存性的显式训练信号。其局限主要体现在:
- 当物体被遮挡或离开视野再返回时,模型可能无法保持物体的身份一致性,产生“消失-重现”的伪物理现象。
- 在物理交互场景中,模型容易违背固体性约束,例如允许物体穿透、重叠或非接触性位移。
- 缺少系统性、可控的认知任务集来量化这些缺陷,导致难以定位模型是在视觉外观层面还是物理规则层面出现错误。
为什么这个问题难/重要
物体恒存性要求模型在时序上维持隐式对象表示,并处理遮挡、视角变化、运动干扰等多重因素,这比单帧识别或短期预测更具挑战。同时,该能力是具身智能、机器人操作、自动驾驶等下游任务中可靠世界建模的基础:智能体必须预判被遮挡物体的持续存在,才能做出安全、连贯的决策。业界对世界模型的关注从图像生成转向物理一致性,因此系统性评估与训练物体恒存性成为关键瓶颈。
行业类比
该问题类似于自动驾驶中多目标跟踪在严重遮挡下的身份保持:若视频模型无法持续“记住”被遮挡车辆或行人的存在,则后续规划与预测将不可信。
核心洞察
- 将认知科学中的对象永久性任务体系化,直接注入视频世界模型的训练,而非依赖通用视频预训练被动涌现物理推理能力。WROP 数据集以 150 个手工设计的认知任务为核心,用 Blender 随机化速度、光照、相机角度等干扰参数,在保留任务结构的前提下生成 150 万样本。这种做法与现有大规模视频生成模型主要通过互联网数据 scaling 获得隐式物理直觉的路径形成对比:它显式地把人类核心认知先验转化为可监督信号,使模型能针对性地习得遮挡、固体性等概念,而非仅靠统计关联。
- 评估对象永久性时,采用盲测成对 Elo 机制,而非依赖传统自动指标。WROP 考试包含 300 道题,由人类评委对 14 个视频模型的输出进行两两盲评,结果按 Elo 排名。这解决了物理推理中‘生成视频看起来合理但因果错误’难以被 FVD、CLIP 分数等指标捕捉的问题。PWM-WROP 在 continuation 模型中排名第一,整体第三,且前两名 reference-to-video 模型之间无统计显著差异,说明人类判断能区分不同架构的物理一致性,为后续世界模型评估提供了新范式。
方法
输入与任务定义
WROP 的输入是 150 个手工设计的认知任务,每个任务描述一个特定的物理场景(如物体被遮挡、容器容纳、碰撞交互等),并归属于 六个认知类别(例如遮挡持续、实体性、容器连续性等)。任务设计灵感来自发展心理学中的核心认知先验,确保每个任务具有明确的物理推理目标。
关键模块:程序化生成器
- Blender 场景模板:为每个任务构建基础场景,包含目标物体、遮挡物、容器等元素,以及需要模型预测的关键事件(如物体消失后重现、物体无法穿透实体等)。
- 参数随机化:生成器随机化速度、光照、摄像机角度、物体材质等 nuisance 参数,在保持认知结构不变的前提下产生视觉多样性。每个任务生成 10,000+ 样本,总计 1.5M 训练样本。
- 考试集构建:从生成数据中额外抽取 300 个问题,形成标准化评估集,覆盖所有任务家族,用于盲评打分。
模型训练与输出
基于 PWM-WROP(16B 参数世界模型),采用视频生成架构(支持延续和编辑),在 AWS Trainium2 上使用原生 PyTorch 训练栈 PWM 进行微调。训练目标为生成符合物理直觉的视频帧序列:给定部分观察(如物体被挡住),模型输出后续帧(物体再次出现)或编辑结果(物体未穿透障碍)。训练损失为视频生成的标准扩散损失(具体形式略去公式),通过大量程序化样本强化对象永久性表征。
与同类方法的差异点
现有视频生成模型依赖互联网规模数据被动涌现物理推理,而 WROP 通过 认知结构可控的程序化数据 显式注入对象永久性先验,以小得多的数据量实现针对性能力提升。
实验
实验设计
构建 WROP(World Reasoning with Object Permanence)数据集,含 150 个认知科学启发任务,分属 6 类认知类别。使用 Blender 生成器随机化速度、光照、相机角度等干扰参数,每任务生成 10,000+ 样本,总计 1.5M 训练语料,并设计 300 题考试集。评估 14 个视频模型:3 个 reference-to-video、7 个 edit、4 个 continuation(含 PWM-WROP 16B 世界模型)。采用盲评 Elo 机制进行人类偏好排序。
关键发现
- PWM-WROP 在 4 个 continuation 模型中排名第一,总体排名第三。
- 前两名由两个 reference-to-video 模型以统计并列方式占据。
- 这表明针对性训练物体永久性可提升视频生成模型的物理推理,但尚未完全超越具有外部参考信息的模型。
基线对比解读
Continuation 模型仅从给定起始帧生成后续视频,而 reference-to-video 模型可参照完整目标视频,信息不对称导致 Elo 排名天然偏向后者。PWM-WROP 在同类模型中胜出,证明 WROP 数据集有效注入核心认知先验;总体落后可能源于任务难度差异或模型规模/架构限制。后续工作可探索将参考信息融入 continuation 训练,或增大模型容量以缩小差距。
行业影响
落地场景
具身智能与机器人操作是核心受益领域:视频世界模型具备物体永久性与固体性推理后,可预测物体在遮挡、碰撞、移动后的状态,用于机器人抓取规划与操作仿真。
具体 use case:
- 电商 AR 试穿 / 家具摆放:用户上传房间视频,模型实时叠加虚拟家具并保持遮挡关系与物理碰撞一致,提升转化率。
- 自动驾驶仿真:生成物体穿越遮挡、多目标交互的 corner case 视频,扩充感知与预测模型的训练数据,减少实车采集成本。
商业价值
- 降本:以生成式物理仿真替代部分手工搭建的 3D 场景和实拍视频,大幅降低数据生产成本。
- 增收:内容平台可将物理一致性视频生成作为 API 能力输出,向游戏、影视、广告客户收费。
- 体验提升:视频编辑工具中,用户可自动处理物体遮挡、穿越等复杂操作,减少手动关键帧和遮罩工作。
跟现有工作流接口
- 数据集 WROP 可作为微调数据或数据增强 pipeline,注入现有视频扩散模型(如 Sora 类架构),增强物理推理能力。
- 训练栈 PWM(原生 PyTorch,支持 AWS Trainium2)可集成到企业 ML 基础设施,降低训练成本。
- 与 Blender / Isaac Sim 等仿真工具链结合,形成“合成数据生成 → 模型微调 → 下游任务验证”的闭环。
局限
- - 数据集由 Blender 合成生成,虽然通过随机化速度、光照、相机角度等参数增加了多样性,但合成场景与真实世界视频在纹理、遮挡模式、物理交互复杂性等方面仍存在差距。模型在 WROP 考试上的成功可能无法完全迁移到自然场景中的对象永久性推理,真实世界泛化能力有待验证。
- - 评估范围集中于对象永久性和固体性,并未覆盖更广泛的物理智能维度(如因果关系、流体动力学、支持关系等)。此外,人类偏好盲测虽然提供了相对排名,但主观判断可能受样本量限制,自动指标与人类判断的一致性也未充分论证,评估体系的可靠性仍可加强。
- - 与最强的 reference-to-video 基线相比,PWM-WROP 总体排名第三,仅与两个参考模型形成统计平局,表明该方法尚未完全超越所有现有视频生成模型。同时,论文未与专精物理推理的神经符号系统或大规模多模态语言模型进行对比,在更广泛的世界模型能力图谱中的定位尚不明确。