论文

PhiZero: 基于物理语言构建的世界模型

PhiZero: 基于物理语言构建的世界模型

我们引入 PhiZero,一个围绕物理语言构建的物理世界模型。物理语言是世界状态转换的紧凑离散表示。现有的物理世界模型通常在像素空间中直接预测未来视频,将潜在的世界动态隐式编码在高维视觉预测器中。 受人类能够从视觉经验中抽象出预测结构并用自然语言进行显式推理的启发,我们通过自监督从野外视频中学习物理语言,并用它来显式推理物理世界如何演化。为此,PhiZero 采用“先推理后渲染”的范式:首先推断未来的世界演化作为物理语言序列,然后将推断的转换渲染为视频。 在生成和理解基准上的大量实验验证了 PhiZero 建模物理一致的世界演化的能力。我们进一步展示了其在真实与交互式世界建模、细粒度动作条件模拟以及零样本运动迁移方面的潜力。

论文精读

TL;DR PhiZero 提出物理语言,将世界动态抽象为离散序列,实现“先推理后渲染”的显式物理建模,在视频生成与理解等任务上验证了物理一致性及可控仿真能力。

问题

问题背景

世界模型旨在让 AI 理解物理环境中状态演化的规律,是具身智能、自动驾驶与仿真等应用的核心模块。当前研究重心正从直接视频生成转向可解释、可控的物理预测。

现有方法局限

主流物理世界模型直接在像素空间预测未来帧(如视频扩散模型),存在三重局限:

  • 动态信息隐式化:物理规律(碰撞、重力等)被包裹在高维视觉特征中,难以显式推理或干预;
  • 长程崩坏:自回归逐帧生成难以维持物理一致性,累积误差导致物体变形、运动违反直觉;
  • 数据与计算低效:像素级建模需海量数据,且缺乏对状态转移的抽象压缩,推理成本高。

为什么这个问题难/重要

从无标注视频中学习物理规律本质上是解耦学习难题——必须分离物体属性、几何关系与因果效应。自然视频缺乏标注,模型容易学到表面统计关联而非真正物理机制。但一旦攻克,可解释的物理状态表示将大幅提升世界模型在下游任务中的泛化与可控性,是推动 AI 从“感知”走向“推理”的关键瓶颈。

行业类比

类似于 NLP 中通过预训练语言模型将语义压缩为离散 token 从而支持复杂推理,物理语言如同为物理世界建立了一套可计算的符号系统,使得后续的规划与仿真能像语言模型对话一样高效、可控。

核心洞察

  • **物理语言 (Physical Language) 作为显式动力学抽象**:PhiZero 不直接预测像素,而是学习一组离散 token 来表达世界状态转移(如物体位移、形变),将隐式动力学转化为可推理的序列。相比视频生成模型(如 Sora、VideoPoet)在像素空间隐式建模物理规律,物理语言提供了可解释、可编辑的中间表示,使世界模型的推理过程透明化,并支持通过操控 token 序列实现精细的运动编辑与零样本迁移。
  • **从无标签野外视频自监督学习物理规律**:利用海量自然视频,通过重建式自监督任务训练物理语言 tokenizer,避免了依赖仿真器、物理参数或人工标注。与基于物理引擎(如 MuJoCo、Blender)的方法不同,PhiZero 能直接从真实世界视频中抽取通用的物理语元,具有更好的扩展性和数据效率,为构建通用物理世界模型提供了可行路径。
  • **推理与渲染解耦的 Reason-then-Render 范式**:先以物理语言序列形式推理未来世界演变,再将其渲染为视频帧。这种分阶段设计使得动力学学习与视觉生成解耦合,便于分别优化;渲染器可专注于视觉质量,推理器则聚焦于物理一致性。相较于端到端视频预测,该范式在需要可控交互或跨实体迁移的场景中优势明显,如机器人仿真中可复用推理器而仅更换渲染器。

方法

PhiZero 采用 先推理再渲染 (reason-then-render) 范式,将物理世界建模分解为三个核心模块:

  1. 物理语言分词器 (Physical Language Tokenizer)

    • 输入:一段视频帧序列。
    • 编码:通过 Transition-level Q-Former 将连续帧间的状态转移压缩为紧凑的离散 token 序列(即物理语言)。该模块结合了 VQ-VAE 的向量量化思想,并引入 扩散先验解码器 (Diffusion-prior Decoder) 从 token 重建清晰的视频帧,提升渲染保真度。
    • 训练技巧:采用 纯噪声预热 (Pure-noise Warm-up) 策略稳定初期训练,配合 课程学习 (Curriculum Training) 从简单场景逐步过渡到复杂场景。
  2. 物理语言推理器 (Physical Language Reasoner)

    • 输入:一段历史帧编码得到的物理语言 token 序列。
    • 推理:基于 预训练 VLM(如 LLaMA 架构)以自回归方式预测未来的物理语言 token。该 VLM 通过 两阶段训练 微调:先对齐物理语言与自然语言的语义空间,再在大量物理交互视频上学习世界动态。
    • 数据管理:通过专门的数据管线筛选富含物理事件(碰撞、运动等)的视频片段。
  3. 视频渲染 (Renderer)

    • 将推理出的未来物理语言 token 序列送入 Diffusion-prior Decoder,逐帧生成对应的未来视频画面。

整体流程:输入视频 → Tokenizer → 离散物理语言 token → Reasoner → 未来物理语言 token → Decoder → 输出未来视频。

与同类方法的差异:现有世界模型(如 Dreamer、IRIS)直接将环境动态隐式编码在连续隐向量或像素预测中,难以显式抽象和干预;PhiZero 用 离散物理语言 作为中间表示,天然支持序列推理和符号操控,且 reason-then-render 分离设计使模型更易扩展为零样本操控、运动迁移等任务。

实验

实验设计

PhiZero 在多个物理视频生成与理解基准上进行了系统评估。生成任务涵盖 Physics-IQ、PhyGround 与 WorldModelBench,评估模型预测未来帧的物理合理性;理解任务则采用 IntPhys2、LikePhys 与 YoCausal,检验模型对物理违反、直观物理及因果结构的把握能力。实验采用 reason-then-render 范式:先由物理语言推理器将初始帧与动作映射为离散物理语言序列,再由渲染器生成视频,并与直接像素空间预测的基线模型(如基于扩散或自回归的视频预测器)对比。

关键发现

  • 物理语言带来显式推理能力:将世界动态抽象为紧凑的离散符号,使模型能够像人类一样进行物理直觉推理,而非仅记忆像素模式。
  • 生成视频的物理连贯性显著提升:在长序列预测中,PhiZero 比传统像素预测模型产生更少物体消失、穿模或违反力学规律的情况。
  • 零样本迁移能力:物理语言的组合性与解耦特性,使得模型在未专门训练的情况下,即可实现跨具身运动迁移与 sim-to-real 转移。

基线对比解读

传统物理世界模型将动力学隐含在高维像素预测头中,缺乏显式物理约束,导致在长时预测与分布外场景下迅速退化。PhiZero 将未来演化抽象为 物理语言序列,并借助预训练 VLM 进行逻辑推理,因此能够捕捉物体间更稳定的物理关系。在 Physics-IQ 等基准中,PhiZero 的物理一致性评分明显优于同类视频预测基线,尤其在需要全局约束(如守恒定律)与长程因果的场景中优势更突出。这证明抽象物理语言作为中间表征,有效降低了对像素级统计的过拟合,使模型更接近“世界模型”的本质。

行业影响

落地场景

PhiZero 通过 reason-then-render 范式显式建模物理世界动态,可直接应用于需要物理一致性的生成与理解任务。典型场景包括:

  • 自动驾驶仿真:生成符合物理规律的多样化驾驶场景,替代高成本实车采集,覆盖长尾事件。
  • 机器人仿真训练:为机械臂操作、移动导航提供交互式环境,支持策略学习与 sim-to-real 迁移。
  • 视频内容生成:在影视特效、游戏引擎中生成动作连贯、碰撞真实的交互式视频,降低人工动画成本。
  • 工业异常检测:基于物理规律的演化预测,识别设备运行中的异常模式。

商业价值

  • 降本:用自监督方式从无标注视频中学习物理语言,大幅降低高质量仿真数据的生成成本,替代部分手工建模或物理引擎计算。
  • 增收:在短视频平台、虚拟直播等业务中,更高的物理真实感可提升用户停留时长和互动率;在自动驾驶工具链中,加速模型迭代,缩短产品上市周期。
  • 体验提升:使生成式 AI 产品输出的视频更符合直觉物理规律,减少“视觉假象”,增强可信度与沉浸感。

与现有产品/工作流的接口

PhiZero 可作为一个物理推理中间件,与现有视频生成或仿真管线松散耦合:

  1. 与视频扩散模型结合:将物理语言序列作为条件输入,引导 Sora、Stable Video Diffusion 等模型生成物理一致的帧,提升长期时序稳定性。
  2. 替代传统仿真器:用学习到的动态模型代替部分基于规则或物理引擎的计算,输出渲染前的世界状态,再配合神经渲染器生成图像。
  3. LLM/VLM 协作:利用预训练视觉语言模型 (VLM) 对物理语言进行推理,实现基于自然语言指令的场景编辑或动作规划。

具体应用案例

  • 自动驾驶数据工厂:输入初始帧和车辆控制信号,生成未来多秒的物理一致性驾驶场景,用于训练感知、预测和规划模型,解决 corner case 数据匮乏问题。
  • 短剧/动画制作:创作者提供文字描述或关键帧,系统自动生成符合物理定律的角色动作和环境交互,大幅缩短传统绑定、驱动和渲染流程,降低中小工作室的出品门槛。

局限

  • **物理语言推理器依赖预训练 VLM**:推理器基于视觉语言模型微调,但可能继承 VLM 的幻觉和常识推理误差,对于长时序、多物体交互或罕见物理现象,生成的物理语言序列可能偏离真实物理规律。纯语言中间表示难以精确建模连续物理量(如力、速度)的渐变,可能限制需要高精度预测的下游任务。
  • **离散物理语言存在信息瓶颈**:tokenizer 将帧间变换压缩为离散 token,虽利于推理效率,但丢失了细粒度视觉细节和连续运动信息,导致渲染视频出现模糊或伪影。对比端到端像素预测模型,在纹理丰富、快速变化的场景中重建质量可能不足,且 token 表大小与表示能力的权衡需要进一步探索。
  • **泛化性与真实世界验证不足**:训练数据主要为受控的物理交互视频,对开放域复杂场景、长时依赖或真实机器人环境的泛化能力尚未量化。论文展示的零样本 sim-to-real 和运动迁移缺少大规模基准测试,物理语言的可迁移性分析仅停留在少数领域,实际部署时的分布偏移风险较高。此外,推理-渲染双阶段架构可能引入累积误差,影响长期 roll-out 的稳定性。
论文Shuyao Shang2026-07-30原文

相关内容