Apple-π: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence
现代视频生成模型越来越被视为具有内化物理法则的涌现世界模型。然而,现有基准大多仅在输出层面评估物理合理性,而不验证模型是否通过忠实、基于法则的推理过程到达该输出。 我们引入 Apple-PI,第一个明确将视频模型评估锚定在物理法则上的基准。它包含三个部分: 1. Orchard 数据集:400 个视频,涵盖经典力学中的十个典型任务,分离单法则任务(无混杂因素诊断)与多法则任务(泛化探测)。 2. 三阶段基准协议:基于科学推理的感知、公式化和演绎,通过链式帧提示在信息图标注的首帧上驱动,将生成视频视为模型的可见推理轨迹。 3. 混合评估套件:结合基于 MLLM 的主观评分与基于物理法则的客观度量,实现阶段级诊断,不仅判断模型失败,更定位失败环节。 对 11 个模型的评测显示,当前视频模型远非可靠的有法则依据的世界模拟器,最佳模型得分仅 0.473。阶段级、支柱级和源级分析进一步揭示了 感知→公式化→演绎 瓶颈、弱的多法则状态转移以及持续的 Sim-to-Real 差距。这些发现将 Apple-PI 定位为指导未来视频模型迈向具有法则依据的物理智能世界模型的基础诊断工具。
论文精读
TL;DR Apple-PI 是首个以物理定律为锚点的视频模型基准,通过分阶段诊断揭示感知→公式化→演绎的推理瓶颈,证明现有模型距可靠的物理世界模拟器仍差距显著。
问题
视频生成模型 日益被视为具备物理直觉的 世界模型,但如何可靠评估其 物理智能 仍是开放问题。现有基准大多仅检查生成视频的 输出端物理合理性 (如运动一致性、物体碰撞),却忽略模型是否经由 忠实于物理定律的推理过程 抵达结果。这意味着即便模型偶然生成符合物理规律的视频,也无法确认其内化了定律;且这类评估无法定位故障阶段——是 感知 出错 (未能从视觉输入提取正确的物理量)、建模 出错 (未能将感知转化为正确的物理公式),还是 演绎 出错 (公式正确但模拟求解失败)。同时,缺乏对 多定律组合泛化 和 仿真到真实迁移 的细粒度诊断。物理推理本就横跨多个认知层次,要求模型从像素中捕捉空间化的物理量、映射为形式化定律、并仿真演化,这比单纯的外观生成难得多。业界对 可靠物理世界模拟器 的需求日益迫切 (如机器人操控、自动驾驶仿真),但当前顶尖视频模型在 Apple-PI 基准上仅得 0.473 分,揭示出感知→建模→演绎的 渐进瓶颈、多定律状态迁移薄弱及 Sim-to-Real 差距。这类似在 自动驾驶规划 中,不仅要求车辆不发生碰撞,更须验证其决策链全程遵循交通物理法则——否则仅凭最终结果无法保证安全性。
核心洞察
- **首次将物理定律锚定为视频模型评估的核心维度**:Apple-π 通过三阶段科学推理(感知、公式化、演绎)解构视频生成过程,将评估从输出层面的“像不像”深化到推理链路的“对不对”。与仅判断视觉合理性的现有基准不同,它能定位模型在哪个环节(如公式抽象或动力学推演)失败,为诊断物理智能提供了手术刀式的分析工具。
- **链式帧提示将视频生成转化为可见的推理轨迹**:Apple-π 要求模型基于信息图注释的首帧生成完整视频序列,使内部推理过程外部化、可审计。这突破了传统基准只关注最终生成结果的局限,让研究者得以直接观察模型对物理定律的遵循程度,从而暴露了感知-公式化-演绎的渐进式瓶颈和多律状态迁移的脆弱性。
- **揭示当前视频模型离可靠定律世界模拟器仍有巨大差距**:即使最强模型总分仅 0.473,且 Sim-to-Real 鸿沟显著。Apple-π 的分阶段、分原理、分来源诊断,明确指出了大规模视频训练和推理监督尚未解决物理泛化问题,为未来融入符号物理先验或显式推理模块提供了工程路线图。
方法
输入与输出格式
Apple-PI 将视频模型的可视化推理过程作为评估对象,输入是一张信息图风格的第一帧(infographic-annotated first frame),该帧叠加了物体质量、速度、摩擦系数等物理量标注,以此强制模型从显式的物理表示出发。模型需要基于该帧生成后续帧,形成一条帧链视频(chain-of-frames video),作为模型对物理场景演化过程的“思维轨迹”。
基准协议三阶段
协议将科学推理拆解为三个可控阶段:
- 感知(Perception):要求模型从输入帧中识别关键物理量及物体状态。子任务包括文本描述(Perception-Text)和图形标注(Perception-Graphic),后者需直接覆盖掩码或绘制箭头。
- 公式化(Formulation):模型需写出该场景所遵循的物理方程,文本形式(Formulation-Text)或图形形式(Formulation-Graphic,如画受力图)。
- 演绎(Deduction):最终生成视频,模拟物理交互。该阶段的评估同时考虑与真实物理结果的视觉一致性及物理量守恒。
所有阶段均通过统一的模型调用接口完成,对于纯视频生成模型,使用特定的感知和公式化提示模板来引导。
评估套件
评估采用混合策略:
- MLLM 主观评分:由多模态大模型根据详细的评估量规(rubrics)对各阶段输出打分,涵盖准确性、完整性和物理合理性。
- 物理定律客观度量:在演绎阶段,计算生成视频与真实轨迹间的 Masked PSNR、空间 IoU、时空 IoU 及速度精度等指标,直接量化模型对物理定律的遵循程度。
与同类方法的差异
Apple-PI 不同于仅评估最终视频真实性的现有基准,它首次将视频模型评估锚定在物理定律的可解释推理过程上,实现了从“结果是否合理”到“推理是否 law-grounded”的范式转换。
实验
实验设计
Apple-π 基于 Orchard 数据集评估 11 个视频模型,涵盖 10 项经典力学任务,共 400 个视频。采用三阶段科学推理协议:Perception(从信息图标注的首帧中提取物理量)、Formulation(输出物理公式)、Deduction(生成后续帧作为推理轨迹)。评估混合 MLLM 主观评分与基于物理定律的客观指标(如速度精度、掩码 PSNR),实现阶段级诊断。
关键发现
- 当前最优视频模型综合得分仅 0.473,远未达到可靠的物理世界模拟水平。
- 渐进式瓶颈:从 Perception → Formulation → Deduction 分数逐阶段衰减,表明模型难以完成完整的推理链。
- 多律泛化弱:涉及多条物理定律的任务中,状态迁移失败率显著升高。
- Sim-to-Real 鸿沟:仿真数据训练的模型在真实视频上性能大幅下降,揭示分布偏移问题。
- 定性分析显示模型常产生“看似合理但物理上错误”的运动,缺乏对守恒律、碰撞等深层理解。
与基线对比解读
该基准无直接先验基准可比,但结果与行业直觉一致:视频生成模型虽能输出逼真画面,却未内化物理规则。Apple-π 首次以“推理过程”而非单纯“输出逼真度”作为评价标准,暴露了模型在物理智能上的根本缺陷。对比传统只评估生成质量的范式,本协议更侧重因果对齐,为构建法律锚定的世界模型指明方向。
行业影响
落地场景
Apple-π 基准通过物理定律锚定视频模型的推理过程,可嵌入以下产品与业务:
- 视频生成平台(如 Runway、Pika、Sora 等):用于评估新模型版本的物理推理能力,定位感知-公式化-演绎各阶段的瓶颈,指导模型迭代优化。
- 自动驾驶仿真:对生成的未来驾驶场景视频,验证其运动轨迹是否符合经典力学(如惯性、碰撞响应),提升仿真数据的物理可靠性。
- 机器人世界模型:评估视频预测模型在物体交互、运动规划任务中的多定律泛化能力,辅助筛选可作为世界模型的骨干网络。
- 教育科技:在物理仿真教学视频自动生成中,确保内容严格遵循物理定律,减少人工审核成本。
商业价值
- 降本:自动化对标物理定律的评估,替代部分人工审核或传统物理仿真检验,显著降低模型开发与内容生产中的验证成本。
- 增效:通过阶段化解剖诊断(感知 → 公式化 → 演绎),帮助研发团队快速定位模型短板(如某个子任务或特定定律),缩短“发现问题→优化→验证”的迭代周期。
- 体验提升:推动视频生成模型从“视觉逼真”向“物理可信”进化,增强用户在专业场景(特效、仿真、教育)下的信任度,可能撬动高端 B 端市场。
与现有产品/工作流的接口
- 模型评估 CI 管线:将 Apple-π 的链式帧提示协议和 MLLM 主观+物理客观指标融合评分,集成到模型训练后的自动化测试环节,作为发版前的质量门禁。
- 数据配比指导:利用数据集
Orchard的单定律/多定律分层设计,分析模型在不同物理任务上的表现分布,为训练数据采样策略提供量化依据。 - 多模态理解接入:评估中使用的信息图风格首帧和逐帧推理轨迹,可直接对接现有 VLM(如 GPT-4V、Gemini)作为判官,无需额外开发专用模块,易于被社区采纳。
具体落地用例
- 视频生成模型的版本迭代:某头部视频模型发布前,通过 Apple-π 检查“碰撞后速度方向是否正确”、“多定律组合任务(如斜面+弹簧)的演绎失败点”,并将阶段瓶颈得分反馈给训练工程师,针对性补充物理增强数据,最终提升 10% 的演绎分。
- 自动驾驶仿真数据质检:仿真平台导入 Apple-π 客观指标(如速度准确度、掩码 PSNR),对每批生成的变道或刹车视频自动评分,筛选出物理不合理的片段并拒绝入库,保证模拟测试的安全性,减少因错误仿真导致的算法回归风险。
局限
- 物理范围局限:Apple-PI 聚焦经典力学十类任务(如碰撞、抛体),未涉及流体力学、电磁学、热力学等更广泛的物理领域。数据集中的物体多为简单几何体,场景单一,难以评估模型在复杂日常场景中的物理理解。这限制了其作为通用物理世界模型基准的代表性,未来需扩展物理范畴与视觉多样性。
- 评估协议依赖生成质量与客观指标,但未深入分析模型的推理因果性:即模型是否真正内化物理定律,还是仅模仿训练数据分布。MLLM 主观评分与基于模板的客观指标可能无法完全反映物理推理的真实可靠性。此外,现实世界视频的标注引入人工噪声(如掩码不精确、公式推导误差),影响评估的稳定性。
- 相较于已有的物理理解基准(如 Physion、CLEVRER),Apple-PI 创新在于将显式物理定律嵌入评估流程,但其自身仍是一个诊断工具,未提供改进模型的方法。数据规模较小(400 视频),可能过拟合于特定任务,且与真实应用存在 Sim-to-Real 差距,从仿真到真实视频的泛化尚未充分验证。