Apple-π 基准测试将视频模型物理推理拆解为五条赛道
新基准 Apple-π 拆解视频模型的物理推理过程,发现模型能读对数字选对公式,却仍无法稳定生成符合物理定律的连续运动。
南洋理工大学与港中大团队发布 Apple-π,将视频模型评测锚定在物理定律上。系统包含力学数据集 Orchard、分阶段基准协议和主客观评测套件,把“视频模型是否懂物理”变成可逐环节定位的工程问题。测试11个模型,最佳视频模型仅得0.473分,演绎阶段仍是核心瓶颈。
正文摘录
从苹果落地到牛顿定律,Apple-π 把视频模型的物理推理过程摆上考场 .jpg)  一个苹果从树上落下,今天的视频模型大多能生成一段「看起来正确」的运动:苹果向下、速度加快,最终落地。 但模型是真的理解了重力定律,还是只是在复现训练数据中的视觉统计规律? 这一区别,决定了视频模型究竟是擅长制造逼真画面的生成器,还是能够预测世界演化的「世界模型」。现有物理视频基准多聚焦最终结果是否合理,却很难回答模型究竟在哪一步出了错:没有读懂场景?选错了定律?还是无法把定律稳定地执行到每一帧? 近日,来自 南洋理工大学 S-Lab 与香港中文大学 的研究团队发布 Apple-π。该工作将视频模型的评测显式锚定在物理定律上,并把生成视频视为一条可见、可审计的「逐帧推理轨迹」。它不只问结果像不像真的,更追问模型是否经历了从感知、定律表述到演绎的完整科学推理过程。