Einsia AI 发布物理评测基准:8 个视频生成模型最高仅 57.76 分
这篇给视频生成模型出了一场物理考试:画面连贯不等于物理正确,测出物理量再算误差,当前最强模型也只拿到 57.76 分。
Einsia AI 旗下 Navers Lab 发布「World Models' Last Exam in Physics」,用 40 个任务、9 类物理现象测试 8 个视频生成模型能否遵守物理规律。评测把分数拆成两部分:一致性分数 C 由视觉语言模型 Qwen3.6-27B 打分,看主体和过程是否连续可观察;物理分数 P 则从视频里真正测量轨迹、周期、液面等物理量,再核对它们是否满足对应物理关系,不依赖参考视频。总分中物理占 85%,最高分 Seedance 2.5 也只有 57.76 分。
正文摘录
.jpg) 一个小球从空中落下,一束光照向镜面,一块包着石头的浮冰慢慢融化。对人来说,这些都是熟悉的物理现象。对模型来说,它们却是一场并不轻松的考试。 如今的模型,画面可以生成得很清晰,物体可以生成得很连贯,运动也可以看上去很顺畅。但小球是否遵循自由落体规律?反射光线的角度是否正确?冰融化之后,液面又会怎样变化?这些问题,需要从视频里真正测量。 Einsia AI 旗下 Navers Lab 的最新工作「World Models' Last Exam in Physics」,用 40 个任务、9 类物理现象,对 8 个视频生成模型展开测试。当前模型中,Seedance 2.5 排名第一,但平均分也只有 57.76 / 100。 它想探究的本质是: 「现有的视频生成模型,是否能够遵守物理规律?