论文

WorldOlympiad: 你的世界模型能通过铁人三项吗?

WorldOlympiad: 你的世界模型能通过铁人三项吗?

我们提出 WorldOlympiad,一个用于诊断基于视频的世界模型的基准,涵盖 物理忠实性、几何一致性 和 交互保真度 三个维度。现有基准通常关注视觉质量、语义对齐或短期时间一致性,但很少评估生成视频是否遵循物理规则、保持连贯的三维结构以及支持长期可控交互。为填补这一空白,WorldOlympiad 将世界模型评估分解为三个互补轨道: - 物理轨:使用对象分割和 MLLM-as-judge 评估生成视频在力学、热现象和材料属性方面是否遵循可解释规则。 - 几何轨:利用 高斯泼溅 重建生成视频,评估结构一致性、跨视角连贯性和相机轨迹对齐。 - 交互轨:评估生成的扩展序列是否遵循复杂动作提示,并保持跨连续视频块的平滑过渡。 WorldOlympiad 涵盖游戏、机器人和通用真实视频三大下游场景,捕捉从交互控制、具身操作到开放领域运动和相机动态的多样化挑战。这些轨道和场景共同构成一个可扩展且可解释的评估套件,能够暴露超出通用视频质量的失败模式。在先进模型上的实验揭示了物理推理、三维一致性和长时交互方面的显著差距,凸显了为生成式世界模型设计更结构化评估协议的必要性。

论文精读

TL;DR WorldOlympiad 是一个三赛道基准,系统诊断视频生成式世界模型在物理规律、3D 几何一致性和长程交互控制上的差距,暴露纯视觉合成到可信世界模拟的关键缺口。

问题

问题背景

视频生成模型正从单纯的视觉合成向世界模型演进,业界期望其不仅输出高保真画面,更能内化物理规律、三维几何与长期交互逻辑,从而在游戏、机器人、自动驾驶等下游场景中作为可微仿真器使用。

现有方法局限

当前视频生成评估基准(如 FVD、IS、CLIP 相似度)主要关注视觉质量短期时序连贯性,无法回答以下关键问题:

  • 物理可信度:生成的视频是否遵循力学、热力学、材料属性等可解释规则?
  • 几何一致性:生成内容能否重建出稳定的三维结构?跨视角观测是否一致?
  • 交互保真度:在长时程、分块生成的 rollout 中,动作指令是否被持续、平滑地执行?

这些基准将世界模型评估降维为图像生成指标的延伸,掩盖了物理推理、三维重建与长期交互控制等核心能力的缺失。

为什么这个问题难且重要

  • 技术挑战:物理规律隐含在像素动态中,缺乏可自动化、可解释的评测手段;长时程生成易累积误差,几何坍缩难以量化;跨域(游戏、机器人、真实视频)的泛化评测缺乏统一框架。
  • 业界关注度:随着 Sora、Genie 等模型推动世界模型概念,若无结构化评估,模型迭代将陷入“盲飞”,无法明确定位失败模式,阻碍从感知到行动的闭环落地。

行业类比

如同自动驾驶需要超越“画面像不像”的感知指标,去评估碰撞率、轨迹合理性一样,世界模型也需要这样一套“硬核铁人三项”来检验其是否真正理解世界。

核心洞察

  • **WorldOlympiad 将世界模型评估从表面质量转向结构化三元诊断**,这是首个同时考察物理规律、3D 几何一致性和长期交互保真度的基准。现有基准多聚焦 FVD、CLIP 相似度或短期时序连贯性,无法判断生成视频是否真正理解力学、热学、材质等物理规则,或维持稳定的三维结构与可控交互。WorldOlympiad 将评估分解为物理、几何、交互三个赛道,并覆盖游戏、机器人、真实世界三个场景,暴露了模型在物理推理与长期一致性上的系统性失效,为构建可工程化的世界模拟器提供了更完整的测试框架。
  • **通过对象分割、MLLM-as-judge 和高斯泼溅重建实现可解释的细粒度诊断**,有别于依赖单一数值指标的粗粒度评价。物理赛道利用分割模型定位运动对象并由多模态大模型判定物理规则遵循度;几何赛道从生成视频重建高斯泼溅表示,进而量化结构一致性、跨视角一致性和相机轨迹对齐;交互赛道检验动作是否被准确执行、视频块间是否平滑过渡。这种设计不仅给出分数,还能定位失败模式,直接连接模型能力缺陷与具体视觉现象,为模型迭代提供了可操作的反馈信号。

方法

评估框架概览

WorldOlympiad 是一个用于诊断视频世界模型的基准,评估维度从输入生成视频出发,经由三个互补评估轨道(物理、几何、交互),最终输出多维度的忠实度评分。

输入与数据准备
  • 素材覆盖三大源域:游戏(gaming)、机器人(robotics)和真实世界视频(real-world)。
  • 经过三阶段流水线处理:
    1. 时序分块(StageI-Chunking):将长视频切分为连贯片段。
    2. 自动标注(StageII-Caption):为每个片段生成描述,捕获动作、物理现象和相机参数。
    3. 人工校对(StageIII-Refine):修正错误标注,确保指令清晰、物理规则明确。
关键评估模块
  1. 物理忠实度(Physical Track)
    利用对象分割提取动态实体,再通过 MLLM-as-Judge 对生成视频中的物理法则遵循程度打分,涵盖:

    • 力学:碰撞、重力、运动轨迹
    • 热现象:热传导、相变
    • 材料属性:弹性、流体、断裂
  2. 几何一致性(Geometry Track)
    对生成视频进行3D 高斯泼溅(Gaussian Splatting)重建,然后评估:

    • 结构一致性:物体在不同帧间的形状稳定性
    • 跨视角连贯性:多视角渲染的几何统一性
    • 相机轨迹对齐:估计的相机路径与真实参数的偏差
  3. 交互保真度(Interaction Track)
    检查模型生成的 rollout 是否精确执行复杂动作提示,并保持连续视频块之间的平滑过渡。衡量指标包括动作跟随准确率、块间一致性分数。

输出与应用

最终输出每个模型在三个轨道上的标准化分数,并按照游戏、机器人、真实场景分别报告,暴露失败模式(如物理幻觉、3D 塌缩、控制延迟)。

与现有仅关注视觉质量或短时一致性的基准不同,WorldOlympiad 首次将物理规则、几何结构、长期交互控制统一在一个评估框架中,提供了对世界模型更全面的诊断。

实验

实验设计

WorldOlympiad 在 gamingroboticsreal-world 三大场景视频上对当代视频生成模型进行系统诊断,评价体系分解为三个维度:

  • 物理忠实度 (Physical):通过物体分割与 MLLM-as-Judge 评估生成视频是否遵循机械力学、热力学和材料特性规律;
  • 几何一致性 (Geometry):使用 Gaussian Splatting 重建生成视频,衡量结构一致性、跨视角连贯性及相机轨迹对齐度;
  • 交互保真度 (Interaction):检验生成 rollout 是否准确执行复杂 action prompts,并在连续视频片段间保持平滑切换。

关键发现

  1. 物理常识成为共享基础能力,但模型在处理精细机械交互或异常热现象时仍表现不佳。
  2. 几何-仿真鸿沟仍未闭合:即使视觉质量较高,多数模型的 3D 结构重建存在畸变,跨视角生成不一致,表明世界模型的内部表示缺乏真正的 3D 感知。
  3. 专业化与泛化之间权衡突出:在游戏场景训练的模型难以泛化至机器人操控,反之亦然,缺乏统一的通用世界模型。
  4. 长程交互控制薄弱:多片段生成时,动作意图逐渐漂移,片段间过渡生硬,损害了作为世界模型的可控性。

基线对比

与现有仅关注视觉质量或短期时序连贯性的基准(如 VBench、EvalCrafter)相比,WorldOlympiad 首次从物理、几何、交互三个互补维度深度暴露失败模式。实验表明,当前最强模型在这三个维度上仍远逊于人类判断,尤其是在需要 3D 理解和长时间动作保持的任务上。这解释了为何单纯提升 FID 或视频质量分并不能转化为可靠的世界模拟能力,呼吁更结构化的评估协议来指导生成式世界模型的发展。

行业影响

落地场景

WorldOlympiad 作为视频生成式世界模型的标准化诊断套件,可直接应用于需要高保真物理与几何一致性的产品线:

  • 游戏与影视内容创作:评估 AI 生成的游戏引擎画面或特效片段是否遵循物理规律,避免“反直觉”视觉 bug。
  • 具身智能与机器人仿真:验证环境 rollout 视频的交互一致性与跨视角连贯性,确保 sim-to-real 数据管道的可信度。
  • 自动驾驶与数字孪生:对传感器仿真视频进行 3D 几何对齐与相机轨迹校验,降低虚拟测试的误判风险。
  • 通用视频生成平台:为文生视频、图生视频模型提供自动化质检,替代部分人工审核。

商业价值

  • 降本:自动化评估替代人工对物理合理性、3D 一致性的主观判断,减少人工标注与 QA 成本。在视频生成模型的迭代训练中,快速过滤低质量样本,缩短开发周期。
  • 增收:对于 toB 视频 API 服务(如广告素材生成、虚拟试穿),更高的一致性与物理正确率直接提升客户满意度和复购率。
  • 体验提升:在交互式应用中(如游戏内可控角色生成),WorldOlympiad 的交互轨迹评估可确保用户操控的响应流畅且合理,减少“穿模”或动作断裂,提升产品竞争力。

与现有产品 / 工作流的集成

WorldOlympiad 设计为模块化评估套件,可无缝嵌入现有视频生成模型的研发与部署流水线:

  • 离线评估阶段:模型训练后,可将生成视频与对应条件信号输入基准,自动生成物理、几何、交互三个维度的分数报告,类似分类任务中的 accuracy 看板。
  • 在线质检阶段:在视频生成 API 调用时,对结果进行实时打分,设定阈值拦截低质量输出,或作为后处理修复的触发条件。
  • 工具链集成:支持通过 项目主页 提供的 Prompt Template,快速适配自定义场景; MLLM-as-judge 机制可与现有大语言模型评估管线共用,无需额外部署专用模型。

具体落地用例

  1. 电商虚拟试穿与商品展示:某电商平台使用视频生成模型自动为商品生成模特走秀视频。通过 WorldOlympiad 的物理与几何 track,自动检测服装飘动是否符合材料属性、人体透视是否一致,避免展出出现“腿部穿透裙子”等缺陷,提升客户信任度。
  2. 机器人训练数据合成:某仓储机器人公司利用视频生成模型创建拣货场景的合成视频。WorldOlympiad 的交互 track 评估机械臂动作是否遵循指令,几何 track 确保多视角下货架结构不变,防止生成数据引入错误规律,影响下游策略学习。

局限

  • - 评估方法依赖 **MLLM-as-judge**(如 GPT-4),可能引入大模型固有的偏见与评分不一致性,降低评估的客观性和可复现性。物理得分对提示词设计和模型版本敏感,需要持续校准,且多模态大模型本身对物理常识的理解仍有局限,可能无法准确判别复杂物理交互的正确性。
  • - 几何评估采用 **3D Gaussian Splatting** 从生成视频重建场景,该方法对视频的清晰度、相机运动多样性和场景静态假设要求较高,对于运动模糊、遮挡严重或动态场景可能重建质量不佳,从而影响几何一致性指标的有效性。重建误差会与生成模型的几何误差混淆,难以完全解耦。
  • - 基准仅针对**视频生成式世界模型**,未覆盖基于潜状态空间的纯动力学世界模型(如 Dreamer 系列)。真实世界建模任务常需在低维特征空间预测状态,这类方法无法通过生成视频来评测,导致基准的通用性受限。此外,三个场景(游戏、机器人、通用视频)虽具代表性,但数据来源和交互形式仍有较大差异,跨域评估的公平性有待提升。
论文Yuke Zhao2026-06-09原文

相关内容