WorldExam: 从表象外观到内在反应性的世界模型基准测试
可控视频生成模型正越来越多地被用作世界模型。相应地,评估它们在这一角色中的表现,就不应局限于生成视频的表观外观,还要关注其所描绘世界的内在反应性:即从场景状态推断世界应如何反应,并生成输入中未明确指定的合理后果的能力。然而,现有基准主要评估视觉质量或显式指令完成度,通过检查请求的动作和交互结果是否实现来评判,忽视了内在反应性。 为此,我们提出 WorldExam,这是一个分层诊断基准,涵盖四个层级:视觉质量、控制遵循、空间一致性 和 世界反应性。它包含 1,474 个案例,分布于八个专门任务,并支持对相机驱动、动作驱动和语言驱动三种模型范式的统一评估。世界反应性 层级评估超出输入显式说明的场景条件反应和目标导向行为。 对 20 个代表性模型的评估揭示了明显的能力分化:相机驱动模型擅长相机控制,但其接口不支持动态交互;动作驱动模型能更精确地控制主体,但往往让世界无响应;语言驱动模型在交互上表现更好,但对复杂控制的遵循不够忠实。 没有任何模型能同时覆盖广泛任务并保持稳定强性能,这说明高视觉质量和显式指令完成并不保证内在反应性。
论文精读
TL;DR WorldExam 提出分层基准评估世界模型的内在反应性,揭示视觉质量与指令遵循不等于场景驱动的合理反应,为生成式世界模型提供系统诊断工具。
问题
当前,可控视频生成模型(controllable video generation)正被广泛用作 世界模型(world models),以模拟物理世界的动态演化。评估这些模型不仅需要衡量生成视频的外观质量,更需检验其对场景内在因果与物理法则的遵循程度。
现有基准的局限
现有基准(如 VBench、EvalCrafter)主要依赖视觉质量指标(FVD、CLIP 分数)或显式指令完成度(如物体是否被移动、动作是否执行),普遍忽略了一项关键能力:内在反应性(inherent reactivity)——模型能否根据当前场景状态,自动推断出合理的后续行为,并生成输入中未明确要求的物理后果。具体局限包括:
- 只检查“人推箱子”的动作是否发生,不管箱子是否遵循摩擦力规律滑行;
- 忽视动作引发的次级效应(如液体飞溅、物体阴影变化);
- 无法评估对隐含因果的理解,例如“捡起杯子后液面是否下降”。 因此,即使模型在视觉上逼真、指令上顺从,也可能对物理法则“视而不见”,难以成为可靠的世界模拟器。
技术挑战与重要性
评估内在反应性面临双重挑战:一是需要定义可泛化的评估指标,将常识物理规则量化为可计算的测试用例;二是需要覆盖多种交互范式(摄像头驱动、动作驱动、语言驱动),因为不同模型对场景反应的触发机制差异巨大。业界对世界模型的需求日益迫切,从具身智能到自动驾驶仿真,都要求模型不仅“画得像”,更要“反应得对”——缺乏内在反应性的推演结果不可信,无法支撑下游决策。
行业类比:如同自动驾驶仿真系统,不仅要验证自车能否按规划行驶,更需检验其能否预判他车变道、行人横穿等在指令中未直接描述的场景并发行为——这正是世界模型走向实际应用必须通过的“反应性”大考。
核心洞察
- 世界模型的评估不应止步于视觉质量和显式指令遵循,而必须包含对场景理解与自发反应能力的测试。现有基准大多只检查指定的动作是否被生成(如“走过去”),但忽略了世界模型中物体之间隐含的物理交互和社交反应,而 WorldExam 通过“世界反应性”层次专门评估这一点,揭示了模型在无明确提示时是否能生成符合物理规律和社交逻辑的后果。
- 不同控制范式的模型(camera-driven, action-driven, language-driven)在能力上呈现显著分化,且没有任何模型能同时覆盖所有任务并表现优秀。这一发现对实际工程选型具有直接指导意义:需要根据应用场景的交互需求和可控性要求,权衡使用哪种范式,而不能期待单一模型解决所有问题。
方法
WorldExam 构建了一套四层诊断体系,从表层视觉到深层反应,逐级解耦世界模型的能力维度。评估以场景状态和控制指令(相机参数、动作信号、语言描述)为输入,通过统一框架测试 camera-driven、action-driven 和 language-driven 三种模型范式。
层次化任务设计
- Level 1: Visual Quality – 直接度量生成视频的像素级保真度与时空一致性。
- Level 2: Control Adherence – 检查模型是否严格遵照输入指令(如相机位姿、主体动作)执行。
- Level 3: Spatial Consistency – 评估模型在视角变化或场景重访时维持 3D 空间结构的能力。
- Level 4: World Reactivity – 核心创新层,测量模型在未显式指定的交互中,是否自发产生符合物理规律、社会常理或目标导向的合理反应。
测试案例策划使用半自动流水线,组合模板场景、仿真环境与人工校验,覆盖 1,474 个案例,分布在八项专项任务中(Camera Control, Subject Control, Scene Revisit, Terrain Interaction, Object Interaction, Social Interaction, Physical Reaction, Goal Completion)。评估协议分为 Static-Scene Track(静态场景,侧重相机控制与空间一致性)和 Dynamic-Interaction Track(动态交互,侧重主体驱动与世界反应)。针对 World Reactivity 层,引入 Checklist-Based 评分,通过结构化问题清单对生成视频中的隐含反应进行细粒度打分,并通过人工对齐实验验证其可靠性。
与以往仅关注视觉质量或指令执行准确率的基准不同,WorldExam 首次将评估对象从“生成了什么画面”扩展到“世界如何自我演化”,尤其刻画了模型在复杂交互中的内在因果推理与常识反应能力。
实验
实验设计与评估协议
WorldExam 构建了包含 1,474 个测试用例的层级诊断基准,覆盖 Visual Quality、Control Adherence、Spatial Consistency 与 World Reactivity 四个层级。测试用例分布在 Camera Control、Scene Revisit、Subject Control、Terrain Interaction、Object Interaction、Social Interaction、Physical Reaction 与 Goal Completion 八个专用任务中。评估协议针对三种模型范式(camera-driven、action-driven、language-driven)分别设计:静态度量 track 关注相机控制与场景重访,动态交互 track 则通过 checklist 方式评估世界反应性,包括物理反应、社交交互与目标完成等维度。
核心发现
对 20 个代表性可控视频生成模型的全面评估揭示了显著的能力分化:camera-driven 模型在相机轨迹控制上表现最佳,但其接口无法支持动态交互;action-driven 模型在主体控制上更精确,却导致环境缺乏响应,呈现“主体动而世界不动”的非物理行为;language-driven 模型在交互场景下更灵活,但对复杂控制指令的遵循度显著下降。最关键的发现是,高视觉质量与显式指令完成并不保证内在世界反应性——许多模型能生成外观逼真的视频,却无法推断场景状态应有的物理结果(如物体碰撞后弹开、人物互动后的合理反应)。没有单一模型能在所有任务上同时取得领先,体现出当前模型在构建真正“世界模型”上的结构性短板。
基线对比与启示
对比实验表明,不同驱动范式在各自设计目标上表现突出,但普遍缺乏跨范式泛化能力。Camera-driven 模型因缺少交互机制而无法参与动态任务;action-driven 模型虽能操作对象却忽略语境;language-driven 模型尽管通用性稍好,但在精细控制上远未达标。这一结果指出,未来研究不能仅关注生成视频的感知质量或简单的指令跟随,而应着力提升模型对场景内在物理与社会规则的推断与生成能力。WorldExam 作为统一诊断平台,为定位模型缺陷、指导多范式融合提供了系统性工具。
行业影响
落地场景
WorldExam 评估的可控视频生成世界模型,直接作用于需要开放环境模拟与交互预测的产品线:
- 自动驾驶与机器人仿真:利用世界模型生成多样化的驾驶场景、物理交互(如车辆碰撞、行人避让),替代昂贵且危险的真实路测。
- 游戏与元宇宙内容生成:自动生成角色操控、环境响应(如破坏、天气变化)的高保真视频,加速关卡原型与 NPC 行为设计。
- 电商与广告视频制作:输入商品与简单指令,生成多角度、带物理交互(如布料飘动、液体倾倒)的展示视频,降低 3D 动效成本。
- 教育与企业培训:构建反应式虚拟环境,模拟化学实验、设备操作等场景,学员动作可触发符合物理规律的后续变化。
商业价值
- 降本增效:WorldExam 的四层诊断体系(视觉质量、控制遵循、空间一致性、世界反应性)可在模型选型阶段快速筛除“外观好但内在反应差”的模型,避免集成后出现物理违背、交互缺失等问题,节省重复开发和数据采集成本。
- 体验升级:重视内在反应性的评估,推动模型从“机械遵循指令”转向“真实环境响应”,在自动驾驶仿真中能暴露更多 corner case,在电商中生成更可信的商品交互,提升用户信任与转化。
- 统一评估框架:支持相机驱动、动作驱动、语言驱动三种范式,使技术决策者能横向对比不同接口模型的真实能力,减少试错投入。
与现有工作流的接口
- 模型训练管线:WorldExam 可作为持续集成(CI)中的质量门禁,在模型迭代后自动跑分,标记空间一致性和世界反应性退化。提供标准化脚本和指标,易于集成到 MLflow 或 Kubeflow 等 MLOps 平台。
- 数据标注与合成:利用Test Case 生成管线可扩展构建特定领域的场景库(如工厂流水线、手术室),反哺训练数据,形成“评估-反馈-增强”闭环。
- 产品选择与展示:为视频生成 API 供应商提供第三方评测报告,帮助 B2B 客户(如内容平台、游戏工作室)按场景任务(如
Physical Reaction、Goal Completion)选择最优模型。
具体行业用例
- 自动驾驶仿真公司:使用 WorldExam 评估不同世界模型在交通参与者互动(如突然加塞、行人闯入)上的反应预测能力,将高分模型嵌入仿真引擎,生成带因果反馈的极端场景,减少路测里程,加速安全验证。
- 电商平台:集成语言驱动世界模型,为商品自动生成交互式 3D 视频(如家具组装、工具使用),并通过 WorldExam 的
Object Interaction和Physical Reaction任务确保模型输出符合物理常识,提升用户停留时长和加购率。
局限
- **评估场景与模型范围的局限**:WorldExam 目前仅针对可控制的视频生成模型进行评测,未涉及基于物理引擎的仿真世界模型或具身交互环境。虽然论文宣称评估“世界模型”,但实际覆盖的模型类别仍以视觉生成式为主,对强化学习环境、机器人仿真等更广义的世界模型缺乏考量。此外,八项任务虽然层次分明,但场景数量和多样性仍受限于自动管线与人工模板,可能无法充分泛化到开放域场景。
- **指标与人类判断的对齐仍待加强**:尽管 World Reactivity 层级提出 checklist-based 评估,并报告了与人类评价的初步对齐,但此项对齐实验规模有限,未在不同任务和模型上充分验证。部分指标(如空间一致性、控制依从性)仍依赖启发式或像素级度量,可能与人类对“物理合理性”的感知存在偏差。例如,物体交互的评分可能过于严格或宽松,没有像 VBench 那样引入人类偏好校准。
- **对比现有基准的差异化定位带来缺失盲区**:相对于 VBench、EvalCrafter 等全面覆盖视觉质量、时序一致性、文生对齐的基准,WorldExam 聚焦于“世界反应性”这一被忽视的维度,但同时也牺牲了对画面美学、运动平滑度、风格一致性等常规维度的深入评测。这可能导致模型开发者为了在 WorldExam 上获得高分而忽略其他重要的生成质量,因此 WorldExam 更适合作为现有基准的补充,而非替代。