WBench: 面向交互式视频世界模型评估的综合多轮基准
交互式世界模型进展迅速,但现有基准仅覆盖部分能力,缺乏统一评估标准。为此,我们提出 WBench,一个涵盖五维度的综合多轮基准:视频质量、设定遵循、交互遵循、一致性和物理合规性。 WBench 包含 289 个测试案例 和 1,058 次交互轮,每个案例指定世界设定和多轮交互序列,覆盖多样场景、风格、主体及第一/三人称视角,并支持四种交互类型:导航、主体动作、事件编辑和视角切换。导航统一了文本、6-DoF 位姿和离散动作控制,便于评估不同输入接口的模型。 评估采用 22 个自动子指标,结合专用视觉模型与大语言多模态模型,所有指标经人工验证。对 20 个前沿模型 的测试表明,无单一模型在所有维度上表现优异。我们提供了各模型的特征优势、不足和开放挑战的详细诊断见解。代码和数据见 https://github.com/meituan-longcat/WBench 。
论文精读
TL;DR WBench 提出首个多轮交互式视频世界模型评估基准,覆盖五维能力、289个测试用例与22个自动化指标,为统一评测填补空白。
问题
问题背景
交互世界模型(Interactive World Models)正被用于具身智能、游戏模拟与虚拟环境生成,其核心能力是接收多轮交互输入(文本、6-DoF 位姿、离散动作)并生成连贯、遵循指令的视频序列。然而,该领域长期缺乏统一的评估标准,不同研究各自选用部分指标,难以系统衡量模型的综合表现。
现有方法局限
现有基准主要存在以下具体技术局限:
- 覆盖维度不全:多数基准(如 VBench、EvalCrafter)仅关注视频质量或单轮文本对齐,未涉及交互遵循度(导航、事件编辑等)、多轮一致性与物理合规性。
- 交互类型单一:仅支持文本或单一控制模式,无法评估模型对6-DoF 相机控制、离散动作及视角切换等复杂交互的泛化能力。
- 评估协议割裂:不同输入接口的模型(文本驱动、相机控制、动作条件)缺乏统一的测试构建与度量方式,导致结果不可比。
- 自动指标不可靠:部分指标与人类判断相关性低,且缺乏针对交互类任务的专用自动衡量方法。
为什么这个问题难且重要
构建统一的多轮交互评估基准面临 三重挑战:
- 测试案例设计复杂:需同时覆盖多样场景、风格、主体、视角(第一/三人称)及四种交互类型,且必须保证每轮交互的语义逻辑与物理连贯性。
- 跨接口统一评估:需将不同控制信号(文本、6-DoF 位姿、离散动作)转换为可比较的交互遵循度量,这对导航类任务尤其困难。
- 自动指标与人类对齐:需要组合专用视觉模型与大语言多模态模型,设计22个自动子指标,并通过大规模人类评判验证其可靠性。
业界高度关注世界模型在 具身操作、游戏 AI 及 数字孪生 中的落地,一个多维度的基准是筛选与迭代模型的关键前提。
行业类比
如同自动驾驶需要涵盖感知、预测、规划的 闭环评测体系,交互世界模型也亟需一个能同时检验生成质量、指令遵循与环境物理一致性的多轮交互基准。
核心洞察
- WBench 定义了一套多维度的交互式世界模型评估体系,将评估从视频质量单维度扩展到设置遵循、交互遵循、一致性与物理符合性五个维度,形成系统化对比。此前基准如 T2VQA 或 VBench 仅关注部分方面,缺乏对多轮交互和物理合理性的考量,WBench 填补了这一关键空白。
- 该基准整合了文本、6-DoF 姿态和离散动作等多种控制接口,覆盖导航、主体动作、事件编辑和视角切换等交互类型,首次在统一框架下测试模型对不同输入模态的泛化能力。评估结果显示当前模型普遍偏科,没有一个在所有维度领先,凸显了构建通用交互式世界模型的工程挑战。
- WBench 的 22 个自动化子指标结合了视觉专家模型和大型多模态模型,并通过人类判断验证了其可靠性。这种可扩展的评估方案使得研究人员和工程师能够快速、一致地追踪模型在迭代中的进展,而无需昂贵的人工评估,为实际开发提供了必备的工程基础设施。
方法
WBench 通过测试案例 → 交互轮次 → 视频生成 → 多维评测的管线,实现对交互式世界模型的统一基准。
数据集构建
- 测试案例定义:每个案例包含一个世界设定(world setting)和一段多轮交互序列(multi-turn interaction sequence),共计 289 个案例、1,058 轮。设定覆盖多样化场景、风格、主体、第一/第三人称视角,确保评测广度。
- 交互类型设计:覆盖四种核心能力:
- 导航(navigation):统一支持文本、6-DoF 姿态和离散动作控制,适配不同模型的原生输入接口。
- 主体动作(subject action):指定对象执行特定动作。
- 事件编辑(event editing):修改世界中的事件逻辑。
- 视角切换(perspective switching):改变观察视角。
评测套件
- 五维评估体系:从 视频质量(Video Quality)、设定遵循(Setting Adherence)、交互遵循(Interaction Adherence)、一致性(Consistency)和 物理合规性(Physics Compliance)五个维度全面衡量模型。
- 22 项自动子指标:结合专家视觉模型(如美学质量、闪烁度评估等)与大型多模态模型(如 场景 / 主体匹配),覆盖从像素级到语义级的细粒度评估。例如:
- 视频质量:美学质量、成像质量、时间闪烁、动态程度、运动平滑度等。
- 交互遵循:导航得分、事件编辑遵循、主体动作遵循、视角切换遵循等。
- 一致性:主体一致性、背景一致性、空间一致性、分段连续性等。
- 人类对齐校准:所有自动指标均通过人类评分验证,确保客观可靠。
与同类工作差异:WBench 是首个在多轮交互设定下同时覆盖五种能力维度并统一异构导航控制接口的基准,提供可扩展的自动指标与人类对齐验证。
实验
实验设计
WBench 基准包含 289 个测试用例 与 1,058 个交互轮次,系统评估交互世界模型的五个核心维度:
- 视频质量(Video Quality)
- 设定遵循(Setting Adherence)
- 交互遵循(Interaction Adherence)
- 一致性(Consistency)
- 物理遵从(Physics Compliance)
测试覆盖 导航、主体动作、事件编辑、视角切换 四种交互类型,统一支持文本、6-DoF 位姿和离散动作控制接口。评估采用 22 个自动子指标,结合专家视觉模型与大语言多模态模型,并通过人类评判验证指标有效性。共评测 20 个 SOTA 模型,涵盖文本驱动、相机控制与动作条件三大类别。
关键发现
没有单一模型在所有维度上表现强劲,各模型能力呈明显互补特征。部分模型在视频美观度上占优,却在物理一致性或长程记忆上明显退化;多轮交互场景下,一致性衰减 是普遍瓶颈。自动指标与人类判断的 高相关性 证实了评估框架的可靠性。WBench 首次揭示了复杂交互(如事件编辑、视角切换)中模型行为的系统性和可诊断性弱点。
与基线对比的深度解读
相较于现有只覆盖部分能力的基准(如仅评估视频质量或单动作响应),WBench 提供了 覆盖全维度、多轮、多交互类型 的统一评测。对比显示:
- 动作条件模型 虽可直接操控,但在复杂物理交互中表现常低于预期;
- 文本驱动模型 在叙事一致性上较强,但精确空间控制不足;
- 相机控制模型 在视角切换上稳健,但交互多样性受限。
这些差异为模型选型与改进方向提供了明确指引,尤其在 跨维度一致性 和 物理推理 仍存在巨大提升空间。
行业影响
落地场景
交互式视频世界模型正在赋能许多需要多轮动态交互的领域。WBench 提供的五维评估框架(视频质量、设定遵循、交互遵循、一致性、物理合规)可直接应用于:
- 电商与虚拟试穿:用户可通过多轮交互(更换视角、编辑场景)检验服饰在不同动作下的视觉效果,WBench 确保生成视频的服装一致性、场景遵循和物理合理性。
- 自动驾驶与仿真:利用世界模型生成 corner case 驾驶视频时,需要评估导航指令的遵循度与物理合规性,WBench 为此类模型提供了系统化的选型基准。
- 影视预演与内容创作:在多镜头、多事件编辑的场景中,WBench 的交互遵循和一致性指标帮助筛选最佳模型,减少后期修正成本。
- 教育互动模拟:例如虚拟实验室中多步骤操作的教学视频生成,需要严格遵循教程设定,WBench 的设定遵循和交互遵循评估可保障教学内容精准交付。
商业价值
- 降本:WBench 通过 22 个自动子指标替代人工评审,大幅降低交互式视频模型的评估成本,加快迭代周期。模型开发者可以快速定位模型在某一维度的弱点,避免在错误方向上投入资源。
- 营收增长:对于面向消费者的应用,如虚拟试穿功能,高质量的交互视频显著提升用户参与度和购买转化率。精准的评估基准确保了上线模型的体验基线,减少流失。
- 体验提升:WBench 对多轮交互一致性、物理合规的严格度量促使模型输出更真实、更连贯的视频,直接增强终端用户的沉浸感与信任感。
与现有产品/工作流的集成
WBench 的设计兼容多种模型接口(文本、6-DoF 姿态、离散动作),评估协议易于接入现有 MLOps 管道。其自动化指标利用专家视觉模型(如 VideoScore) 与大模型多模态(如 GPT-4V) 结合,并提供与人类判断对齐的验证,可作为持续集成中的质量关卡。数据集通过 GitHub 发布,支持直接 pip install 使用,与常见的视频生成框架(如 Open-Sora、Stable Video Diffusion)无缝对接。
具体应用案例
- 电商虚拟试穿:某时尚平台引入多轮交互试穿功能,用户在选择一件外套后,可进一步输入“转身展示背部”或“切换至室外场景”。WBench 的交互遵循度和设定遵循度指标确保模型始终生成正确的服装和场景,减少因模型幻觉导致的退货率。
- 自动驾驶仿真:一家自动驾驶公司在合成罕见驾驶场景视频时,使用 WBench 评估多个世界模型(如 DriveDreamer、Genie)在接收“左转,减速”等导航指令后的视频质量与物理合规性,从而选择最优模型生成训练数据,提升感知系统的鲁棒性。
局限
- **自动评估指标的固有局限**。WBench 使用 22 个自动子指标,结合专家视觉模型与大型多模态模型进行评分,虽与人类判断对齐,但计算成本较高,且依赖第三方模型的准确性与鲁棒性。在物理合规、因果保真等复杂维度上,自动指标可能仍无法完全复现人类对物理异常或逻辑矛盾的敏感度,导致部分微妙的质量退化被低估。此外,指标正常化的策略(如 HPSv3-Norm)可能掩盖不同模型在原始美学偏好上的真实差异,影响跨模型比较的解释性。
- **基准覆盖的维度与交互类型仍有限**。尽管 WBench 覆盖 289 个测试用例和 1,058 轮交互,并包含导航、主体动作、事件编辑和视角切换四类交互,但实际交互可能涉及更复杂的情形,如多智能体协作、长线因果任务、物理交互(抓取、碰撞)和开放域对话等。现有测试用例的生成依赖模板与人工校验,可能无法充分反映真实世界中开放、多元的交互分布,限制了其对模型长期多轮交互稳定性和泛化能力的评估深度。
- **评估协议对异构模型接口的适配可能引入偏差**。WBench 虽然通过抽象控制接口(文本、6-DoF 姿态、离散动作)统一评估不同原生活用范式的模型,但在实际测评中,部分模型可能仅支持某一子集,需进行接口适配或降级评估(例如仅基于文本的导航评估),这可能导致模型能力未被完全释放,或在不同交互类型间引入不平衡的评测难度,使得跨模型排名的公平性受到影响。