论文

VGI-Bench: 探究视频生成模型中的视觉智能

VGI-Bench: 探究视频生成模型中的视觉智能

近期研究表明,视频生成模型可通过生成的帧展现出某种形式的零样本视觉推理能力。然而,可靠的评估仍具挑战:基准测试应采用与当前视频模型视觉先验对齐的输入,要求有效的演化过程而不仅是合理的最终状态,并校准任务难度以保持挑战性但又部分可行。为此,我们提出 VGI-Bench,包含 27 个任务和 810 个实例,通过二维分类体系(任务领域与技能标签)对视频生成模型的视觉推理能力进行细粒度评估。 我们的评估显示,当前生成系统能解决部分视觉推理任务,但远未可靠:即使最强的模型 Seedance 2.0 在我们的评估标准下也仅达到 51.0%。进一步分析探索了输出失败模式、输入条件敏感性、从合成微调的性能迁移边界,以及内部去噪视角——揭示模型自我修正能力有限,后期步骤主要细化早期假设而非纠正推理错误。 我们希望 VGI-Bench 能够推动下一代视频生成模型的发展。网站:https://hexuan21.github.io/VGI-Bench/

论文精读

TL;DR VGI-Bench 以 27 个任务 / 810 实例系统评测视频生成模型的视觉推理,最强 Seedance 2.0 仅 51% 成功率,揭示自纠正能力不足。

问题

问题背景

视频生成模型近年从单纯的内容创作工具向具备零样本视觉推理能力的系统演进,研究者开始关注其能否在生成过程中隐式完成物理、因果或意图推理。

现有方法局限

现有基准在评估视频生成模型的视觉推理时存在三类具体技术缺陷:

  1. 输入模态失配:许多任务使用静态图像或纯文本作为条件,未对齐当前视频模型以时序视觉先验为主的输入偏好,导致模型无法发挥生成式推理优势。
  2. 只评终态,忽略过程:评估只检查最终帧是否合理,不要求中间帧呈现有效的演化过程。模型可能通过记忆或巧合生成一个看似正确的终态,而未真正理解动态关系。
  3. 难度未校准:任务要么过于简单(模型凭表面线索即可猜对),要么过于困难(所有模型均无法完成),不能区分不同模型的推理水平。

为什么这个问题难/重要

视觉推理本身是多模态、时序、因果的复合能力,难以用单一指标衡量。视频生成模型将推理过程隐藏在去噪轨迹中,缺少显式的可解释信号,导致评估必须依赖生成帧的语义判断。同时,业界对视频生成模型的期待已从“画质逼真”转向“理解世界模型”,可靠的推理基准是推动架构改进和训练策略优化的关键反馈信号。

行业类比

类似自动驾驶仿真中,如果视频生成模型不能正确推理车辆运动与交通规则的因果关系,就无法生成物理合理的场景,进而影响下游感知模型的训练质量。

VGI-Bench 通过 27 个任务、810 个实例,并引入过程敏感度和难度校准,正是为了填补这一评估空白。

核心洞察

  • VGI-Bench 通过要求“有效演化过程”而非仅“合理的最终状态”,重新定义了视频生成模型的视觉推理评估。与以往只检查最终帧合理性的基准不同,该基准校准任务难度,使模型在当前能力下仍有部分可解,从而区分不同模型的推理层级。结果显示最强模型 Seedance 2.0 仅达 **51.0%** 成功率,揭示生成能力与可靠推理之间存在显著鸿沟。这一设计推动下一代模型需在规划、因果与时空一致性上取得实质性进步。
  • 对去噪轨迹的分析发现,视频生成模型的视觉推理在去噪早期基本定型,后续步骤主要细化早期假设而很少纠正错误。这解释了为何模型自校正能力有限,并指出优化推理的关键窗口在**早期去噪阶段**。与依赖增加推理步骤或微调后期层的常见策略不同,该发现建议在早期去噪阶段注入更强先验或设计中间监督,以提升推理可靠性。

方法

输入构造与任务设计

VGI-Bench 从视频生成模型的视觉先验出发,设计输入以对齐当前模型的生成能力。每个任务实例包含:

  • 一段文本提示,描述一个需要视觉推理的演化过程(如物体运动、状态变化、逻辑规则呈现)。
  • 一个初始画面(image 或视频首帧),用于启动生成过程。
  • 任务的目标是让模型生成后续帧,使演化过程符合物理或逻辑约束。

关键模块:两级分类与质量控制

基准组织为两级分类体系:

  1. 任务域(task domains):涵盖空间推理、物理交互、因果推断、计数与比较等 27 个任务。
  2. 技能标签(skill tags):细粒度标注每个实例所需的推理技能(如外观保持、遮挡处理、轨迹预测)。

构建中引入人工质量控制:

  • 由标注员验证任务的可解性与唯一性,剔除歧义或无法通过生成表现的实例。
  • 控制难度校准:确保任务既非当前模型已饱和求解,也未完全不可行,从而保留区分度。

输出与评估流程

模型输出为视频序列。评估采用两阶段:

  • 主要评估(视频):使用 VLM-as-Judge,对生成视频的完整性与规则符合度打分(Completeness 与 Rubric 指标)。
  • 辅助评估(图像):将静态画面作为目标状态诊断,检查模型是否能在单帧中呈现正确最终状态。

通过聚合得到每个模型的任务成功率。论文还设计了数据增强策略(如风格变换、提示改写)以测试模型对输入扰动的鲁棒性。

与同类方法的差异

与仅评估最终画面合理性的基准不同,VGI-Bench 强调过程有效性,要求生成的中间帧必须遵守物理或逻辑演化约束;同时通过难度校准避免模型使用表面统计捷径。

实验

实验设计

  • VGI-Bench 包含 27 个任务、810 个实例,按两级分类法(任务领域 + 技能标签)组织。
  • 评估指标为 Completeness 与 Rubric Score,要求生成有效的演化过程,而非仅合理终态。
  • 输入条件与当前视频模型的视觉先验对齐,用于零样本视觉推理评测。

关键发现

  • 现有视频生成系统能处理部分视觉推理任务,但可靠性不足:表现最好的模型 Seedance 2.0 仅达 51.0% 成功率。
  • 失败模式显示自校正能力有限:去噪后期主要细化早期假设,而非修正推理错误。
  • 输入条件敏感性与合成数据微调的迁移边界进一步限制了泛化能力。

基线对比

  • 商用视频模型整体领先,但离解决问题仍有明显差距;图像生成仅作为静态目标状态诊断,无法替代动态过程评估。
  • 相比纯静态图像评测,VGI-Bench 强调时序一致与过程合理性,揭示了视频模型在视觉推理中的特有短板。

行业影响

落地场景

视频生成模型当前在 视觉推理 任务上可靠性有限(最强模型 Seedance 2.0 仅 51.0%),但已能处理部分子集,适合用于辅助生成需要动态理解、因果顺序的内容,如电商虚拟场景合成、教育动画生成、物理交互模拟。不建议全自动替代,适合预筛选或初稿。

商业价值

短期价值在于降本:减少专业动画/3D制作人力,生成结果作为初稿后人工精修。VGI-Bench 作为评估基准可帮助团队量化模型能力边界,降低上线风险。长期若模型通过更多视觉推理任务,可拓展全自动内容生成市场。

与现有产品/工作流接口

  • 模型选型与回归测试:在 CI/CD 中集成 VGI-Bench,跟踪每次模型更新的视觉推理能力变化,防止回退。
  • 合成数据微调参考:论文发现 synthetic fine-tuning 迁移有限,可用于指导训练数据配比。
  • VLM-as-Judge 评估代码可复用,与现有视频生成 API(如 Seedance、Kling)对接,输出结构化评分。

具体落地 use case:

  1. 电商平台批量生成商品在复杂场景中的动态短视频,先用 VGI-Bench 筛选在 物理交互 任务上表现较好的模型,再人工抽检,节省拍摄成本。
  2. 在线教育公司制作物理实验演示动画,通过 VGI-Bench 的 因果顺序 任务筛选模型,减少错误概念传播。

局限

  • **依赖 VLM-as-Judge 的自动评测可能存在系统性偏差**。论文主要用 VLM 对生成视频进行完整性、合规性与 rubric 打分,但这类判别模型本身对动态过程、遮挡关系、因果链条的理解有限;论文仅在部分任务上报告了人工一致性,未给出全任务级别的误差界。这可能导致排序不稳定,尤其对于接近随机水平的中间模型,其得分差异可能被评测噪声淹没。
  • **任务生态与真实性覆盖不足**。现有 27 个任务多基于合成素材或简化物理场景,如物体移动、颜色变幻、数量增减,缺少真实世界复杂交互、长时程因果、多主体协调等分布;输入图像多为干净背景下的单个或少量物体,与视频生成模型实际部署时的复杂先验差距较大。因此,基准结论可能高估模型在真实场景下的视觉推理可靠性。
  • **难度校准与输入设计依赖人工先验,存在捷径风险**。作者通过 pilot 实验控制任务难度,但并未完全消除 prompt 或参考帧中的静态目标状态泄露;部分模型可能利用画面中的终止状态线索而非完整推演过程就通过评测。此外,数据增强只覆盖图像输出子集,视频增强路径未见系统分析,限制了基准对模型鲁棒性的检验深度。
论文Xuan He2026-08-26原文

相关内容