OmniVBench: 面向全模态 Reference-to-Video 生成的基准与大规模数据集
Reference-to-video (R2V) 生成正朝着更通用、更多样的参考控制演进,催生出新兴的 omni R2V 生成 范式。然而现有 benchmark 难以匹配这些新能力:测试用例覆盖的参考类型与组合有限,评测协议也大多只衡量整体参考一致性,忽视了参考因素是否被正确保留、解耦并绑定到目标上。与此同时,omni R2V 训练数据构建成本高昂,训练资源十分稀缺。 为此,我们提出 OmniVBench 与 Omni-R2V Dataset。OmniVBench 将 R2V 评测拓展到更广的参考类型、细粒度控制任务与更丰富的参考组合,覆盖 7 个任务族、18 个细粒度任务,横跨内容、运动、风格、结构、叙事与多参考设置。我们引入 factor-grounded evaluation,包含 12,172 条 用例专属 checklist 项,评估预期参考因素是否被忠实保留、是否正确解耦并绑定到对应目标,以及是否按指令正确实现。 我们进一步发布 Omni-R2V Dataset,把工业级训练资源带给更广泛的研究社区。该数据集主要基于大规模专业视频素材库构建,包含 340K 处理后训练样本,覆盖多样参考类型与多参考组合;我们为参考—目标配对构建了任务专用 pipeline,提供了可扩展的 omni R2V 数据构建方案。 对先进开源与闭源 R2V 模型的广泛评测显示,各模型在 OmniVBench 不同任务族与评测维度上仍存在明显性能差距,凸显出当前 R2V 模型的局限。
论文精读
TL;DR OmniVBench 构建面向 omni R2V 的基准与 340K 训练集,用 12,172 条因子级检查清单评估参考保真、解耦与指令实现,揭示现有模型在细粒度控制上的明显差距。
问题
问题背景
Reference-to-video (R2V) 生成正转向 omni R2V 范式,需同时处理内容、运动、风格、结构等多类参考及组合。领域焦点从“能生成”转向“能按精确参考约束生成”。
现有方法局限
现有基准在覆盖度与评估深度上明显不足:
- 测试用例只覆盖少数参考类型与简单组合,未触及跨维度多参考(如内容+风格+结构同时注入)。
- 评估协议主要依赖整体相似度(如 CLIP 相似度),无法判断某个参考因子是否被正确保留、解耦并绑定到目标。
- 缺乏因子级 checklist,难以区分模型是“保留风格”还是“忽略运动参考”等细粒度失败。
- 训练侧缺乏大规模、多样化的 omni R2V 数据,现有数据构建 pipeline 成本高且难扩展到多参考组合。
这些局限导致模型真实能力被高估,研究者无法定位瓶颈。
为什么难且重要
多参考因子注入需要高维解耦与精准路由:模型须同时理解每个参考的语义、将其与指令中目标对象或帧范围正确关联,并在时空生成中保持稳定。交叉干扰会导致目标混淆或属性泄漏。
业界对可控视频生成的期待持续提高,缺乏因子级归因评测,就无法区分不同架构在解耦和路由能力上的真实差异,难以指导模型迭代。
行业类比
该问题类似多模态大模型中的细粒度指令跟随评测:不仅看最终输出是否合理,还要逐项检查每个约束是否被满足,才能暴露模型真实短板。
核心洞察
- **因子接地评估** (factor-grounded evaluation) 将评估焦点从整体参考一致性细化到逐个参考因子的保留、解缠与绑定正确性。现有 R2V 基准大多仅计算视频与参考的整体相似度,无法区分模型是丢失了风格、混淆了运动来源,还是未能按指令将参考绑定到正确目标。OmniVBench 通过 12,172 个 checklist 项目,显式检查每个参考因子是否被忠实保留、是否正确解缠并路由到对应对象、是否按指令实现,从而提供可定位失败原因的细粒度诊断。
- **Omni-R2V Dataset** 构建 pipeline 从大规模专业视频语料出发,通过任务特定的参考-目标对构造与指令生成,实现了低成本、可扩展的 omni R2V 训练数据生产。与以往依赖人工设计或合成数据的方案不同,该 pipeline 利用现成专业视频中的天然对应关系,针对内容、运动、风格、结构、叙事等不同任务设计专门的配对策略,并自动生成指令,得到 340K 训练样本。这一工业化数据配方解决了 omni R2V 训练数据稀缺的瓶颈,为后续模型训练提供了可直接复用的资源。
方法
方法概述
OmniVBench 与 Omni-R2V Dataset 的核心方法围绕 omni reference-to-video (R2V) 的基准构建与数据构造展开。
输入:源视频片段、多类型参考(图像/视频/文本)、任务指令。
关键模块:
- 任务分类体系:定义 7 个任务族、18 个细粒度任务,覆盖 content、motion、style、structure、narrative 及多参考组合,扩展了传统 R2V 的参考类型与组合范围。
- 基准构建:从大规模专业视频语料中筛选样本,为每个样本构造 reference-target pair 并生成指令;OmniVBench 最终包含 12,172 条 case-specific checklist 条目。
- 评估协议:引入 factor-grounded evaluation,将评估拆解为三个维度——参考因子是否忠实保留、是否正确解耦并绑定到目标、是否按指令实现。每条 checklist 针对具体案例生成,聚合后得到细粒度能力得分。
输出:OmniVBench 评测集(含多任务、多参考组合)以及 Omni-R2V Dataset(340K 训练样本),后者通过任务特定流水线从源视频构造 reference-target pair 和指令,为 omni R2V 模型提供可扩展训练资源。
与同类基准的差异在于:OmniVBench 不再依赖整体一致性分数,而是通过因子级 checklist 定位模型在保留、解耦、指令实现上的具体短板,同时数据集覆盖更多参考组合。
实验
实验设计
论文构建了 OmniVBench 基准,覆盖 7 个任务族 与 18 个细粒度任务,引入 factor-grounded evaluation 协议,包含 12,172 条 case-specific checklist items,从参考保真度、因子解耦与绑定、指令实现三个维度评估。同时发布 Omni-R2V Dataset(340K 训练样本)用于模型训练。实验选取多款先进开放与闭源 R2V 模型进行系统评测。
关键发现
在 OmniVBench 上,所有模型均暴露出明显性能缺口,不同任务族与评估维度上表现不均衡。内容参考 与 运动参考 等常见任务表现相对较好,但 叙事参考、多参考组合 以及 跨方面参考 等复杂场景中,模型的 参考保真度 与 指令实现 能力显著下降。因子解耦与绑定 成为主要瓶颈,表明当前模型难以精确路由多个参考信号至对应目标。评测还显示,开放模型与闭源模型之间存在一定的性能差距,但闭源模型也远未达到理想水平,凸显 omni R2V 仍处于早期阶段。
基线对比解读
与先前仅关注 整体参考一致性 的基准不同,OmniVBench 的细粒度、因子级 checklist 评估更精确地暴露了模型在 解耦、绑定及指令路由 上的短板,而传统指标可能掩盖这些缺陷。在 多参考任务 中,多数模型倾向于简单融合或忽略部分参考,导致 参考冲突 或 目标错绑,这一现象在开放模型上更为突出。闭源模型虽整体略优,但在 叙事连贯 与 跨方面组合 上仍存在明显差距,说明仅靠增大模型规模或数据量不足以解决 omni R2V 的核心挑战,需要新的架构设计与训练策略。
行业影响
落地场景
OmniVBench 与 Omni-R2V Dataset 直接服务 参考到视频生成(R2V)模型的评测与训练升级。在电商产品视频中,模型可基于商品图(内容参考)、姿势序列(运动参考)、品牌调性(风格参考)自动生成多角度展示视频;在内容平台,可依据剧本分镜(叙事参考)和参考片段(结构参考)快速生成符合 IP 风格的短视频。多参考组合能力尤其适合需要同时控制角色外观和动作的虚拟主播、游戏过场动画。
商业价值
评测基准暴露现有模型在参考因素保真、解耦与路由上的短板,帮助研发团队精准定位优化方向,减少盲目试错。该数据集提供 340K 工业级训练样本,可显著降低从头构建 R2V 数据集的成本(人力标注、配对构造)。对业务而言,结合基准选型可缩短模型迭代周期,将视频素材生产成本降低一个数量级,并支撑更丰富的个性化广告、动态创意生成,提升用户参与度与转化率。
与现有产品/工作流集成
OmniVBench 提供因子级 checklist 评估,可作为 CI/CD 中的质量门禁插入现有视频生成模型训练平台,与常用框架(如 PyTorch、Hugging Face)兼容。Omni-R2V Dataset 遵循标准样本格式(参考-目标对、指令),可直接用于微调扩散 Transformer 或 DiT 模型。具体集成路径:
- 评测:将
factor-grounded评分脚本接入模型版本回归测试,按任务族输出雷达图,辅助技术决策。 - 训练:从数据集中按任务族采样,与现有视频数据集混合,在预训练模型上做多任务指令微调。
具体 use case:电商平台使用 OmniVBench 评测自研商品视频生成模型,发现其在“运动参考”维度得分低,针对性利用 Omni-R2V Dataset 中的运动参考样本微调,最终将自动生成商品展示视频的可用率提升至 80% 以上;流媒体平台借助该基准筛选多参考组合能力强的模型,用于根据用户上传的照片和动作模板生成个性化片头,降低版权素材采购成本。
局限
- **数据集构建依赖专业视频素材**,虽然规模达到 340K,但来源类型较为单一,可能引入样本选择偏差,且未充分讨论版权与授权问题。这限制了数据集在开放域、用户生成内容或非专业场景下的泛化能力。此外,任务特定的参考-目标对构造流程虽然可扩展,但当前覆盖的参考类型组合仍有限,真实应用中自由形式的多参考交叉绑定(如多个不同角色与不同动作、风格的任意组合)尚未被系统性探索。
- **评估协议中的 checklist 生成需要大量人工标注**,尽管提供了 12,172 个具体条目,但 checklist 本身的构建存在主观性,且不同标注者对“正确解耦”或“正确路由”的判断可能不一致。论文未充分验证 checklist 评分与人类整体质量判断之间的相关性,也未提供自动化评估的替代方案。这可能导致评估结果在更广泛的人类偏好测试中出现偏差,影响基准的可靠性。
- **对现有 R2V 模型的评测显示其在多个任务家族与评估维度上仍有明显性能缺口**,这固然说明了基准的挑战性,但也反映出当前基准可能将一些尚未成熟的能力纳入考核,使得分数整体偏低、区分度有限。与同类基准相比,OmniVBench 更强调细粒度因子控制,但未与已有基准(如针对单一参考类型的基准)做直接相关性分析,因此其增量有效性尚需进一步验证。