论文

VidaForge:面向视频预训练数据配方的开放研究基础设施

VidaForge:面向视频预训练数据配方的开放研究基础设施

视频基础模型日益依赖大规模预训练数据,但其背后的端到端数据管线大多封闭,难以检查或复用。研究者若想理解视频数据配方如何影响模型预训练,往往需要先搭建大量基础设施,才能验证一个聚焦的假设。 我们提出 VIDAFORGE,一套开放研究基础设施,将视频数据配方表示为从原始视频到训练数据集的可执行五阶段工作流。该工作流中的任一决策都可被替换,从而构建出替代数据集,同时完整保留每个样本的生成方式。 为展示这一研究流程,我们在 Wan 2.1 与 V-JEPA 2.1 的早期从零预训练中,比较了不同覆盖度与质量的数据配方。结果如下: - 在两种学习目标下,更广覆盖度 的配方都取得最高的下游基准分数; - 而 基于 loss 的评估 则倾向支持不同的配方。 该研究展示了 VidaForge 如何将数据配方选择与下游模型性能连接起来。我们还发布 VIDAFORGE-3M,包含 314 万个场景级片段、共 6,475 小时,并附带细粒度标注与筛选信号,供视频数据配方研究使用。

论文精读

TL;DR VIDAFORGE 将视频数据配方表示为可执行五阶段工作流,支持研究者对比不同数据配方对 Wan 2.1 和 V-JEPA 2.1 预训练的影响,发现更广覆盖率配方下游得分更高,并开源 3.14M 片段数据集。

问题

问题背景

视频基础模型(如 Wan 2.1、V-JEPA 2.1)的预训练性能高度依赖大规模数据配方的设计与执行,但端到端数据管道通常闭源,研究者难以检查和复用。

现有方法局限

  • 若想验证数据配方对预训练的影响(例如比较 coverage 与 quality),研究者需从零搭建视频摄取、场景分割、去重筛选、多级标注、打包等基础设施,耗时且易引入非受控变量。
  • 现有开源数据集(如 WebVid、HD-VILA)只提供静态子集,缺乏样本从原始视频到训练数据的完整溯源,无法系统研究“替换一个筛选阈值如何改变模型行为”。
  • 训练与验证集往往未严格隔离,损失评估与下游任务评估可能不一致,导致配方优化目标模糊。

为什么这个问题难/重要

  • 数据配方是一个高维决策空间,每个阶段(标注粒度、去重强度、覆盖范围等)都会改变数据分布;不同学习目标(生成 vs 表示学习)对配方敏感度不同,论文中 Wan 2.1 与 V-JEPA 2.1 在相同配方下损失趋势相反。
  • 从零预训练成本高,缺乏可复现的配方工作流会严重拖慢迭代;VidaForge 将配方定义为可执行五阶段工作流(ingestion → segmentation → selection → annotation → packaging),支持变体构造与规模化,直接连接数据决策到模型性能。
  • 业界对数据管线的透明度和可审计性需求上升,缺少统一基准阻碍跨团队对比数据方案。

行业类比

类似 LLM 预训练中对数据混合比例的调优,但视频数据规模更大、处理链路更长,需要标准化的“数据配方实验台”,才能像调超参一样系统搜索数据决策。

核心洞察

  • 将视频数据配方抽象为可执行工作流,使数据消融研究从黑盒变为透明可干预。与仅发布数据集或端到端管道不同,VidaForge 允许在五阶段(摄取、分割、选择、标注、打包)中单独修改决策,并保留每个样本的生成轨迹,从而能严格归因模型性能变化到具体数据选择。这解决了视频预训练领域因管道封闭而无法有效比较数据配方的问题,为构建更可靠的 scaling law 和课程学习策略提供基础。
  • 损失指标与下游性能在数据配方评估中存在显著分歧:广泛覆盖的配方在下游基准得分最高,但基于损失的评估却偏好其他配方。这一发现挑战了仅用训练或验证损失筛选预训练数据的常见做法,说明损失曲面与任务泛化能力并非线性对应。研究者需要在数据配方的迭代中引入下游任务探针,尤其当学习目标(生成式或表示学习)不同时,最优数据组合可能变化。VidaForge 的结构化比较为这种多目标权衡提供了可重复的实验框架。
  • VIDAFORGE-3M 数据集强调细粒度标注与筛选信号而非单纯规模,提供 314 万场景级片段、6475 小时视频,并附带相机运动、多级字幕、语义标签和重复关系。与常见的海量弱标注视频数据集不同,它连同可执行代码一起发布,使研究者能够追踪数据从原始视频到训练样本的完整生命周期。这种透明性降低了复现和扩展视频数据配方研究的门槛,也便于社区在相同数据基础上进行公平对比。

方法

VidaForge 方法核心:可执行数据配方工作流

VidaForge 将视频预训练数据配方定义为五阶段可执行工作流,从原始视频池到最终训练集,全程记录每个样本的生产决策。

  1. Ingestion:对原始视频进行 Probe(探测元数据)、Screen(初步筛选)和 Transcode(统一转码),得到标准化视频流。
  2. Segmentation:通过 Detect 场景边界并 Clip 切分为场景级片段,保留时间语义单元。
  3. Selection:结合 Context 信息、Filter 质量/覆盖规则、Dedup 去重和 Select 采样,构成配方的主要变化点(例如 coverage 优先或 quality 优先)。
  4. Annotation:为片段自动生成 Camera 运动标签、多级 Caption 和语义 Tag,提供细粒度元数据。
  5. Packaging:按下游模型需求打包为训练格式,分别适配 Wan 2.1(生成式)和 V-JEPA 2.1(表示学习),示例中通过 NeMo-AutoModel 等工具实现。

该框架的核心创新在于:配方中任何环节的决策参数均可被替换或调整,从而系统地构建变体数据集,同时保留完整的 provenance(每个样本如何产生)。研究者无需重复搭建基础设施,即可直接比较不同数据策略对预训练的影响。

与同类工作相比,VidaForge 是首个将视频数据配方形式化为开放、可执行、可复现工作流的研究基础设施,使数据选择决策与下游模型性能建立因果关联,而非仅仅发布固定数据集。

实验

实验设计

VidaForge 将视频数据配方建模为可执行的五阶段工作流,包括 ingestion、segmentation、selection、annotation、packaging。研究者通过改变某个决策节点构建不同 coverage 与 quality 的配方变体,使用 Wan 2.1(视频生成)与 V-JEPA 2.1(表征学习)进行早期从零预训练,并评估下游 benchmark 分数与训练 loss。

关键发现

在两种学习目标下,更广覆盖(broader-coverage)的配方均取得最高的下游基准分数,而 loss-based 评估则偏好不同配方。这表明单一 loss 指标无法完全反映数据配方对下游任务的影响,需要结合下游性能进行综合判断。

与基线对比解读

论文未直接与外部封闭 pipeline 比较,而是通过不同配方变体的横向对比揭示数据选择的影响。广覆盖配方虽然可能引入更多噪声,但增强了多样性,有利于下游泛化;而高精度、低覆盖配方可能在训练 loss 上表现更优,却牺牲了任务迁移能力。这提醒工程实践:构建视频预训练数据时,不应仅凭 loss 曲线筛选数据配方,需在早期阶段嵌入下游任务探测,并关注数据覆盖度与质量的权衡。

行业影响

落地场景

VidaForge 可作为视频模型数据团队的基础设施,用于:

  • 内容平台构建视频理解 / 审核模型时,快速比对不同数据配方的效果;
  • 电商视频生成产品(如自动广告视频)优化生成质量与数据成本;
  • 自动驾驶、具身智能等需要视频表征学习的场景,利用 VidaForge-3M 的 scene-level 注释加速数据清洗。

商业价值

  • 降本:开源可执行工作流省去重新搭建数据管线的工程投入;
  • 提效:配方可复现、版本化,支持数据假设快速验证,缩短模型迭代周期;
  • 性能提升:实证 coverage 优先配方在下游基准上更优,为数据选择提供决策依据。

接口集成

  • 提供配置驱动的数据配方定义,输出适配 Wan 2.1 / V-JEPA 2.1 的标准化数据集;
  • 注释与 curation signals 可对接数据标注平台、特征存储与实验跟踪工具,嵌入现有 MLOps 流程。

落地 use case:短视频平台用 VidaForge 构建 high-coverage 与 high-quality 两个数据配方,各训练小模型做快速评测,选定最优配方后再全量训练;电商公司则用它测试不同数据配比对视频生成模型语义一致性的影响,并复用多级 caption 提升 prompt 效果。

局限

  • **训练规模与模型覆盖有限**:论文中的实验仅使用 Wan 2.1 和 V-JEPA 2.1 两个模型,在早期从头预训练阶段进行对比,训练步数、数据量和下游任务数量均受限。这限制了结论向更大规模预训练、更多模型架构或更长训练周期的外推能力。作者在摘要和结论中也强调这是初步研究,需进一步扩大规模验证。
  • **数据管道依赖外部模型且可能引入偏差**:VidaForge 的多个阶段(如 segmentation、annotation、captioning)依赖高质量的外部模型(如 Qwen 系列 VLM),这些模型的固有偏差会传递到数据集标注和筛选信号中。此外,数据集来自一个特定的视频池,其领域覆盖和分布可能不代表通用视频数据,影响数据配方研究的普适性。
  • **评估指标相对单一**:论文主要通过损失值和少量下游基准(如 SSv2)比较数据配方,但视频生成和表征学习还需要更多样化的评估维度(如生成质量的人类评估、长视频理解、零样本迁移等)。与工业界闭源管道相比,VidaForge 在数据处理吞吐量和标注多样性上可能仍有差距,需要更多工程优化和社区共建。
论文Yan Ma2026-09-06原文

相关内容