论文

LAION-BVD: 一个千万小时级开放视频数据集,用于多模态预训练

LAION-BVD: 一个千万小时级开放视频数据集,用于多模态预训练

LAION-BVD 是一个面向多模态学习的大规模开放视频数据集,包含从 CommonCrawl 收集的 13 亿条平台特定视频 URL。我们从中下载了 80M 个视频,总时长达到 1000 万小时。该数据集专为跨视频、音频和图像模态的多模态预训练而设计。 利用内容感知场景检测,我们提取视频片段,并为其合成生成视频和音频描述。基于这些数据训练的模型在标准视频-文本和音频-文本基准上取得了具有竞争力的性能,且随着训练规模或模型规模的增大,性能持续提升。 此外,我们探索了将视频帧作为图像-文本数据的替代来源,通过提取场景变化帧实现。这些帧展现出与标准网页图像语料库不同的视觉分布,基于该数据集训练的模型在图像-文本检索任务上取得了强劲的性能。 我们将 LAION-BVD 开源给研究社区,以前所未有的规模显著扩展了多模态视频的开放访问。

论文精读

TL;DR LAION-BVD 开源 10 百万小时视频数据集,支持视频、音频、图像多模态预训练,结合合成字幕与场景检测,在多个基准上取得竞争性能,规模空前。

问题

问题背景

多模态预训练领域,视频、音频、图像与文本对齐是核心方向。大规模开放数据集是推动模型能力的关键,但现有资源严重不足。

现有方法局限

当前主流视频-文本数据集如 WebVid-10M、HowTo100M 存在以下问题:

  • 规模有限:通常只有百万级视频片段,总时长远低于十亿级图像-文本对。
  • 模态覆盖单一:多数数据集仅覆盖视频+文本,缺少音频或与原视频同步的音频描述,难以进行音视频联合学习。
  • 字幕质量参差:依赖人工标注或 ASR 转录,噪声大、描述颗粒度粗,难以支持细粒度时空对齐。
  • 开放许可受限:部分大规模数据集来自 YouTube 等平台,存在版权与分发限制,阻碍复现与扩展。

为什么这个问题难/重要

构建 10M 小时级开放视频数据集面临多方面的技术挑战:

  1. 数据采集与清洗:从 CommonCrawl 中筛选 1.3B 视频 URL,需要高效去重、验证可用性并过滤低质/重复内容,索引与存储开销巨大。
  2. 场景切分与描述生成:内容感知场景检测需在长视频中准确找到语义片段,合成视频/音频字幕要求多模态理解模型本身达到足够水平,否则错误会传播到下游。
  3. 跨模态对齐:视频帧、音频流、文本描述需在时间上对齐,训练时还要处理不同采样率和序列长度,计算资源与数据管道复杂度高。

业界高度关注大规模视频数据集,因为视频包含丰富的动态信息、音频线索和连续视觉变化,是通向通用多模态智能的重要数据来源。开放可获取的数据集能显著降低研究门槛,加速视频理解与生成模型迭代。

行业类比

类似 Common Crawl 之于语言模型,LAION-BVD 试图成为视频领域的开放式基础数据源:若文本预训练依赖海量网页文本,则视频预训练急需一个可自由获取、规模相当的视频-音频-文本语料库。

核心洞察

  • LAION-BVD 以 10M 小时视频、80M 个视频、1.3B 条 URL 的规模,构建了目前最大的开放多模态视频数据集之一,同时覆盖视频、音频和图像三种模态。相较于 HowTo100M(136M 视频片段)和 WebVid-10M(10M 视频文本对),其规模和信息密度显著提升;且数据全部来自 CommonCrawl 的广泛抓取,避免了领域偏置,为研究大规模多模态预训练提供了坚实的开放基准。
  • 采用内容感知场景检测提取片段,并为视频和音频分别合成字幕,绕开了人工标注的高成本与 ASR 转写的噪声问题。与多数视频数据集仅提供视觉文本对或依赖自动语音识别生成弱标签不同,LAION-BVD 的合成字幕能够同时描述视觉动作和音频事件,强化了跨模态对齐信号,使模型在视频-文本和音频-文本检索任务上均取得有竞争力的表现。
  • 从视频中提取场景变化帧作为图像-文本数据,观察到其视觉分布与标准网页图像语料存在显著差异(如动态模糊、非典型视角、复杂背景)。这一做法突破了传统图像预训练数据来源的局限,为模型注入更多样化的视觉概念,实验证明仅用该数据训练即可在图像-文本检索上达到强性能,表明视频帧是大规模图像预训练的有效补充。

方法

输入:从 CommonCrawl 收集 1.3B 平台特定视频 URL,下载 80M 视频,总时长约 10M 小时。

关键模块:

  • 内容感知场景检测:将视频切分为语义连贯的片段,去除冗余,同时提取场景切换帧用于图像模态。
  • 合成 caption 生成:对视频片段,用视觉-语言模型生成视频描述;对音频流,用音频-语言模型生成音频描述。避免人工标注,保证规模与一致性。
  • 多模态对齐:视频帧、音频、文本通过对比学习目标对齐;场景帧作为图像-文本对补充。

输出:多模态预训练数据集,包含 video-text、audio-text、image-text 三元组,可用于视频-文本检索、音频-文本检索及图像-文本检索模型的预训练。实验显示训练/模型规模扩大时性能持续提升。

与同类方法差异点:LAION-BVD 是首个以 10M 小时规模同时覆盖三模态的开放视频数据集,且合成 caption 与场景帧提取策略使其在数据分布上显著区别于 WebVid、HowTo100M 等既有视频语料。

实验

实验设计

LAION-BVD 实验围绕 多模态预训练 展开:从 CommonCrawl 收集 1.3B 个 platform-specific URLs,下载 80M 个视频,总时长 10M 小时。利用 content-aware scene detection 切分 clip,并合成视频和音频 caption。模型在标准 video-text 和 audio-text benchmark 上评估;同时提取 scene-changing frames 作为图像文本数据源,用于 image-text retrieval 实验。

关键发现

  • 模型规模或训练量增大时,性能持续提升,无饱和迹象。
  • 视频帧分布与传统网络图像语料不同,却能取得强 image-text retrieval 性能,说明帧数据可作为图像预训练的有效补充。
  • 数据集规模达 10M 小时,显著扩展开放多模态视频数据访问。

与基线对比

摘要未给出具体数值,仅称达到 competitive performance。与现有大规模视频数据集相比,LAION-BVD 强调 平台级 URL 收集、合成 caption、覆盖视频/音频/图像三模态;工程上值得关注其可扩展的采集与过滤 pipeline。

行业影响

落地场景

LAION-BVD 适用于需要视频-文本、音频-文本、图像-文本联合理解的产品与业务,如视频平台的内容搜索与推荐、自动生成视频摘要/字幕、视频问答、内容审核、电商商品视频理解、在线教育视频索引、企业知识库视频检索。开放数据集降低获取大规模多模态训练数据的门槛,尤其适合中小团队构建垂直领域多模态模型。

商业价值

  • 降本:合成 caption 替代人工标注,省去大量标注费用;开放数据减少自建数据采集成本。
  • 提效:10M 小时视频规模支持从头预训练,避免依赖昂贵专有 API;模型在标准基准上随规模提升,带来直接性能收益。
  • 增收/体验:更精准的视频搜索、推荐和自动描述,提升用户粘性与转化;视频帧作为图像数据补充,可改善图像检索多样性。

与现有产品/工作流的接口

可作为 PyTorch / Hugging Face Datasets 直接加载的预训练数据集;通过 video_url 元数据可结合自有下载与内容感知场景检测管线提取片段。合成 caption 可用现有模型(如 BLIP、Whisper)生成,与主流训练脚本兼容。支持分布式训练,需重点处理视频解码与存储开销。

具体 Use Case

  1. 全球视频流媒体平台:使用 LAION-BVD 预训练视频-文本模型,自动为 UGC 视频生成多语言描述,提升搜索召回与推荐相关性。
  2. 电商商品视频:从商品演示视频中提取关键帧与音频描述,训练跨模态检索模型,实现“以图搜视频”和“以文搜商品”,改善转化率。

局限

  • **版权与合规风险**:数据集从 CommonCrawl 抓取视频 URL 并下载视频,可能包含大量受版权保护的内容,发布大规模视频数据集面临法律与伦理挑战。论文未明确说明版权审查机制,此前 LAION 系列数据集已因版权问题受到质疑。此外,原始视频中可能含有不当内容或隐私信息,自动过滤难以完全保证安全。这些因素限制了该数据集在工业界的直接使用,下游开发者需自行承担合规风险。
  • **合成字幕质量瓶颈**:视频和音频字幕通过自动语音识别、图像/视频字幕模型等合成生成,这些模型本身存在误差、偏见与幻觉,生成的字幕可能包含噪声或不准确描述。虽然论文报告了在标准基准上的竞争性表现,但合成字幕的质量上限可能低于人工标注,限制了模型在精细理解任务(如时间定位、细粒度问答)上的潜力,且噪声可能影响预训练模型的稳健性。
  • **数据多样性与分布偏差**:数据源自 CommonCrawl,可能过度代表特定语言、地区或内容类型,对低资源语言、长尾场景及非英语内容的覆盖不足。同时,视频的时长、分辨率、主题分布可能存在系统性偏差,这会影响模型在下游任务上的泛化能力。与精心策划的小规模数据集相比,LAION-BVD 的多样性未经严格校准,可能加剧预训练模型的偏见。
论文Andreas Hochlehnert2026-08-25原文

相关内容