OmniVideo-100K: 通过结构化脚本和证据链进行音视频推理的数据集
当前自动化音视频问答(QA)管线普遍采用“视频-字幕-QA”范式,但该方法将视频分割为短片段并分别生成音频与视觉模态描述。这种解耦处理割裂了声音与视觉源的固有关联,且独立片段处理常导致同一实体跨片段描述不一致。此外,将长文本理解与QA合成耦合在单一步骤中,往往使模型局限于局部事件,生成的问答缺乏长期时间连接与深层跨模态推理。 为解决上述问题,本文提出一种自动化数据引擎,包含两大机制: 1. 实体锚定视频脚本化(Entity-Anchored Video Scripting):将视频转化为结构化脚本,包含摘要、主要实体列表及片段级音视频描述。实体列表作为全局先验,确保跨片段指代一致性并重建音视频关联。 2. 线索引导的QA生成(Clue-Guided QA Generation):引导模型首先从脚本中挖掘跨片段、多模态线索,继而基于这些高价值线索生成QA对。 基于该管线,我们构建了指令微调数据集 OmniVideo-100K 及人工验证测试集 OmniVideo-Test。在 VITA-1.5、Qwen2.5-Omni-7B 和 Qwen3-Omni-30B 上微调后,模型在 OmniVideo-Test 上性能提升高达 20.59%,并在 Daily-Omni、JointAVBench 等成熟基准上展现出强劲泛化能力(提升高达 12.64%)。
论文精读
TL;DR 通过实体锚定脚本与线索引导生成,构建 OmniVideo-100K 数据集,让音视频 QA 模型具备跨段、跨模态推理能力,在多个开源模型上提升最高 20.59% 性能。
问题
问题背景
当前音视频理解领域正从纯视觉分析迈向全模态联合推理,多模态大模型 需要同时处理视觉、音频及文本,以支撑视频问答、摘要等任务。然而,构建高质量的音视频问答训练数据仍是瓶颈,现有自动化标注管线普遍存在模态割裂与时间一致性问题。
现有方法局限
主流“视频-字幕-QA”范式将视频分割为短片段,独立为视听模态生成描述,带来三个关键缺陷:
- 跨模态关联丢失:音频描述(如“狗叫声”)与视觉源(画面中吠叫的狗)的解耦处理,切断了声源绑定关系,模型无法习得“声音由谁发出”的因果推理。
- 跨片段实体不一致:同一人物或物体在不同片段中可能被赋予不同指代(如“穿红裙的女人” vs “先前说话的女士”),导致长视频中的实体追踪断裂,描述前后矛盾。
- 局部答案主导:将长文本理解与问答生成压缩为单步 LLM 调用,模型倾向于从单个片段内提取信息,生成的 QA 对缺乏需要跨片段、长时依赖的深层推理,如“为什么角色在第三段突然沉默?”这类需要回溯多模态线索的问题极少出现。
为什么这个问题难/重要
技术挑战在于:
- 全局一致性必须显式建模,而非依赖片段级描述的隐式对齐;
- 跨模态线索挖掘需引导模型关注时间轴上分散的视听证据,这对标注成本与自动化策略都是考验;
- 随着 Qwen-Omni、VITA 等全模态模型兴起,业界亟需能激发真正多跳推理能力的训练数据,否则模型只学会表面问答,无法应对复杂场景。
行业类比
该问题类似:从散乱拍摄素材自动生成一部连贯的电影剧本,并据此设计需要观众综合视听记忆的“深度观影题”——远比仅从单镜头图片出题更具挑战。
核心洞察
- - **实体锚定的视频脚本化** 通过全局实体列表统一跨片段描述,并显式关联音频与视觉源,解决了传统分段式描述的音视觉割裂和实体不一致问题。 与现有将视频分割后独立生成各模态描述的方法相比,此机制将实体列表作为全局先验,确保同一实体在视频各片段中描述一致,并重建了声音与视觉对象之间的对应关系,从数据生成源头提升了跨模态和长时序推理的质量。
- - **线索引导的问答生成** 将跨片段多模态线索挖掘与问答生成解耦,先提取高价值线索再生成问题,显著提升了问题的长期时间连接和跨模态推理深度。 现有的“视频-描述-问答”框架通常将长文本理解与问答生成耦合,导致模型只关注局部事件,问题缺乏长时序依赖。本方法先让模型基于结构化脚本挖掘全局线索,再基于这些线索生成问答对,使生成的问题能覆盖视频整体叙事并进行深层跨模态推理,从而提升了指令数据的训练价值。
方法
整体流程
输入原始音频-视觉长视频,经两阶段自动化数据引擎生成高质量问答对。
关键模块
1. Entity-Anchored Video Scripting(实体锚定视频脚本化)
- 输入: 长视频(含音频与视觉流)。
- 处理: 首先检测并提取主要实体 (人物、物体等),构建全局实体列表作为跨片段一致性先验。视频被分割为片段,对每个片段同步生成音频描述和视觉描述,并强制与实体列表指代对齐,重建音视关联。最终输出结构化脚本:全局摘要 + 实体列表 + 片段级音视描述。
- 目的: 解决传统独立片段处理导致的实体描述不一致与音视解耦问题。
2. Clue-Guided QA Generation(线索引导问答生成)
- 输入: 上述结构化脚本。
- 处理: 先提示模型挖掘跨片段、多模态的高价值线索(如实体行为演变、音视事件因果链),构建证据链;再基于这些线索生成问答对。
- 输出: 需要长期时间推理与深层跨模态推理的 QA 对,用于指令微调。
输出数据集
构建 OmniVideo-100K 训练集与人工验证的 OmniVideo-Test 测试集。
与同类方法差异
传统“video-caption-QA”将描述生成与问答生成耦合在单步,导致局部化问题与音视割裂;本方法通过实体锚定脚本化构建全局一致先验,并解耦出线索挖掘步骤,生成更具推理深度和长期一致性的音频-视觉问答训练数据。
实验
实验设计
实验选取三类主流视听大模型进行指令微调:VITA-1.5、Qwen2.5-Omni-7B 和 Qwen3-Omni-30B。微调数据为自动构建的 OmniVideo-100K,评测集合包括自构人工校验的 OmniVideo-Test 以及两个公开基准 Daily-Omni 和 JointAVBench。核心验证目标有二:
- 结构化脚本与线索引导的 QA 生成能否提升视听推理能力;
- 同一数据管线对不同规模模型的泛化适应性。
关键发现
- 一致且显著的性能跃升:在 OmniVideo-Test 上,三个微调模型相对其基座分别获得最高 20.59% 的性能增益,说明数据集有效注入了长时序跨模态推理信号。
- 强泛化至已有基准:在未参与训练的 Daily-Omni 与 JointAVBench 上,性能提升最高达 12.64%,证明所学推理模式并非过拟合于特定领域。
- 消融分析佐证管线有效性:论文在 3.2 节设计了多组消融,证实 Clue-Guided QA Generation 和 Main Entity List 对最终效果均有不可或缺的贡献,移除任一组件均导致性能明显下降。
与基线对比的深度解读
传统“视频-字幕-QA”管线存在两大痼疾:一是音视频分离处理割裂了自然的声音-源头关联;二是独立片段生成字幕导致同一实体跨片段描述不一致。这些缺陷使合成的 QA 对大多局限于局部事件,缺乏长期时序依赖和深层跨模态推理。
本文通过 Entity-Anchored Video Scripting 引入实体列表作为全局先验,强制跨片段指代一致并重建音视频关联;再以 Clue-Guided QA Generation 先将脚本中的跨片段、多模态线索显式挖掘出来,再依据高价值线索生成问答对。这一流程从根本上将 QA 合成的焦点从“描述片段”拉升至“串联证据链”。实验结果中大幅超越基线的得分,正是对这种结构化推理供给的直接反馈,也暗示未来视听数据的自动标注不应停留在浅层描述,而需主动构造可组合的证据实体。
行业影响
落地场景
OmniVideo-100K 赋予模型对长视频的音视频跨模态推理能力,直接推动以下产品升级:
- 视频理解平台:如视频检索、内容审核、版权检测等场景,通过结构化脚本可定位到具体片段,并基于多模态线索生成更精准的标签或问答对。
- 智能教育:自动为教学视频生成“证据链”式问答,辅助学生定位复杂过程的因果步骤。
- 交互式媒体:在直播、点播服务中嵌入实时问答,提升用户参与度(如根据当前画面与声音提供剧情推理)。
- 工业巡检与安全:监控录像的异常事件检测,需要关联声音(警报、撞击声)与视觉证据,本数据集训练的模型可输出完整事件链报告。
商业价值
- 降本:该自动化数据引擎替代了人工标注多模态视频问答对的昂贵流程,Entity-Anchored Video Scripting 保证了片段间实体一致性,Clue-Guided QA Generation 则挖掘跨片段、跨模态线索,使合成数据质量接近人工,大幅降低数据生产成本。
- 增收与体验:强化了 MLLM 的长期关联推理能力,产品可提供更“聪明”的问答服务,直接提升用户留存与付费意愿;例如视频平台的智能解说功能,能根据完整上下文回答“为什么这个人现在笑了?”这类深层问题。
- 通用性:在 VITA-1.5、Qwen2.5-Omni 等领先模型上均能显著提升性能(最高 20.59%),并可泛化到 Daily-Omni、JointAVBench 等公开基准,说明该数据集可作为即插即用的指令微调增强剂,快速提升已有产品的音视频推理水平。
与现有产品 / 工作流的接口
- 训练管线集成:数据集以指令调优格式提供,可直接追加到现有 MLLM 的训练数据中。脚本结构(摘要、实体列表、片段描述)可作为中间表示,方便与检索增强生成(RAG)或知识图谱结合。
- 推理增强:已微调模型可在推理时输出结构化证据链,便于下游任务做可解释性展示或人工校验。
- 实时处理适配:实体锚定的脚本生成方法可改造为流式版本,用于处理直播视频,持续维护全局实体状态,为每一段实时生成连贯描述和问答。
具体落地 Use Case
全球视频云平台:集成至 PaaS 层的媒体智能服务,客户上传长视频后可自动产生产品评测、赛事集锦的交互式 Q&A,用户点击问题即可跳转到答案片段,提升观看时长与广告收益。系统利用 OmniVideo-100K 微调的模型,能准确回答“当解说员提到‘关键进球’时,屏幕上发生了什么?”这类复杂问题。
智能驾驶数据标注:自动驾驶录像同时包含视觉(道路状况)与音频(引擎声、喇叭、紧急车辆警报),需要关联两者以训练端到端模型。使用该数据引擎生成大量“警报声响起时,前方出现了什么?”的问答对,作为感知-决策模型的预训练信号,提高对关键事件的推理准确率,降低事故风险。
局限
- **自动化管道依赖大模型能力边界**:Entity-Anchored Video Scripting 和 Clue-Guided QA Generation 均依赖大规模多模态模型(如 Qwen-VL-Max/Audio 系列)进行脚本生成与线索挖掘。若上游模型在长视频事件理解或细粒度跨模态对齐上存在不足,错误会传播至生成的脚本和问答对,影响数据集质量。论文未系统分析这种级联误差的比例及对下游微调的影响。
- **数据集多样性与覆盖范围有限**:OmniVideo-100K 仅包含 86K 视频,且未明确说明视频来源的分布(如不同时长、场景、声音类型的比例)。相比一些百万级视频理解数据集,其规模较小,可能限制模型在长尾场景(如罕见音画事件组合)上的泛化。人类验证的测试集仅约 1K 例,虽可保证标注质量,但规模不足以严格评估细粒度表现。
- **评估维度尚未覆盖端侧与实时场景**:实验仅在 VITA、Qwen2.5-Omni/3-Omni 等大型模型上微调评估,未探索小模型(<3B)或多模态检索器。此外,基于脚本的 QA 生成天然引入推理成本,未讨论在实际部署中长视频预处理和 QA 生成的延迟,限制了该流水线在低资源或实时交互场景下的适用性分析。