论文

VideoKR: 面向知识和推理密集型视频理解

VideoKR: 面向知识和推理密集型视频理解

我们提出了 VideoKR,这是首个专门为增强知识和推理密集型视频理解而设计的大规模训练语料库。它包含 31.5 万个视频推理示例,涵盖 14.5 万个新收集的、CC 许可的专家领域视频。我们开发了一种人机协同、面向技能的示例生成流程,逐步瞄准更深层次的视频推理能力,同时确保示例及其 CoT 理由 的难度、多样性和可靠性。我们还整理了 VideoKR-Eval,这是一个新的专家标注基准,其中的问题需要真实的视频理解和知识密集型推理,而非文本捷径。 我们的实验表明,在标准的 SFT→GRPO 微调流程下,基于 VideoKR 后训练的模型在知识密集型视频推理方面优于先前的后训练方法,同时在通用视频推理上保持竞争力,这凸显了数据设计是视频推理进展的关键驱动力。我们进一步进行了全面的消融实验,以分离 VideoKR 的贡献,为未来工作提供了可操作的见解。 亮点总结: - 大规模视频推理训练集(31.5 万示例)与专家标注基准。 - 人机协同流程确保示例质量与技能递进。 - 后训练模型在知识密集型推理上取得新最佳。

论文精读

TL;DR VideoKR 是首个专为知识密集推理型视频理解设计的大规模训练语料,通过人工参与的技能导向生成管道构建,显著提升模型在知识视频推理任务上的表现,凸显数据设计的核心驱动力。

问题

问题背景

视频理解正从简单描述向知识密集型推理 (knowledge-intensive reasoning) 演进,要求模型结合领域知识、多步逻辑与时间动态,而不仅是识别对象或动作。

现有方法局限

当前视频训练数据与基准存在三重缺陷:

  • 文本捷径 (textual shortcut):多数视频问答 (VideoQA) 基准可通过单帧或字幕文字正确回答,无需真实理解视频内容,导致评测无法区分浅层匹配与深层推理。
  • 领域知识缺失:主流视频指令数据集(如 VideoChat2-IT、ShareGPT4Video)以日常场景为主,缺少需要专业知识的深度提问与逐步推理示例。
  • CoT 质量不可控:现有合成或自动生成的思维链 (Chain-of-Thought) 缺乏质量保证,常包含错误推理步骤或虚假关联,直接污染训练信号。

技术挑战与重要性

构建知识密集视频推理数据的核心困难在于:

  1. 知识-视频对齐:需确保视频内容真正包含推理所需的知识线索,而非仅凭文本描述即可回答。
  2. 推理深度与多样性:单一数据集难以覆盖从事实检索到因果推断的递进式推理技能,且需要高质量 CoT 标注来引导模型逐步推理。
  3. 评测公平性:现有基准的文本捷径使模型能力评估失真,无法准确衡量在需要跨帧关联与外部知识的情景中的真实表现。 业界正将多模态模型应用于教育、医疗、专业培训等严肃场景,这些场景对可靠的知识推理能力有刚性需求,而数据质量直接决定模型上限。

行业类比

类似自动驾驶需要高精度地图与 corner case 数据,知识密集视频理解也需要专门构建的专家级训练语料(而非通用数据)才能驱动模型从“浅层感知”走向“深层认知”。

核心洞察

  • 数据构建策略比模型规模或训练算法更决定视频推理上限。VideoKR 不依赖更大基座模型或复杂强化学习技巧,而是通过专家领域知识库、技能分级、人机协同生成 CoT 推理链,构建出 315K 高质量训练样本。同类视频理解数据集多侧重于通用描述或简单 QA,缺乏对深层知识调用和逻辑链的显式建模,VideoKR 则以“技能树”方式渐进式覆盖因果、比较、推演等推理类型,证明精细化的数据设计是缩小视频 LLM 与现实复杂推理需求的差距的高效路径。
  • 人工把关的自动化生成流水线为稀缺的高质量推理数据提供了可复制的范式。VideoKR 使用人类专家定义核心技能、审核种子样例并验证最终质量,中间由模型基于规则和筛选大规模生成问题与推理链,既保证了每条数据的难度、多样性和可靠性,又将成本控制在可接受范围。这不同于完全依赖人工标注(昂贵且难以扩展)或纯模型自生成(易产生退化与噪声)的传统方案,该流水线可以迁移到其他需要复杂推理的细粒度任务中,是推理数据工程的一次重要实践。

方法

VideoKR 构建了一个人机协同、技能导向的数据生成流水线,专为知识密集型视频推理设计,核心包括三个模块:

1. 领域知识库与视频收集

  • 输入:专家域的结构化知识源(如教科书、专业文献)。
  • 关键模块
    • Domain Knowledge Bank:抽取概念、关系与场景模板,形成可组合的知识单元,用于后续生成高信息密度的视频查询。
    • Knowledge-Driven Video Search:基于知识库自动生成场景描述,引导从 CC 许可源中检索并过滤视频,最终收集 145K 专家域视频,避免常见视频数据集偏向日常场景的局限。
  • 输出:领域丰富、版权清晰的原始视频池。

2. 技能导向的示例生成

  • 输入:上一步视频池 + 预定义的核心推理技能分类。
  • 关键模块
    • Core Skill Categorization:由人类专家定义视频理解中所需的逐步推理能力(如因果推断、实体识别、跨帧关联等),确保覆盖从浅到深的认知层次。
    • Seed Curation:人类专家为每种技能手写种子 QA 示例,提供规范的 CoT 推理链。
    • Model-based Generation & Validation:利用强模型结合种子与知识库对视频生成候选 QA 对及 CoT 理由,再经自动规则与人工抽检双重过滤,保证难度、多样性与可靠性。
  • 输出315K 视频推理示例,每个示例包含视频、问题、多步推理链(CoT rationales)。

3. 全流程质量控制

  • Human-Validated Model Selection:对流水线中每个生成步骤,人工对比多个候选模型的输出,选定最可靠模型,避免单一模型偏差。
  • Data Contamination Mitigation:通过构造专用测试样本筛查并去除可能泄露评价集特征的训练数据。
  • Manual Quality Assessment:专家定期抽样评估生成的示例与推理链,确保逻辑严密、知识正确。

最终数据集拆分为 VideoKR-SFT-201K(用于监督微调)和 VideoKR-RL-114K(用于 GRPO 强化学习)。

4. VideoKR-Eval 基准

基于同源视频,通过多模型单帧过滤剔除仅凭文本或单图像可回答的样本,再经专家重新标注,形成严格依赖视频与知识的评估集,有效暴露现有模型的浅层捷径。

与同类工作的差异:以往视频推理数据集通常依赖众包或自动模板,难以避免文本先验和领域单一;VideoKR 首次以专家参与、技能导向方式系统构建知识与推理密集的训练与评测资源,并通过严格的人机验证闭环控制质量,弥补了现有数据驱动视频理解研究中“重数据量、轻思维链质量”的缺口。

实验

实验设计

论文采用标准的两阶段后训练管线 SFT → GRPO,在新建的 VideoKR 语料上对视频模型进行监督微调与强化学习优化。

  • 训练数据:VideoKR-SFT-201K(201K 条监督示例)与 VideoKR-RL-114K(114K 条 RL 示例),均由人工辅助流水线生成,覆盖知识密集型视频推理的多元技能。
  • 评估基准:除自建 VideoKR-Eval(专家标注、需真实视频理解与知识推理的题目)外,还选取了多个通用视频理解基准,以验证泛化性。
  • 消融分析:针对 SFT 数据的技能组成、是否使用 CoT 解释、以及 VideoKR 与先前语料的差异设计对照实验,剥离数据方案的贡献。

关键发现

知识推理大幅提升:在 VideoKR-Eval 上,VideoKR 后训练模型显著优于所有先前的后训练方法,证明数据设计是推进视频推理能力的关键驱动。

通用能力保持:模型在一般视频理解基准(如 EgoSchema、PerceptionTest)上的性能保持竞争水平,未出现专门化带来的灾难性遗忘。

数据质量至关重要:消融表明,技能导向的多样组成与 CoT 理由能有效提升模型处理复杂推理的能力,仅使用直接输出或单一技能数据會显著降低效果。

与基线对比的解读

相较于依赖网络大规模图文对或低质量自动标注的先前语料,VideoKR 通过 领域知识库引导的视频采集人工参与的多阶段示例生成,确保了样本的难度、多样性与推理解释的可靠性。实验证实,即使在相同模型规模与训练算法下,精准构造的高质量数据比扩充数据量更能突破视频理解的推理瓶颈,为后续研究提供了可操作的数据策划路线。

行业影响

落地场景

VideoKR 直接赋能知识密集型视频问答、专家领域内容理解与自动化分析。在电商中,可解析产品演示视频并回答复合问题(如“材料是否符合某行业标准”),提升导购与客服质量;在内容平台,可自动为专业频道(科学、历史)生成深层摘要、事实核查与跨视频推理;教育场景则可构建能解释复杂现象、剖析因果链的视频导师;医疗影像分析也可受益于结合领域知识的多步骤推理,而非仅依赖感知。此外,自动驾驶工业检测需从监控视频中推理故障原因或异常事件,VideoKR 提供的训练范式可直接用于提升这类长尾场景的判读鲁棒性。

商业价值

VideoKR 通过提升视频理解模型的知识深度与推理可靠性,在三条线上创造收益:

  • 降本:减少对人工专家审核、标注与疑难解答的依赖,尤其在高价值专业视频处理流水线中,自动化率可显著提升;
  • 增收:在广告匹配、个性化推荐中引入更精准的内容语义标签,提高点击率与转化;
  • 体验提升:用户获得能回答“为什么”和“怎么办”而非仅“是什么”的视频助手,粘性与付费意愿增强。VideoKR 同时提供数据流水线范式,企业可自建垂直领域的知识驱动视频训练集,形成差异化壁垒。

与现有工作流的接口

VideoKR 的SFT→GRPO 后训练方案可直接嵌入主流多模态大模型(MLLM)训练栈。其面向技能的示例生成管线可对接现有数据标注平台,通过人机协同降低标注难度。推理时无需额外架构改动,仅需在训练数据中引入 CoT 思维链与领域知识库对齐。部署方面,可与 LLaVA、Qwen-VL 等开源视觉语言模型集成,微调后通过标准推理引擎上线。

具体用例

  1. 电商直播选品分析:某服装品牌使用 VideoKR 微调模型解析面料工艺视频,自动回答“这件夹克是否适合极寒天气?”——模型需结合视频中面料展示与纺织学知识推理保暖性、防风等级,替代人工客服研判。
  2. 开放式在线课程(MOOC)辅导:在历史纪录片学习中,学生暂停视频提问“该事件的经济背景是什么?”,模型基于画面中的文物、地图与外部知识库进行跨模态推理给出上下文解释,而非仅输出旁白文字匹配。

局限

  • **数据集构建依赖人工编写种子示例与多轮验证**,虽然保证了质量,但成本较高且难以快速扩展到新领域或更大规模。整个管道中的技能分类、示例生成及过滤仍需领域专家深度参与,自动化程度有限,可能限制其在资源受限环境下的可复现性。
  • **实验均基于单一模型家族(Qwen2-VL)进行后训练**,未在其他架构(如 LLaVA-OneVision、InternVideo2 等)上验证效果,泛化能力存疑。真实应用场景中模型和标签分布差异可能导致性能下降,缺少跨模型鲁棒性分析。
  • **VideoKR-Eval 虽然由专家重标注以减少文本捷径**,但视频与问题仍可能隐含视觉统计偏差或语言先验,模型可能利用表面相关性而非真正推理。此外,基准仅包含英文内容,在多语言场景下的知识推理表现未知,且未考察长视频或复杂交互场景下的鲁棒性。
论文Lin Fu2026-06-03原文

相关内容