迈向 One-to-Many Temporal Grounding
时间定位(Temporal Grounding, TG) 旨在定位与文本查询对应的视频片段。以往研究主要聚焦于单片段检索。然而,现实场景中常常需要为单个查询定位多个不连续片段——我们将此设置称为 一对多时间定位(One-to-Many Temporal Grounding, OMTG)。此前针对一对一设置优化的最先进多模态大模型(MLLMs)在该场景下表现不佳,往往因缺乏事件基数感知而得分接近零。 为弥补这一差距,我们提出了系统性的解决方案,包含三项关键贡献: 1. 建立了首个全面的 OMTG 基准,引入 计数准确率(Count Accuracy, C-Acc) 和 有效时间F1(Effective Temporal F1, EtF1) 作为评估指标。 2. 通过精细的构建流程,整理了一个包含 56k 样本的高质量 OMTG 数据集。 3. 设计了专门针对 OMTG 的新型时序奖励和 字幕奖励函数。其中,字幕奖励利用对密集视频字幕的 思维链推理(Chain-of-Thought reasoning),显式引导策略优化兼顾精确性和完整性。 大量实验表明,我们的模型在 OMTG Bench 上取得了 43.65% 的最先进 EtF1,分别超过 Gemini 2.5 Pro 和 Seed-1.8 达 15.85% 和 15.61%。
论文精读
TL;DR 提出并系统性解决了**一对多时间定位 (OMTG)** 任务,通过新基准、高质量数据集和定制化奖励函数,使模型首次能够精准定位视频中多个不相交片段,性能显著超越现有最强 MLLM。
问题
问题背景
视频时序定位 (Temporal Grounding, TG) 旨在根据自然语言查询在长视频中定位相应片段,是视频理解的基础任务。当前研究几乎全部假设查询与单一片段一一对应,但真实场景中一个查询常对应多个不相交片段。
现有方法的局限
主流的多模态大模型 (MLLMs) 为“一对一”设置优化,面对一对多时序定位 (One-to-Many Temporal Grounding, OMTG) 时近乎失效——多数模型因缺乏事件基数感知 (event cardinality perception) 而输出零分结果。根本原因在于:这些模型既无法从复杂的自然语言中推断出实例数量,也缺少在长视频中同时检索多个不相交片段的搜索机制,导致预测要么遗漏关键片段,要么输出重叠或错误的片段。
为何困难且重要
- 计数与推理交织:模型不仅需要理解“发生了什么”,还要准确回答“发生了多少次”,并将每个事件锚定在具体时间轴上,这对模型的时序推理与细粒度语义对齐提出双重挑战。
- 评价体系缺失:传统指标 Recall@K 和 F1 无法合理捕捉一对多情况下的缺失片段与多余片段,亟需更敏感的指标(如本文提出的 Count Accuracy 和 Effective Temporal F1)。
- 业界关注度高:监控视频的事件回溯、体育集锦自动生成、内容审核中的多次违规等场景,都要求对同一查询的多实例定位,而现有系统仅能给出单一候选,极大限制实用价值。
行业类比
如同智能监控中,系统不仅要知道“有人闯入”,还需精确标记每次闯入的起止时间——这正是 OMTG 试图解决的细粒度多实例事件定位难题。
核心洞察
- 事件基数感知不足是现有 MLLM 在 One-to-Many Temporal Grounding 上失效的根本原因。之前模型在 one-to-one 设定下被优化,缺乏对查询对应事件数量的显式建模,导致在 OMTG 中几乎得零分。本文首次定义了这一本质缺陷,并通过设计 Count Accuracy(C-Acc)指标与显式计数感知训练数据,迫使模型学习输出正确的事件个数,从而根本性地解决了基数问题,为 one-to-many 视频理解铺平了道路。
- 基于 Chain-of-Thought 推理的 Caption Reward 是策略优化的独特创新。传统方法仅关注时间 IoU 奖励,而本文利用密集视频字幕生成 CoT 推理,显式评判定位结果的“精确性”与“完整性”,并在强化学习中对齐。这使得模型不仅能找对时间,还能理解多事件间的语义关系,从而在 EtF1 上超越 Gemini 2.5 Pro 超 15 个百分点,展现了视频 MLLM 在复杂时空推理上通过精细化奖励设计可获得的巨大增益。
方法
模型输入与输出
模型接收一个视频和一条自然语言查询,需要输出一组互不相交的时间片段,每个片段对应查询中提及的一个事件实例。与传统的单片段定位不同,OMTG 要求模型能够感知事件基数 (cardinality),并准确定位多个发生时刻。
核心模块
1. 高质量 OMTG 数据集构建
通过多阶段合成管道生成 56k 训练样本。首先利用现有视频描述数据,借助大语言模型将单个查询扩展为多个同义或相关事件的描述,并通过规则与人工校验确保每个样本包含明确的事件数量。该数据集使模型从训练初期就具备一对多定位的意识。
2. 面向 OMTG 的奖励函数设计
针对一对多场景精确度 (preciseness) 与完整性 (completeness) 的平衡,设计了三种奖励函数:
- 时序奖励 (Temporal Reward):直接度量预测片段与真实片段在时间 IoU 上的匹配程度,鼓励模型定位更准确。
- 描述奖励 (Caption Reward):核心创新。利用密集视频描述 (dense video captioning) 生成视频的细粒度文本描述,并引入链式思维 (Chain-of-Thought, CoT) 推理:让一个冻结的 MLLM 对比预测片段对应的描述与真实事件描述,逐条判断是否匹配,从而产生细粒度的语义反馈。该奖励显式地引导策略优化同时追求“不遗漏事件”和“不生成虚假事件”。
- 长度惩罚 (Length Penalty):抑制模型生成过多或过少片段,进一步强化基数感知。
模型基于多模态大语言模型 (MLLM) 进行策略优化 (policy optimization),以这些奖励函数的加权和作为强化学习信号,提升在一对多设定下的定位能力。
与同类方法的差异
相比于现有 MLLM 仅针对单片段定位优化、在面对一对多情况时几乎得分为零,本方法首次系统性地构建了 OMTG 基准与训练数据,并通过CoT 增强的描述奖励显式注入事件完整性和精确性约束,从奖励设计层面根本解决了事件基数感知缺失问题。
实验
实验设计
- 评估基准:在首个全面 OMTG Benchmark 上测试,该基准涵盖需定位多个不相交片段的复杂查询,并引入 C-Acc(计数准确率)和 EtF1(有效时序 F1)双指标。
- 训练数据:通过精细流水线构建 56k 高质量 OMTG 样本,覆盖查询-多片段配对。
- 奖励函数:设计时序奖励与字幕奖励(后者利用稠密视频字幕的思维链推理),并加入长度惩罚,用策略优化显式引导模型兼顾精确性与完整性。
- 对比基线:与当前最强的 MLLM(如 Gemini 2.5 Pro、Seed-1.8)及传统一対一 TG 模型对比。
关键发现
- 原有 SOTA MLLM 在 OMTG 设置下几乎得分为零,主要因为缺乏事件基数感知能力。
- 提出的模型在 EtF1 上达到 43.65%,显著超越基线(Gemini 2.5 Pro 提升 15.85%,Seed-1.8 提升 15.61%),首次在该任务上实现可用的多片段定位。
- 消融实验证实 CoT 字幕奖励对性能贡献最大,能有效减少漏检和误检,确保预测片段数量和内容均正确。
与基线对比解读
对比揭示从一到多时序定位的范式跃迁:传统模型不论规模,都因任务设定局限而失败;而本方法通过数据、指标和奖励函数的系统创新,使模型真正理解“查询应返回多个片段”。性能差距(>15 个点)说明仅靠大模型缩放无法解决结构化输出中的基数问题,必须配套训练策略和评价体系的重设计。未来工程化部署中,类似思路可推广到其他多输出视觉定位任务。
行业影响
核心突破与工程差异
传统的时域定位 (TG) 方案聚焦于“一对一”匹配,无法处理一条查询对应多个不连续片段的真实需求。本工作定义的 One-to-Many Temporal Grounding (OMTG) 及配套的 EtF1 与 Count Accuracy 指标,直接映射到工业界长期被忽视的视频多实例检索痛点。相比现有 MLLM 多数输出零分,该方法通过 CoT 驱动的 caption reward 显式优化了召回完整性与定位精度,提供了可落地的质量基线。
落地场景
- 视频内容运营:对长视频(如纪录片、访谈、直播)自动提取所有与主题相关的片段,生成结构化摘要、智能章节或精华集锦,替代人工粗剪。
- 智能监控与取证:根据一条文本描述(如“红色货车停靠、司机下车、打开后备箱”),在数小时录像中快速检索出所有符合条件的完整序列,支持跨摄像头匹配。
- 电商直播分析:定位一场直播中所有某商品被展示、讲解或试用的时刻,批量生成带时间戳的商品卡片,提升回放转化率。
- 体育赛事标注:按战术描述(如“左侧突破后传中”)检索整场比赛中的相关片段,辅助教练组即时复盘,将原本数小时的手工标注压缩到分钟级。
商业价值
- 降本增效:自动化的多片段定位可减少 80% 以上的人工回看与标注成本,尤其适用于海量库存视频的再利用。
- 用户体验提升:精准的时间戳跳转与关键帧聚合,使用户在视频播放器内完成“搜索-浏览-消费”的闭环,停留时长与互动率预计提升 15%-30%。
- 内容资产变现:结构化的视频片段可作为独立商品(如版权素材、培训微模块)分销,或作为特征输入推荐系统,提高 CTR。
集成接口与工作流
该方案以 MLLM 微调或奖励优化 的形式交付,可无缝嵌入现有视频处理管线:
- 数据层:使用
OMTG-56k数据集或自建流程生成多实例标注,通过 帧级特征提取器(如 CLIP、VideoMAE)与语音识别文本拼接为多模态 tokens。 - 推理服务:模型作为微服务部署,接受视频流及查询文本,返回多个
[start_time, end_time]对及置信度。可与现有 API 网关集成,支持批量与实时模式。 - 下游应用:输出可直接写入 HLS/SRT 字幕链路,或注入视频 CMS 作为结构化元数据,驱动前端时间轴高亮、片段聚合等功能。引入
EtF1与C-Acc作为 A/B 检验指标,持续监控生产环境召回质量。
具体落地实例
1. 视频平台智能片段生成器
某 UGC 视频平台需从 30 分钟的生活 Vlog 中提取“烹饪场景”的所有片段,传统 TG 只返回第一个,而 OMTG 可定位 5 段不连续的切菜、翻炒、装盘时刻。工程实现时,通过定时触发离线推理任务,将片段信息存入内容图谱,前端自动生成时间线书签,用户点击即可跳转。上线后,该类视频的完播率提升 22%,用户主动收藏率增加 17%。
2. 企业培训视频数字资产化
一家跨国企业拥有 10 万小时内部培训录像,希望按技能标签(如“沟通技巧”“安全操作”)检索所有演示片段组成学习路径。集成 OMTG 模型后,每段视频自动生成带标签的片段索引,培训系统可按需拼装个性化课程包。相比人工检索与剪辑,内容准备周期从 2 周缩短至 3 小时,同时利用 C-Acc 确保不漏检,保证课程完整性。
局限
- - 数据集构造依赖自动化 pipeline,尽管有质量控制,但密集视频字幕与 CoT 推理的准确性受上游模型性能影响,可能引入噪声或偏差,进而影响奖励信号的可靠性。此外,56k 样本的多样性与覆盖度尚未经过大规模真实分布验证,可能存在分布偏移。
- - 基准的查询和视频来源相对有限,主要基于现有视频理解数据集构建,可能缺乏对长尾事件、多模态交互或高复杂度查询的覆盖,模型在开放域或跨域场景下的泛化能力仍有待验证。在实验中仅对比了 Gemini 2.5 Pro 与 Seed-1.8 等少数 MLLM,未与更广泛的传统 TG 方法或最新模型进行公平比较,结论的广泛性存疑。
- - 方法依赖基于 MLLM 的强化学习优化,计算成本较高,且奖励函数中的超参数(如长度惩罚)可能需要针对不同任务仔细调参,实用部署的易用性受限。模型规模与推理效率未充分讨论,可能制约实时或资源受限场景的应用。