论文

TempCloze: Video-LLMs 能否识别缺失的中间片段?

TempCloze: Video-LLMs 能否识别缺失的中间片段?

针对 Video-LLMs 的时序推理基准往往以语言为中介,选项措辞、答案相关性或语言先验都可能为模型提供语言捷径。为减少这类捷径,我们提出 TempCloze,一个用于评估 Video-LLMs 视觉时序推理能力的视频填空基准。 给定一段视频的起始片段与结束片段,模型需要从四个候选中找出真正缺失的中间片段。TempCloze 包含来自七个来源、经过精心筛选的 1,521 段视频,以长镜头视频与第一人称视角视频为主。我们沿三个维度构造同源干扰项: 1. Semantic(语义):考察应当发生什么事件; 2. Alignment(对齐):探查该事件应在何时发生; 3. Progression(进展):测试事件应如何展开。 同时,共享的场景与物体削弱了外观线索。 我们对 10 个闭源与 21 个开源 Video-LLMs 的评估显示,Alignment 是主要瓶颈:模型通常能识别合理的语义内容与局部事件进展,却难以完成时序对齐。我们进一步在 TempCloze-Mixed 与 TempCloze-Hard 上对四个代表性模型开展错误模式与行为敏感性分析,考察错误从何而来,以及候选顺序、上下文方向、可见跨度、帧密度与 test-time scaling 如何影响模型的选择。

论文精读

TL;DR TempCloze 用视频完形填空评测 Video-LLM:给定首尾片段,从四个同源候选找缺失中间段,分离语义、对齐、进展三类干扰;发现对齐是主要瓶颈,模型常能识别语义内容却难判时间位置。

问题

问题背景

Video-LLMs 在视频理解领域快速迭代,时间推理能力成为衡量其视觉智能的关键维度,业界持续关注如何可靠评测这一能力。

现有方法局限

当前视频时间推理基准大多以语言为中介,如视频问答或多选 QA。这类评测无法排除语言捷径:模型可利用选项措辞、答案分布或语言先验直接作答,而不必真正理解视频时序。例如,干扰项与正确答案在语义上差异过大,模型凭语言模型先验即可选出;或答案与问题中的关键词高度相关,无需观看视频。此外,许多基准采用跨源干扰项,候选片段来自不同视频,外观差异明显,模型仅靠场景和物体外观就能判别,而非依赖时间推理。这些设计缺陷使基准难以暴露模型在视觉时间推理上的真实短板,也阻碍了对模型能力的准确量化。

为什么这个问题难/重要

构建不受语言捷径影响的评测,要求干扰项与正确项共享相同场景和物体,仅在“发生了什么”Semantic、“何时发生”Alignment、“如何发生”Progression 三个维度产生差异。视频时间推理的本质挑战在于模型必须从长距离帧序列中捕捉事件的时序依赖,同时抑制外观和语言先验。实测 10 个闭源与 21 个开源 Video-LLMs 后,Alignment 成为主要瓶颈:模型能识别合理语义和局部事件进展,但对“事件发生的具体时刻”不敏感。这对视频编辑、异常检测、具身智能等需要时序精度的应用场景构成直接工程风险。

行业类比

类似自动驾驶预测中不仅要识别物体类别,还要准确判断其运动时序,差一帧都可能影响决策安全。

核心洞察

  • TempCloze 将视频时序推理评估从语言问答转向视觉完形填空,通过要求模型从四个候选中识别缺失的中间片段,直接考察视觉时序理解而不依赖语言描述。其独特之处在于消除了选项措辞、答案相关性等语言捷径,弥补了传统 Video QA 基准可能被语言先验污染的缺陷。
  • 同源干扰项的三维度设计(语义、对齐、进展)将时序推理分解为可独立诊断的子任务,揭示了对齐是当前 Video-LLMs 的主要瓶颈。与传统基准仅报告总体准确率不同,TempCloze 能够区分模型是选错事件类型、选错时间点还是选错演变方式,为模型改进提供精确方向。
  • 行为敏感性分析表明模型选择对候选顺序、上下文方向、可见跨度、帧密度和测试时缩放等因素高度敏感,这提示现有 Video-LLMs 的时序推理能力并不稳健。该发现挑战了静态基准评估的可靠性,强调在部署前需进行鲁棒性测试,以避免实际应用中因输入微调而性能波动。

方法

输入与任务定义

TempCloze 将视频时序推理问题形式化为 视觉完形填空:给定同一视频的 起始片段 与 结束片段 作为上下文,模型需要从四个候选片段中识别出真实缺失的 中间片段。输入仅依赖视觉内容,避免语言中介。

关键模块

  1. 数据过滤与片段切分:从七个来源收集视频(以长镜头、第一人称自我中心视频为主),经过人工/规则过滤,保留连续动作、无明显剪辑、时序关系清晰的样本。每个视频被均匀或按事件边界切分为三段:开头、中间、结尾;中间段作为正确目标,其余两段作为上下文。

  2. 同源干扰项生成:候选干扰项并非外部随机采样,而是与正确中间段共享场景和物体,以降低外观捷径。按三个维度构造:

    • Semantic:替换为同一场景下“不该发生”或“其他可能事件”,考察模型对事件语义的判断;
    • Alignment:保持事件语义不变,但将事件发生的时间提前或延后,考察“何时发生”;
    • Progression:保持事件内容,但打乱内部动作顺序或改变演化方式,考察“如何展开”。
  3. 评估设置:模型输入包括起始/结束帧或片段以及四个候选片段,以多项选择方式输出选择。评测覆盖 10 个闭源与 21 个开源 Video-LLM。进一步构建 TempCloze-Mixed 与 TempCloze-Hard 子集,用于错误模式与行为敏感性分析(候选顺序、上下文方向、可见跨度、帧密度、测试时推理规模)。

输出与主要发现

输出为各模型的 准确率,发现 Alignment 是主要瓶颈:模型能识别合理的语义内容和局部事件推进,但在时间对齐上出错明显。

与同类方法的差异点:现有视频时序推理基准多以自然语言问题或选项作为中介,容易引入语言捷径;TempCloze 通过视觉片段级别的完形填空,并构造同源干扰项,将评估重点从语言理解转移到纯视觉时序推理。

实验

实验设计

TempCloze 从 7 个来源收集 1,521 个长镜头 / 自我中心视频,保留起止片段作为上下文,要求模型从 4 个候选中间片段中识别真实缺失段。构造同源干扰项沿着三个维度:Semantic(应该发生什么事件)、Alignment(何时发生)、Progression(如何展开),共享场景和物体以减少外观线索。在 10 个闭源和 21 个开源 Video-LLM 上评测,并进一步在 TempCloze-Mixed 与 TempCloze-Hard 子集上,用 4 个代表性模型分析错误模式,以及候选顺序、上下文方向、可见跨度、帧密度和测试时缩放对模型选择的影响。

注:原文未报告具体定量指标,以下发现基于定性与趋势描述。

关键发现

  • Alignment 是主要瓶颈:模型通常能识别合理的语义内容和局部事件进展,但难以判断时间对齐关系。
  • 与语言中介基准相比,TempCloze 通过同源干扰项和共享视觉上下文,显著减少选项措辞、答案相关性或语言先验带来的捷径。
  • 错误模式分析揭示模型在选择时易受候选顺序干扰,且上下文方向和可见跨度对性能影响明显;测试时缩放带来有限但非单调的改进。

对比解读

早期时序推理基准多依赖语言问答,模型可能利用语言统计而非真实视觉理解。TempCloze 采用视频完形填空形式,迫使模型基于视觉内容本身判断缺失中间段,更贴近实际视频理解需求。从 31 个模型中观察到的 Alignment 短板,说明当前 Video-LLM 在细粒度时间定位与事件边界感知上仍存在显著提升空间;工程上,这提示需要更强的帧级时序建模或预训练目标,而非单纯增加模型规模或指令数据。

行业影响

落地场景

TempCloze 的视觉时序推理能力可直接用于视频理解相关产品:视频编辑与自动剪辑、内容审核、视频问答、异常检测、自动驾驶事件重建、医疗手术视频分析等。任何需要判断“事件发生时刻/顺序”的 Video-LLM 应用都能从该基准中受益,尤其适合长视频与第一视角视频的场景。

商业价值

模型在 Alignment 维度上的瓶颈会直接导致时序错误:如直播回放中商品展示片段顺序错乱、安全监控中漏检关键事件前后帧。TempCloze 作为评估基准,可帮助团队快速定位模型时序推理短板,减少人工复核成本;同时,通过加入同源干扰项,过滤依赖语言捷径的模型,提升最终产品在内容平台的用户留存与互动。

与现有工作流接口

可集成到 MLOps 评估流水线,作为 Video-LLM 发布前的时序回归测试;也可利用 TempCloze 的 distractor 构造方式生成训练数据,对现有模型进行微调或 RLHF,强化时间对齐能力。技术上,基于 ffmpeg / PyTorch / Hugging Face 的帧采样与片段比对流程即可接入。

具体 use case

  1. 电商直播回放剪辑:平台自动从直播长视频中抽取商品讲解片段,模型需从多个候选片段中选出与上下文时序对齐的中间段。TempCloze 可评估并优化模型,避免“讲完价格才插播商品”的时序错误,提升转化率。
  2. 自动驾驶数据标注:从行车记录仪长视频中定位危险事件前后关键帧,辅助标注员快速标注。模型识别缺失中间片段,可大幅降低标注成本,加速事件重建。

局限

  • 论文未明确讨论数据来源的覆盖偏差。TempCloze 的 1,521 个视频主要来自长镜头和第一人称数据(如 LVD-2M、EgoLife 等),缺乏电影级剪辑、体育转播、新闻等常见视频类型,因此模型在 Alignment 维度上的瓶颈结论可能不适用于所有领域。此外,同源干扰项虽然减少了外观线索,但候选片段均来自同一视频的不同时间点,模型可能依赖片段之间的低层视觉连续性(如运动轨迹、光照变化)而非高层事件逻辑进行匹配,这种捷径没有被完全排除。
  • 实验设计存在一定局限。行为敏感性分析仅覆盖四个代表性模型(两个开源、两个闭源),样本量较小,可能无法充分代表 31 个模型的多样性;且分析集中在 TempCloze-Mixed 和 TempCloze-Hard 子集上,未在完整基准上系统验证。人类基线(附录 C)的规模和质量未在正文详述,若人类准确率未达到足够高(如 95% 以上),则基准的有效性存疑。另外,基准规模相对于现有大型视频数据集仍偏小,可能限制了对罕见场景的覆盖。
  • 与同类时序推理基准(如 Video-MME、MVBench)相比,TempCloze 聚焦于视频填空任务,泛化性较弱。它只评估模型在给定首尾片段时恢复中间内容的能力,未覆盖其他时序推理形式(如排序、计数、预测)。同时,基准构建依赖人工标注和过滤,成本高且难以扩展;干扰项的三个维度(Semantic/Alignment/Progression)虽然清晰,但实际题目中维度可能交叉,模型错误归因分析可能过于简化。
论文Wenqi Pei2026-09-01原文

相关内容