论文

面向全模态密集视频描述的并行化自回归解码

面向全模态密集视频描述的并行化自回归解码

密集视频描述旨在生成带有时间定位的视频事件描述,有益于事件级视频理解和生成。当前,自回归视频大语言模型因其强大的生成和跨模态建模能力成为主流范式。然而,逐token生成的方式严重限制了推理效率,并且随着视频长度和事件密度的增加,可扩展性受阻。 本文提出一种并行化自回归框架,不仅提升生成效率,还增强了时间定位描述的性能。核心思路是利用跨时间不同事件的弱局部依赖来重构因果依赖图,从而实现无损并行生成:跨事件依赖弱的token可并行解码,而事件内紧密耦合的token保留顺序解码以保持局部语义连贯性。为此,我们引入两个关键组件:1) 潜在全局规划机制自动学习事件级结构,生成紧凑token编码全局事件间因果关系,并自适应聚合事件级音视频语义;2) 事件分解并行解码机制有效平衡局部关注与全局事件间感知。 在多个基准上的实验表明,本方法在全模态事件定位与描述方面在效率和性能上均具有明显优势。项目网站:https://github.com/showlab/PadCaptioner。

论文精读

TL;DR 通过重构事件间弱因果依赖实现自回归解码的并行化,在保持时序定位精度的同时大幅提升密集视频字幕的推理效率。

问题

问题背景

密集视频描述(Dense Video Captioning)旨在为视频中每个事件生成带时序边界的描述,是视频理解与多模态生成的核心任务。当前主流方案采用 自回归视频大语言模型(Video LLM),凭借强大的跨模态生成能力取得显著进展。

现有方法的局限

  • 自回归解码逐 token 生成,推理延迟与视频长度和事件数量成正比,无法并行加速。
  • 视频事件间往往存在弱时序依赖,但标准因果注意力强制全局序列顺序,导致大量冗余计算。
  • 在长视频、高密度事件场景下,效率瓶颈严重制约实际部署,且可能因忽略事件间全局关系而影响定位精度。

为什么该问题困难且重要

  • 难点:并行解码需重组因果依赖图,既要保持每个事件内部 token 的局部语义连贯,又要跨事件传递全局上下文,稍有不当即造成信息丢失或描述错乱。
  • 重要性:随着视频应用向实时交互发展,低延迟是刚需;高效并行能大幅降低推理成本,推动 Video LLM 在监控、自动驾驶、视频问答等领域的规模落地。
  • 业界对长视频理解的需求日增,但现有自回归范式已构成显著性能壁垒,亟需打破。

行业类比

类似 长文本生成 中从逐 token 解码到投机采样、并行解码的演进,视频描述的并行化是释放 Video LLM 实时交互能力的关键突破口。

核心洞察

  • 将密集视频事件建模为**弱局部依赖**的序列:不同事件间的时间因果关系较弱,可在自回归框架中**无损重构因果依赖图**,让跨事件 token 并行解码,而事件内 token 保持顺序解码以保留局部语义。这与传统逐 token 生成或强行完全并行化不同,它通过识别依赖强度划分并行/顺序区域,实现**效率与全局时间定位的平衡**。对工程而言,该思路可推广到任何具有稀疏依赖的序列生成任务,无需外部模块即可大幅降低推理延迟。
  • **潜在全局规划**(Latent Global Planning)机制从视频特征中自动学习紧凑的事件级结构表示,既编码全局事件间因果性,又自适应聚合视听觉语义。这与固定的并行模板或人工定义事件边界不同,它通过隐式学习动态规划并行解码的执行顺序,从而避免信息丢失。因此,该设计使得并行解码不再是简单的 token 分组,而成为**可端到端训练的结构感知规划**,为后续事件分解解码提供全局引导,显著提升了在复杂多事件场景下的时间定位与字幕质量。

方法

方法概述

PadCaptioner 提出一种平行化自回归解码框架,面向全模态密集视频描述。核心思想是:视频中的不同事件在时间上相对独立,事件间存在弱局部依赖性,因此可以重构因果依赖图,在保持事件内部串行解码的前提下,实现事件间 token 的无损并行生成

输入与初步处理

输入为视频及其音频流,基础模型是一个自回归视频大语言模型(Video LLM),采用 token-by-token 生成范式。模型首先通过视觉与音频编码器将多模态信号转换为 token 序列。

关键模块

  • 潜在全局规划(Latent Global Planning):自动学习事件级结构,生成紧凑的全局规划 token,编码事件间的因果关系,并自适应聚合音视频语义。该模块包含两个子目标:
    • 显式事件接地约束(Explicit Event Grounding Constraint):确保规划 token 能准确对应事件时间边界。
    • 自适应语义聚合(Adaptive Semantic Aggregation):从原始特征中动态提取事件相关的多模态上下文。
  • 依赖重构并行解码(Dependency-Restructured Parallel Decoding):利用全局规划 token 将原始全序列因果掩码改造为事件分解的并行掩码。具体做法是:
    1. 将解码过程按事件分组,同一事件内部的 token 保持串行因果依赖。
    2. 不同事件的 token 之间打断不必要的依赖,允许并行计算。
    3. 通过交叉注意力引入全局规划 token,使并行解码时仍能获取跨事件上下文。

输出

最终模型以并行方式生成每个事件的起始/结束时间戳及对应的描述文本。训练时使用标准语言建模损失与事件定位损失联合优化,推理时可直接在一步内解码多个事件的 token 块,大幅降低延迟。

与同类方法的差异

不同于以往完全串行的自回归范式(如 Vid2Seq、VTimeLLM),PadCaptioner 首次通过重构因果图实现事件间的无损并行解码,在保持局部语义连贯性的同时,将推理效率与事件密度解耦,使模型能够高效扩展至更长视频和更稠密的事件标注场景。

实验

实验设计

论文在多个全模态密集视频描述基准上验证方法,涵盖不同领域和事件密度。对比基线包括强自回归视频大语言模型 (如 Video-LLaMA 等),重点考察描述质量时间定位准确性,同时设计消融研究分析各组件贡献。

关键发现

  • 并行解码在保持甚至提升描述指标 (CIDEr、METEOR) 的同时,推理速度大幅提升,尤其在长视频和高事件密度场景下优势明显。
  • 潜在全局规划模块能自动学习事件级结构,生成的紧凑 token 有效编码跨事件因果,是并行化无损的关键。
  • 事件因子化解码能在不牺牲细节的前提下,维持对相邻事件的全局感知,避免并行带来的语义断裂。
  • 消融实验证实,移除全局规划或因子化解码均会导致性能下降,证明两者缺一不可。

与基线对比解读

传统 token-by-token 自回归方法受制于串行瓶颈,难以扩展到长视频。本工作通过重构因果依赖图,将事件间弱依赖 token 并行化,而事件内强依赖 token 仍保持串行,实现了 lossless 并行生成。这一思想从根本上改变了密集描述的计算范式,与其他通过蒸馏或剪枝的加速方法不同,它不损失模型容量,反而因显式建模事件结构而提升了定位准确度。

行业影响

落地场景

该框架直接赋能需要密集视频描述(dense video captioning)的产品与业务,例如:

  • 视频内容平台:自动生成带时间戳的事件标签与摘要,支撑智能剪辑、精彩片段提取。
  • 监控与安防:对长视频流进行实时事件检测与结构化描述,提升检索与告警效率。
  • 自动驾驶:理解行车记录仪中的复杂交通事件序列,为场景标注与仿真提供细粒度文本描述。
  • 电商直播:自动分段描述主播动作与商品展示,生成带时间锚点的购物清单,改善回放与搜索体验。

商业价值

  • 降本:通过并行解码显著降低推理延迟,相同硬件下可处理的视频吞吐量成倍提升,直接减少云端推理成本。
  • 增收:更快的密集描述生成使实时视频索引成为可能,支撑植入广告精准匹配、直播带货关键节点即时标记等对延时敏感的商业化场景。
  • 体验提升:无损并行机制在保持描述质量的同时加速响应,用户可秒级获取长视频的事件导航图,提升内容消费效率。

与现有工作流的接口

该方法作为自回归视频大模型的解码侧改进,与现有技术栈兼容度高:

  • 可直接替换VLLM(如Video-LLaMA、VideoChat)中的因果解码模块,无需重新训练视觉编码器或投影层。
  • 新增的潜在全局规划事件因子化并行解码组件以轻量插件形式嵌入,训练和部署均可通过torch.compile或ONNX进一步优化。
  • API接口可设计为接收视频流,返回带时间戳的事件描述JSON,与下游处理管道(如搜索索引、推荐引擎)无缝对接。

具体用例

  1. 短视频平台内容审核:对海量UGC视频进行自动事件切分与描述,结合规则快速过滤违规片段,同时生成可读的审核理由,减少人工复审量。
  2. 智能客服视频分析:在保险定损等场景中,对上传的事故视频自动生成密集的时间轴描述,帮助定损员快速定位关键帧并关联保单条款,缩短处理周期。

局限

  • **弱依赖假设的边界风险:** 该方法的核心洞察是“时间上分离的事件之间存在弱局部依赖”,并以此重组因果图实现并行。然而,当视频事件高度交织、存在强因果叙事或密集对话时(如体育解说、剧情推理),强制打破事件间顺序可能破坏全局语义连贯性,造成信息丢失或逻辑断裂。论文未对这类复杂依赖场景进行专项评测或提供自适应并行度控制,在实际部署中可能需要进行额外的依赖强度估计,增加了工程不确定性。
  • **对事件分割质量的敏感性与泛化不足:** 潜在全局规划模块需要从训练数据中学习事件级结构,其性能高度依赖于事件边界标注的质量和分布。当前基准数据集(如ActivityNet Captions、YouCook2)的事件定义和密度有限,模型可能过拟合于这些领域。迁移至长视频流、用户生成内容或事件密度极不均匀的场景时,自动学习的事件结构可能不准确,导致并行解码的加速比和字幕质量下降,且论文未探讨与强非自回归生成方法的效率-质量权衡。
  • **全模态依赖与部署成本:** 虽然宣称全模态,但实际应用中常面临模态缺失或噪声(如静音视频、嘈杂环境音频),论文缺少单模态或降级输入的鲁棒性验证。此外,框架需要额外训练全局规划器和事件因子化解码器,无法直接适配现有预训练视频大语言模型,从头训练或微调的开销较大。对于资源受限的边缘设备或实时系统,额外的计算图和存储需求可能削弱其效率优势,使其应用场景受限。
论文Wenzheng Zeng2026-07-03原文

相关内容