论文

视频中定位一切:重新思考高效生成式时空视频定位

视频中定位一切:重新思考高效生成式时空视频定位

时空视频定位(STVG)要求模型识别指称事件发生的时间,并在该时间区间内定位目标实体。现有大规模多模态语言模型通常以自回归方式序列化生成密集定位轨迹,导致解码延迟随片段长度增长,且定位错误随时间传播。 我们提出 Parallel Tube Decoding (PTD),一种生成式公式,将定位任务分解为一个时间块和多个时间条件空间块,并并行解码。该方法消除了令牌级和轨迹级依赖,将顺序解码深度固定为 1+1 轮,与片段长度无关。为实现并行空间生成,我们引入 Decoupled Block Attention,在保留共享视频-查询上下文的同时消除跨框依赖,并结合面向时间边界和空间几何的定位感知策略优化。 在 VidSTG 上,PTD 将 Tube Completion Latency 降低 79 倍,空间解码吞吐量提升 92 倍,相比标准自回归解码,同时提升了定位精度。基于紧凑的 4B 骨干网络,我们的模型在 VidSTG 和 HC-STVG 上表现优异,并零样本泛化至时间定位、基于定位的视频问答和指代视频目标跟踪。 结果表明,并行片段生成是视频自回归定位的一种高效且有效的替代方案。

论文精读

TL;DR Parallel Tube Decoding 将时空定位拆成时间块与并行空间块,消除自回归依赖,在 VidSTG 上降低 79 倍延迟、提升 92 倍吞吐量,同时精度更好。

问题

问题背景

当前视频理解的一个核心方向是时空视频定位 (STVG)——根据自然语言查询,同时定位事件发生的时间区间与目标实体在该区间内的空间轨迹。随着视频-语言模型被用于长视频搜索、证据问答等任务,对定位的实时性和准确性要求显著提升。

现有方法局限

  • 现有主流做法基于多模态大语言模型 (MLLM),将密集定位轨迹序列化为 token,采用自回归方式逐 token 解码。
  • 存在两类关键瓶颈:token 级依赖 导致每一步只能生成一个坐标,轨迹级依赖 要求逐帧输出空间框,二者共同导致解码深度随 tube 长度线性增长。
  • 延迟随轨迹变长而恶化,且早期的定位误差会沿时间轴向后传播,造成后续帧框的漂移。

为什么这个问题难且重要

  • 难点在于:时空定位需要同时处理时间边界 和空间几何,并保持跨帧的实体一致性,而并行化解码 会削弱帧间上下文建模能力。
  • 该领域在长视频分析、具身智能和视频检索中具有重要应用价值,业界对低延迟、高吞吐的定位解码方案需求迫切。
  • 解决这一效率-精度权衡,是让视频 grounding 真正落地实时交互系统的关键一步。

行业类比

这与 LLM 推理中从逐 token 自回归解码转向推测解码 / 并行解码 的趋势相似,但此处针对的是视频时空结构化的输出生成,挑战在于如何在不牺牲空间上下文的前提下并行生成多个框。

核心洞察

  • Parallel Tube Decoding 将 spatio-temporal video grounding 从逐 token 自回归轨迹生成重构为固定两轮解码:一个 temporal block 加上并行生成的 time-conditioned spatial blocks,解码深度与 tube length 解耦。与现有 MLLM 逐帧或逐框序列化定位不同,PTD 消除了 trajectory-level 依赖,因此长 tube 不再带来累积延迟与误差传播,在保持甚至提升准确率的同时将 Tube Completion Latency 降低 79 倍。这为视频定位任务提供了一个效率与精度可同时优化的新范式,而不是传统的以精度换速度。
  • Decoupled Block Attention 是并行空间生成的关键:它移除了不同边界框之间的注意力依赖,但保留每个框对共享 video-query 上下文的访问。与 naive 的完全并行(可能丧失全局信息)或完全自回归(解码效率低)相比,这种设计让所有空间框在独立解码的同时共享同一视觉-语言表示,从而在极大提高 throughput(92 倍)时避免精度损失。配合 localization-aware policy optimization 直接优化时序边界和空间几何,避免了传统 token 级交叉熵损失与定位目标之间的不对齐,使并行生成在几何精度上同样可靠。

方法

输入与任务定义

给定视频与自然语言查询,模型需要定位事件发生的时间区间,并在该区间内逐帧输出目标实体的空间边界框(即时空管)。

关键模块:并行管解码

Parallel Tube Decoding (PTD) 将自回归式轨迹生成重构为固定两轮解码:

  • 第一轮(1 步):生成时间块,确定事件起止时刻。
  • 第二轮(1 步):基于时间条件,同时解码所有空间块,得到每一帧的边界框。

这种分解移除了 token 级与轨迹级依赖,使顺序解码深度恒为 1+1,与管长度无关。

Decoupled Block Attention 是并行空间生成的关键:每个空间块可访问共享的视频-查询上下文,但不同边界框之间取消注意力交互,从而支持并行解码而不损失全局信息。

Localization-Aware Policy Optimization 分别针对时间边界与空间几何施加策略优化,提升定位精度。

输出

模型输出完整时空管:时间区间 + 该区间内所有帧的目标框序列。

与同类工作的差异

对比标准自回归解码(逐 token 生成完整轨迹),PTD 将解码深度固定为两轮,彻底解耦时间与空间生成,在提升精度的同时将 Tube Completion Latency 降低 79 倍、空间解码吞吐量提升 92 倍。

实验

实验设计

  • 在 VidSTG 与 HC-STVG 上评估,使用 4B 骨干模型。
  • 对比标准自回归解码,并探索零样本迁移至 temporal grounding / grounded VideoQA / referring video object tracking。

关键发现

  • Tube Completion Latency 降低 79×,空间解码吞吐量 提升 92×,同时定位精度提升。
  • 并行解码将顺序解码深度固定为 1+1 轮,不随 tube 长度增加,从根本上改善长视频效率。

基线对比解读

自回归方法存在 token 级与轨迹级依赖,误差随长度累积,且延迟线性增长;PTD 通过 Decoupled Block Attention 消除跨框依赖并保留共享视频-查询上下文,结合 localization-aware policy optimization,在效率和精度上均占优。实际部署中,该方案适合需要低延迟响应的视频定位任务,如长视频检索与交互式问答。

行业影响

落地场景

Parallel Tube Decoding (PTD) 将视频定位从逐 token 自回归改为并行解码,使生成式视频定位首次具备实时推理潜力。可直接嵌入:

  • 视频搜索引擎:用户用自然语言描述“那个穿红衣服的人在车边出现又离开”,系统在长视频中快速返回时空片段。
  • 内容审核与安全:对直播、监控类流媒体,实时定位“人员跨越警戒线”等事件并给出轨迹框,降低人工巡检延迟。
  • 电商短视频商品关联:在商品讲解视频中即时定位被提及的商品出现的时间区间和屏幕位置,用于跳转购买或自动字幕锚点。

商业价值

  • 降本:原有自回归方案每帧解码需串行等待,PTD 将 Tube Completion Latency 降低 79 倍,同硬件下可处理更多视频流,直接减少 GPU 推理成本。
  • 增收/体验提升:4B 轻量模型即可达到优于大规模自回归模型的精度,且零样本迁移到 temporal grounding、grounded VideoQA、referring tracking,减少多任务重复训练开销,加速产品迭代;用户得到秒级响应而非数十秒等待,提升交互式视频应用的留存与转化。

与现有工作流集成

PTD 输出固定深度的 1+1 轮解码,不依赖 tube 长度,适合批处理和流式接口:

  • 可替换现有多模态 LLM 中的 localization head,将Decoupled Block Attention 作为注意力模块插入,保持视频-问题共享上下文,无需改动上游视觉编码器。
  • 提供 GitHub 代码与项目主页,可作为插件嵌入已有视频理解 pipeline(如 LLaVA-Video、Video-LLaMA 等框架),通过推理引擎的 custom op 或 vLLM 自定义采样器实现并行解码。
  • 对需要实时性的场景(自动驾驶、机器人),可将 PTD 作为感知模块,输出结构化时空事件供下游规划器消费,延迟敏感指标大幅改善。

局限

  • **Decoupled Block Attention** 在消除交叉框依赖、实现空间并行生成的同时,也丢弃了同一帧内不同目标之间的空间关系建模。对于多个目标相互遮挡、紧密交互或存在相对位置约束的场景,并行生成的各个边界框可能缺乏全局一致性,导致定位漂移或框间冲突。论文未讨论是否引入轻量级后处理或迭代修正机制来缓解这一问题,实际部署时可能需要额外的一致性校验步骤。
  • 实验主要在 **VidSTG** 和 **HC-STVG** 两个 STVG 基准上验证主任务性能,零样本泛化虽覆盖时间定位、视频问答和指代跟踪,但缺乏大规模多数据集交叉验证。模型主干固定为 **4B** 参数,未探索更大规模(如 **7B**、**13B**)下的效果与效率权衡。此外,并行解码需要同时生成所有空间块,峰值显存占用可能显著高于逐帧自回归解码,对硬件资源提出更高要求。
  • 方法将时间边界预测作为第一阶段,其准确性直接影响后续所有空间块的解码质量。若时间边界出现偏差,误差将传播至整个管道,且并行空间解码无法根据后续帧内容反向修正时间边界。**Localization-aware policy optimization** 的具体实现涉及时间边界和空间几何的联合奖励设计,超参数平衡较为复杂,训练稳定性可能对奖励尺度敏感。对于事件跨度极短(如瞬时动作)或极长(如持续数分钟)的视频,该方法的效果尚未充分验证。
论文Hanoona Rasheed2026-08-28原文

相关内容