论文

LVMT: 用于长时视频分割的视频掩码 Transformer

LVMT: 用于长时视频分割的视频掩码 Transformer

现有在线视频分割方法难以在具有长期遮挡的长而复杂的视频中跟踪目标。我们假设这一局限源于两点:(i) 时序传播 机制无法自适应地选择跨时间传播的目标信息;(ii) 由于内存需求和梯度消失问题,模型无法在长视频上训练。 针对第一点,我们提出使用一个轻量的 GRU-based 时序传播模块,它能学习选择在记忆中保留并跨时间传播哪些信息。针对第二点,我们引入 Truncated Query Propagation (TQP),一种训练策略:模型以帧块(chunk)为单位处理视频,跟踪目标的信息在块之间传播,但反向传播仅在单个块内进行,从而在避免内存溢出、推理开销和梯度消失的前提下实现更长的时序监督。 由此得到的模型称为 Long-term Video Mask Transformer (LVMT)。在六个 benchmark 上的大量实验表明,LVMT 在多项视频分割任务上树立了新的 state of the art,同时保持了其所基于的高效模型的速度,比此前的最优方法快 10 倍。代码:https://www.tue-mps.org/lvmt

论文精读

TL;DR LVMT 通过轻量 GRU 自适应传播目标信息与截断查询传播训练策略,解决长视频分割中的长期遮挡与训练难题,性能达到 SOTA 且保持高帧率。

问题

问题背景

在线视频分割旨在逐帧分割并跟踪视频中的目标对象,长期跟踪能力对于真实世界应用至关重要。

现有方法局限

现有方法在长视频中表现不佳,主要受限于两点:

  • 时间传播机制缺乏自适应性:多数方法使用固定规则(如逐帧传播 mask)或注意力机制,无法显式选择哪些历史信息对当前帧有用,导致在长期遮挡或外观剧烈变化时,传播的对象特征包含噪声或丢失关键信息,最终造成跟踪漂移或 ID 切换。
  • 训练受限于内存与梯度消失:由于反向传播需要存储所有中间激活,长视频训练容易超出 GPU 内存;同时,随时间展开的梯度会指数级衰减(梯度消失),使得模型难以学习长期依赖。因此,通常只能使用短序列训练,模型在推理时遇到长视频时泛化能力不足。

为什么这个问题难且重要

长期视频分割要求模型在数百帧乃至更长序列中保持对象身份一致性,同时处理遮挡、目标进出视野、外观变化等挑战。这对自主系统(如自动驾驶、机器人)、视频编辑、监控分析等应用至关重要,因为这些场景往往需要实时、鲁棒的长期跟踪。业界对高效、可扩展的长视频分割方法有强烈需求。

行业类比

类似于自动驾驶场景中,车辆需要持续跟踪被短暂遮挡的行人,传统方法容易在遮挡后丢失目标或错误关联,而 LVMT 的思路(自适应记忆与分段训练)可类比于让模型学会“有选择地记住关键证据”。

核心洞察

  • GRU-based query propagation 用轻量 GRU 替代固定规则或基于光流的传播方式,让模型自适应选择要保留和传播的目标信息。相比传统方法依赖手工设计记忆更新或外部运动估计,GRU 的门控机制能学习何时遗忘、何时记住,在长期遮挡下仍能维持目标身份一致性,且不增加推理开销,适合在线视频分割。
  • Truncated Query Propagation (TQP) 将视频分块处理,块间传播查询状态但只在单个块内反向传播,从而允许在长视频上训练而不引起显存溢出或梯度消失。与标准截断 BPTT 不同,TQP 专为 Transformer 查询传播设计,使模型能利用长时程监督信号,同时保持与单帧处理相当的推理速度和内存占用,为长视频训练提供了实用范式。
  • LVMT 在多个基准上以 10 倍于先前 SOTA 的速度达到新 SOTA,证明通过时序传播模块和训练策略的协同设计,可以在不牺牲推理效率的前提下显著提升长视频分割性能。这意味着工程落地不必依赖重型模型或复杂后处理,轻量 GRU 与分块训练即可获得稳健的长期跟踪能力,对实时视频理解系统具有直接参考价值。

方法

输入与整体流程

LVMT 以在线方式处理视频帧序列。对于每帧输入,模型接收当前帧图像特征和从前一帧传播而来的目标查询(query),输出当前帧的实例分割 mask,并更新查询以传递到下一帧。

关键模块

  1. GRU-based Query Propagation
    在原有 PMT 架构中,时间传播采用固定规则(例如直接复制上一帧 query)。LVMT 将其替换为一个轻量级 GRU 模块。GRU 的输入为上一帧 query 与当前帧特征,通过门控机制学习自适应决定哪些目标信息需要保留在记忆中、哪些需要遗忘或更新。最终输出当前帧的 query,用于 mask 生成,同时作为下一时间步的隐藏状态。

  2. Truncated Query Propagation (TQP)
    为支持长视频训练,TQP 将视频划分为多个 chunk(例如每 chunk 8 帧)。在 chunk 之间,query 正常传播,保证时序上下文连续;但反向传播只在每个 chunk 内部进行,梯度不跨 chunk 回传。这避免了长序列训练时的显存爆炸和梯度消失问题,使模型可以在长视频上获得监督信号,且推理时无任何额外开销。

输出

模型输出与任务对应:对于视频实例分割(VIS)、视频语义分割(VSS)等,输出逐帧的 mask 或类别预测。

与同类方法的差异点:LVMT 通过 GRU 引入可学习的记忆选择机制,并结合 TQP 训练策略,同时解决了长时遮挡下的信息丢失与长视频训练的可行性问题,且保持了基础模型 PMT 的高推理速度。

实验

实验设计

LVMT 在六个视频分割基准上进行评估,覆盖长期遮挡与复杂视频场景。模型采用 GRU-based query propagation 作为时序传播模块,可自适应选择保留哪些目标信息;训练使用 Truncated Query Propagation (TQP),将视频切分为 chunk 分别反向传播,块间仅前向传递 query 与隐藏状态,实现长视频监督而不引发显存溢出或梯度消失。具体数据集名称与训练硬件在摘要中未列出。

关键发现

  • LVMT 在全部六个基准上取得新的 SOTA 性能。
  • 保持与高效基线模型 PMT 相近的推理速度,同时比之前的 SOTA 快 10 倍。
  • 摘要图表显示与 PMT 相比在 AP 上有 +4.6、+5.7、+7.8 的提升(具体来自不同设置)。
  • GRU 模块能学习长时记忆中的信息选择,TQP 让训练能利用更长时序上下文,而推理开销不变。

与基线对比解读

LVMT 不打参数规模牌,而是改进时序传播机制与训练策略。相比固定传播路径的现有在线方法,GRU 引入可学习的门控,使模型能够在遮挡后保留必要的目标特征;TQP 将反向传播限制在单个 chunk 内,避免长序列梯度消失同时降低峰值显存,是一种易复用的长视频训练技巧。速度上 10 倍于先前 SOTA 使其更贴近实时在线分割需求。工程落地时可将 GRU 模块嵌入其他基于 query 的视频分割框架,TQP 也可作为通用训练手段用于其他长视频理解任务。

行业影响

落地场景

LVMT 主要解决长视频中目标分割与跟踪的稳定性问题,适用于需要长时间连续处理视频流的场景。例如:

  • 电商直播:对主播展示的商品进行实时分割与跟踪,即使在手部遮挡、物品换手或长时间展示时仍能稳定识别商品轮廓,用于虚拟试穿、商品链接弹窗等交互。
  • 视频内容平台:对 UGC 长视频进行自动对象分割,辅助生成视频摘要、对象级搜索、自动打标或无障碍描述。

商业价值

  • 降本:LVMT 较之前 SOTA 快 10 倍,可在同等算力下处理更多视频流,降低云端推理的 GPU 成本。
  • 增收:在电商直播中,更精准的商品分割能提升虚拟商品展示与点击转化,直接带动 GMV。
  • 体验提升:在视频编辑工具中,用户可更高效地进行对象级编辑(如抠像、替换背景),无需逐帧手动调整。

与现有产品 / 工作流的接口

LVMT 可作为即插即用的视频分割模块,接入现有视频处理 pipeline:

  • 兼容 Transformer 架构,可替换基于 Mask2Former 或 VidEoMT 的现有分割组件,无需改动上游编码器。
  • 训练采用 截断查询传播 (TQP),允许在长视频上训练而不增加显存,便于在有限 GPU 资源下微调。
  • 提供 代码仓库 与预训练权重,支持 torch.hub 或 ONNX 导出,可快速集成到 ONNX Runtime / TensorRT 推理栈。

具体落地 Use Case:电商直播平台可在主播讲解商品的长时间直播流中,使用 LVMT 实时分割商品并叠加 AR 试戴效果,提升用户参与度;视频创作工具(如剪映类)可将其作为“智能抠像”功能,自动分割视频中的主要对象,支持一键移除背景或跟踪特效。

局限

  • **训练成本高**:论文在 Limitations 部分明确提及训练成本问题。TQP 需要模型在多个 chunk 上顺序处理长视频,即使反向传播仅在各 chunk 内部进行,前向传播仍需要遍历整个长序列,且 GRU 状态需在 chunk 间传递,这导致训练时间显著增加。对于长视频数据集,单个样本的训练迭代可能远长于标准视频分割模型,限制了在更大规模数据集上的扩展性。
  • **GRU 状态容量有限**:GRU 的隐藏状态维度是固定的,当视频中出现大量需要跟踪的对象时,状态可能需要同时编码多个对象的时空特征,可能存在容量瓶颈。论文实验主要针对单对象或少量对象的分割任务,对于多对象密集场景,固定大小的 GRU 记忆可能不足以保留所有对象的长时信息,导致身份混淆或漏检。此外,GRU 的顺序更新机制本质上是马尔可夫过程,理论上难以完美保留任意长距离的依赖。
  • **TQP 的梯度截断可能牺牲全局优化**:TQP 在每个 chunk 内独立进行反向传播,chunk 间只传递前向状态而不传递梯度。这种策略缓解了梯度消失和内存问题,但也切断了跨 chunk 的梯度流,使模型难以学习跨 chunk 的长期关联(例如,某个对象在 chunk A 中消失,在 chunk C 中重新出现,但中间 chunk B 无梯度回传)。尽管实验表明该方法有效,但它可能并未真正解决长时依赖的优化问题,而只是通过分块训练近似,长期效果仍有待验证。
论文Narges Norouzi2026-09-29原文

相关内容