论文

SAM-MT: 实时交互式多目标视频分割

SAM-MT: 实时交互式多目标视频分割

现代视频目标分割(VOS)涉及跟踪和分割用户指定的目标。尽管近期方法在单目标场景中取得了显著性能,但扩展到多目标设置时,通常需要为每个单独目标复制单目标处理流程,导致帧率(FPS)下降,且延迟随目标数量增加而无限增长。 基于Segment Anything 2 (SAM2),我们提出SAM-MT,通过将模型转换为面向实时多目标视频分割的交互式框架来解决该问题。SAM-MT使用显式查询(explicit queries)表示不同个体目标,同时利用共享表示捕获全局上下文。它采用解耦掩码注意力(decoupled masked attention)保持各目标身份独立,避免跨目标干扰;使用稀疏记忆(sparse memory)实现稳定的时序演化,并配备专用策略处理遮挡和重叠问题。 实验表明,SAM-MT成功将延迟与目标数量解耦,在10个目标上达到与单目标基线相当的速度(36 FPS),同时维持SAM2强大的视频分割性能。

论文精读

TL;DR SAM-MT 将 SAM2 改造为实时多目标视频分割框架,通过显式查询与解耦注意力实现延迟与目标数解耦,在 10 目标下仍达 >36 FPS,保持原分割精度。

问题

现代视频对象分割(VOS)聚焦于在开放词汇场景中跟踪与分割用户指定的任意目标,应用覆盖机器人导航、增强现实和交互式视频编辑等领域。当前主流方法如 SAM2 基于 时空记忆(STM) 范式,在单目标分割上表现卓越。

然而,现有方法在多目标设置下存在明显局限:直接对每个目标独立运行单目标分割流程,导致计算量与目标数量线性相关,帧率(FPS)大幅下降,延迟无界,难以满足实时交互需求。此外,独立处理缺乏显式的目标间交互机制,易造成遮挡场景下的身份混淆和重叠区域的误分割。

该问题之所以重要且困难,在于多目标视频分割要求并行推理多个实例,同时保持个体身份不受交叉干扰,并稳健处理动态遮挡与目标重叠。这对人机交互、多智能体感知和实时视频分析等应用至关重要,但精度与效率的权衡一直未得到妥善解决。

行业类比:如同自动驾驶系统需实时并行检测与跟踪多个对象并保持稳定 ID,视频分割领域也亟需一种可扩展的多目标架构,将延迟与目标数量解耦,类似 SAM-MT 的设计思路。

核心洞察

  • SAM-MT 将多目标分割从逐目标复制的串行范式转变为并行查询范式:它为每个目标引入显式的可学习查询,与共享的全局特征一起通过解耦掩码注意力处理,确保目标间身份隔离而无交叉干扰。这从根本上避免了传统方法中延迟随目标数线性增长的瓶颈,让所有目标在单次前向传播中完成分割。
  • 在继承 SAM2 强大分割能力的同时,SAM-MT 通过查询合并、稀疏记忆和遮挡处理等针对性设计,成功将多目标推理速度提升至单目标 baseline 水平(10 目标 >36 FPS),且精度损失极小。这种高效的架构适配证明大规模基础模型向实时多实例任务扩展时,并不必然牺牲性能或响应速度,为交互式视频应用提供了可行的工程范式。

方法

输入与任务定义

SAM-MT 接收用户指定的多个目标(通过点击、框或初始掩码),在视频全帧中进行实时实例级分割与跟踪。核心挑战在于目标数增加时,传统逐目标复制单目标模型的方式导致延迟线性增长

核心架构:从 SAM2 到多目标并行

SAM-MT 基于 SAM2 构建,但将其改造为交互式多目标框架,关键创新在于引入显式目标查询(explicit target queries)。每个目标被编码为一个独立查询(query),与共享的全局上下文表示并行处理,从而避免为每个目标重复提取整体特征。

关键模块与数据流

  • 可扩展目标查询(Scalable Target Queries):目标以查询形式存在,支持动态增减,形成可并行的表示。
  • 解耦遮罩注意力(Decoupled Masked Attention):在特征交互时,通过遮罩限制注意力的作用范围,强制各查询只关注自身对应的空间区域,切断跨目标干扰,保持身份分离。
  • 查询合并(Query Consolidation):在初始帧将用户提供的多种提示(如点、框)合并为统一的目标查询表示。
  • 基于查询的稀疏记忆(Query-based Sparse Memory):存储每个目标历史帧的稀疏特征,而非全帧密集记忆,降低存储开销并支持稳定时序演化
  • 身份变换器(Identity Transformer):在时序传播中维护目标身份一致性,避免因遮挡或相似外观造成 ID 混淆。
  • 额外的遮挡处理与重叠预防策略进一步保证多目标场景下的分割稳定性。

输出与性能

每个目标输出逐帧分割掩码,且延迟与目标数解耦。对比同类方法(如逐目标复制 SAM2),SAM-MT 在处理 10 个目标时仍能保持 >36 FPS,与单目标基线速度持平,同时保持了 SAM2 的鲁棒分割精度,真正实现多目标实时视频分割。

实验

实验设计

SAM-MT 基于 Segment Anything 2 (SAM2) 构建,评估聚焦于 多目标视频分割 (VOS) 场景。实验对比了直接重复调用单目标 SAM2 的朴素多目标方案,以此量化多目标扩展带来的计算开销与精度变化。测试覆盖不同目标数量(1~10+),从 推理速度 (FPS)分割精度 两个维度展开。消融实验逐项验证了 解耦掩码注意力 (Decoupled Masked Attention)查询式稀疏记忆 (Query-based Sparse Memory) 以及遮挡与重叠处理策略的贡献。

关键发现

  1. 延迟与目标数解耦:SAM-MT 在 10 个目标下仍保持 >36 FPS,与单目标基线速度持平;而朴素方案延迟随目标数线性增长。
  2. 身份保持稳定:解耦掩码注意力有效抑制了交叉目标干扰,避免了不同实例掩码的混淆。
  3. 精度损失可控:在维持实时性的同时,分割性能与逐目标处理的全精度 SAM2 相当,证明共享全局上下文与并行查询并未牺牲判别力。
  4. 记忆效率提升:查询式稀疏记忆替代了逐目标的密集记忆,大幅降低显存占用,使更多目标成为可能。

与基线对比的深度解读

传统方法将单目标模型“复制 N 次”以处理 N 个目标,导致 每帧处理时间 ×N。SAM-MT 通过 显式目标查询 + 共享全局上下文 的架构,一次性编码全局特征,再为每个查询独立解码掩码,使计算复杂度从 O(N) 降至 O(1)(单次前传)。相比单独运行 N 次 SAM2,SAM-MT 在 10 个目标时实现了 ≈10× 加速,且精度指标(如 J&F)未见明显衰减。这种设计对于需要实时多目标交互的应用(如机器人、自主导航)具有实际工程意义:它将可处理的目标数量从硬件限制中解放出来,使延迟变成固定常数。

行业影响

落地场景

SAM-MT 将实时多目标视频分割推向工程可用级别,精准解耦目标数量与处理延迟。最直接的落地场景包括:

  • 智能视频编辑:在电影、短视频后期中,同时对多人、多物体进行精确抠图与跟踪,无需逐帧手动调整。
  • 安防与监控:对多个行人、车辆进行并行分割与跟踪,支持实时异常检测与流量统计。
  • 自动驾驶:在多目标跟踪场景(如行人、车辆、交通标志)中提供像素级实例分割,增强感知精度。
  • 机器人视觉:在动态环境中实时区分并跟踪多个交互对象,用于抓取、导航等任务。

商业价值

  • 降本增效:传统多目标分割需为每个目标独立运行模型,帧率随目标数线性下降。SAM-MT 的并行解码设计使处理 10 个目标的帧率仍保持 >36 FPS,大幅降低计算资源消耗,尤其适用于边缘设备或大规模视频处理流水线。
  • 体验升级:实时交互式分割可赋能剪辑软件、AR 特效等产品,用户能够即时框选多个对象并获得流畅的遮罩反馈,显著提升创作效率与交互体验。
  • 可扩展性:支持开放词汇目标,无需针对特定类别重新训练,模型迁移成本低,能够快速覆盖长尾需求场景。

与现有产品 / 工作流的接口

SAM-MT 基于 SAM2 架构,可无缝接入现有的 SAM 生态工具链:

  • 与视频编辑软件集成:通过插件或 API 形式嵌入 DaVinci ResolveAdobe After Effects 等工具,将用户框选的多个目标 ID 传入 queries 即可获得实时遮罩输出。
  • 与监控或自动驾驶感知栈结合:提供轻量级推理 pipeline,输入为视频流和初始目标提示(点、框或掩码),输出为带 instance ID 的分割掩码,可直接替换原有逐目标推理的模块。
  • 在线推理 API 化:将 SAM-MT 封装为微服务,前端应用只需发送第一帧的提示标注,后台即可持续返回多目标分割结果,适合云端视频处理平台。

具体落地案例

  1. 短视频平台互动特效:用户上传视频并标记多个主体(如多人舞蹈),SAM-MT 实时分割人体区域,叠加背景替换或特效(如粒子跟随),无需高配设备,大幅降低创意门槛。
  2. 工业质检中的多缺陷并行检测:在流水线视频中,同时对工件表面的划痕、凹坑、裂纹等多个异常区域进行实时分割与跟踪,提升质检吞吐量并减少漏检,且模型无需针对缺陷类型做类别化训练。

局限

  • **依赖 SAM2 架构**:该方法紧密绑定 SAM2 的编码器、内存机制与预测头,难以迁移到其他单目标分割模型。当需要替换 backbone 或应对不同计算资源时,查询设计与解耦注意力可能需大幅重构,通用性受限。即便 SAM2 自身持续演进,本框架的更新也会滞后,制约其在多样化工程管道中的即插即用能力。
  • **实时性能的假设条件**:36 FPS 以上的实测结果建立在特定硬件(如高端 GPU)和优化策略之上,未充分验证在边缘设备、多目标极端数量(如 50+)下的鲁棒性。稀疏内存虽缓解了计算增长,但目标数激增时键值存储与匹配的耗时可能非线性增加,且在复杂遮挡、频繁身份切换场景中,查询管理开销可能导致延迟回升,缺乏在资源受限条件下的可扩展性分析。
  • **极端遮挡与重叠的鲁棒性待验证**:虽然提出了解耦掩码注意力和特化处理策略,但在密集人群、严重遮挡的序列中,身份漂移与边界模糊问题仍可能突出。论文主要对标单目标 SAM2 的精度,未与多目标专用方法(如联合时空推理模型)进行充分对比,无法揭示在复杂交互场景下的精度上限,这对于安全关键应用(如自动驾驶)构成潜在风险。
论文Ruiqi Shen2026-07-09原文

相关内容