论文

SAM2Matting: 通用图像与视频抠图

SAM2Matting: 通用图像与视频抠图

尽管图像抠图取得了显著进展,视频抠图仍面临挑战,原因在于高层跟踪(需要帧级理解)与低层抠图(关注极精细细节)之间的固有鸿沟。现有方法依赖昂贵且范围狭窄的视频抠图数据集,这可能限制域外泛化并削弱跟踪鲁棒性。 我们重新思考了这一范式,提出了 SAM2Matting,一种从跟踪器到抠图的框架,将 VOS 跟踪器 推进为高保真视频抠图。具体而言,该框架通过为基座跟踪器(如 SAM2、SAM3)添加 region-proposal bridge 和专用 matting heads 来解耦任务,使未经妥协的跟踪器能够处理时间一致性,同时抠图组件解决精细细节。 值得注意的是,尽管仅在图像上训练,SAM2Matting 在视频抠图上建立了新的最先进性能,支持多种提示类型,保持强时间一致性,并在人中心及野外场景中展现出鲁棒的泛化能力。

论文精读

TL;DR SAM2Matting 解耦跟踪与抠图,将 foundation tracker(如 SAM2)升级为仅用图像训练即达视频抠图 SOTA,具备强时序一致性与泛化能力。

问题

问题背景

视频 matting 旨在逐帧分离前景目标与背景,输出像素级透明度遮罩(alpha matte),是视频编辑、影视合成、增强现实等应用的核心基础。随着实时视频处理需求增长,业界对高保真、时序一致的 视频 matting 方法愈加关注。

现有方法局限

当前主流做法试图将视频对象分割(VOS) 的跟踪能力与图像 matting 的精细细节预测相结合,但面临几项具体技术局限:

  • 数据依赖性强:现有模型多依赖专门的视频 matting 数据集(如 VideoMatte240K),这类数据集采集成本高、场景覆盖窄,导致模型在非受限场景或未见域上泛化能力显著下降。
  • 跟踪与精度的耦合冲突:视频中目标可能发生大幅运动、形变或遮挡,VOS 跟踪器若在某一帧定位不精确,误差会直接传播至 matting 输出,造成细节丢失或边缘模糊,而传统耦合式设计难以隔离这种错误。
  • 时序一致性不足:多数方法将图像 matting 模型独立作用于每一帧,缺乏帧间信息对齐机制,导致连续帧输出的 alpha 遮罩产生抖动,影响视觉连贯性。

为何此问题既难又重要

技术层面,视频 matting 天然要求模型同时解决两个对立任务:高级语义理解(稳健跟踪)与低级纹理重建(像素级 alpha 预测)。二者对网络结构、损失函数的需求截然不同,直接端到端联合训练容易陷入次优平衡。此外,高质量视频 matting 标注费时且主观性强,域外泛化 成为长期瓶颈。

业界层面,从影视后期到虚拟主播,再到 AR 实时叠层,对任意场景下任意目标的精准提取需求日益迫切,但现有方案在非人类主体、复杂动态背景等场景下的可靠性仍远未达到生产标准,因而该方向持续吸引大量研究投入。

行业类比

如同自动驾驶中实例分割要求对运动物体进行与相机同步的精准掩码预测,视频 matting 也需在时间轴上保持对目标边缘的像素级跟踪,任何微小的分割抖动都会在视频回放中被放大,直接影响用户体验。

核心洞察

  • 解耦跟踪与抠图:将 VOS 跟踪器与专用抠图头分离,通过区域提案桥接,让跟踪器专注于时序一致的目标跟踪,抠图头处理精细透明度预测。这种设计解决了传统视频抠图在高级语义理解和低级细节捕获之间的根本矛盾,避免了因单一模型多任务优化导致的跟踪漂移或细节丢失。相比现有端到端视频抠图方法,它允许直接复用强大的预训练跟踪器(如 SAM2/SAM3),无需在有限视频抠图数据集上联合微调,从而保持跟踪鲁棒性并提升抠图精度。
  • 仅用图像训练即达视频SOTA:框架的抠图模块仅在图像数据集上训练,却在新视频场景中展现出卓越的时序一致性和泛化能力。这颠覆了视频抠图必须依赖密集帧标注的固有认知,表明精确的跟踪边界框配合高质量的图像抠图先验就足以处理视频,极大地降低了数据采集与标注成本,并使得模型更易适应野外复杂场景,对实际部署具有重要工程启示。

方法

方法概述

SAM2Matting 采用 tracker-to-matting 解耦范式,将视频抠图分为时序跟踪逐帧精细 alpha 预测两个独立阶段,从而在无需视频抠图标注的条件下达到高保真输出。整体流程为:输入视频 + 目标 prompt → 基础跟踪器 → Region-Proposal Bridge → 抠图头 → 输出逐帧 alpha matte。

关键模块

  1. 基础跟踪器(如 SAM2SAM3
    接收任意 prompt(点、框或初始帧 mask),在视频帧间执行高鲁棒性的目标区域跟踪,输出每帧的粗糙区域提议。该模块专注于长程时序一致性,保留完整的 VOS 能力,避免因抠图微调而退化。

  2. Region-Proposal Bridge
    将跟踪器输出的粗糙提议转换为抠图所需的细粒度引导。核心包含 ROI 检测器Pseudo-Trimap 生成

    • ROI 检测器裁剪目标区域,减少背景干扰,提升精细处理效率。
    • Pseudo-Trimap 生成根据粗糙 mask 自动构造三分图(已知前景、已知背景、未知区域),为后续 alpha 预测提供精准过渡带。
  3. Matting HeadsProgressive Alpha Predictor
    在 pseudo-trimap 引导下,采用渐进式修正网络预测每个像素的不透明度。设计上强调对细微结构(如发丝、透明物体)的感知,通过多级细化逐步恢复边缘细节。训练使用了图像抠图数据集上的像素级 alpha 损失与拉普拉斯平滑损失,完全不涉及视频标注。

  4. 优化策略
    解耦训练:跟踪器保持冻结或仅微调少量参数,抠图头独立在图像数据上充分训练;推理时两阶段串联,通过内存记忆机制保证帧间平滑。

与同类方法的差异

传统视频抠图方法直接在视频数据集上联合训练跟踪与细节预测,易因数据稀缺而泛化不足。SAM2Matting 将最先进的 VOS 跟踪器无损复用为前端,结合纯图像抠图训练的后端,首次实现了仅靠图像数据即能超越视频抠图专训模型的性能,同时保持极强的开域(in-the-wild)适应能力与多 prompt 弹性。

实验

实验设计

SAM2Matting 仅在图像 matting 数据集上训练,未使用任何带标注的视频数据;评估则覆盖图像视频双模态,包含定量指标、定性可视化、消融研究、跟踪鲁棒性测试、推理效率及灵活提示等维度。这种设计刻意解耦跟踪与抠图能力,验证框架在不同输入条件下的泛化表现。

关键发现

即使训练时从未见过视频,SAM2Matting 仍在多个视频 matting 基准上达到新 SOTA,展现出极强的时序一致性——alpha 序列流畅且无闪烁。同时,它支持多种 prompt 类型(如初始帧 mask、点击、文本),在人类主体与自然场景中均表现稳健,证明 tracker-to-matting 范式有效弥合了高层语义跟踪与低层细节感知的鸿沟。

与基线对比

传统方法依赖昂贵的视频抠图数据集,且跟踪与抠图高度耦合,导致域外泛化受限。SAM2Matting 通过区域建议桥 + 专用抠图头增强基础跟踪器(SAM2/SAM3),允许跟踪器专注时序一致性、抠图组件处理高精度细节,从而在仅用图像训练的情况下超越以往采用视频监督的方法。消融实验显示,移除任一组件均会显著降低视频 matting 质量,尤其在大范围运动或遮挡场景下,本框架的鲁棒性优势更为突出。

行业影响

落地场景

SAM2Matting 将视频抠图从依赖昂贵时序标注的范式,转向基于基础跟踪器(如 SAM2、SAM3)的解耦框架,仅用图像训练即可泛化至视频。这一特性使其可直接嵌入对实时性、时序一致性和细节要求高的产品:

  • 视频会议与直播:虚拟背景替换、演讲者轮廓精确提取,减少肢体边缘抖动和半透明区域误判。
  • 影视后期与短视频创作:快速分离人物、物体与背景,用于特效合成、绿幕替代,支持点、框、涂鸦等多种提示交互。
  • 电商内容制作:为商品展示视频自动生成透明背景,支持动态更换场景,提升素材生产效率。
  • 自动驾驶与机器人感知:在数据标注中精细分割运动物体,辅助去除复杂背景干扰,或作为在线感知模块预处理步骤。

商业价值

  • 降本:无需昂贵的高质量视频抠图数据集;仅基于图像训练,极大降低数据采集和标注成本。推理过程可复用现有 VOS tracker 的轻量级结构,单卡即可实时运行(论文展示了良好 FPSVRAM 效率)。
  • 增收:在 SaaS 视频工具、云端 API 服务中,提供差异化的高精度抠图能力可提升订阅附加值,吸引专业用户;在直播电商中,动态背景更换能增强商品展示吸引力,间接提升转化率。
  • 体验提升:强时序一致性和对跟踪误差的鲁棒性,大幅减少视频会议中常见的背景闪烁与边缘抖动,带来更自然的沉浸式交互,降低用户疲劳感。

与现有产品/工作流的接口

模型可封装为轻量级 ONNX / TensorRT 推理引擎,通过 REST / gRPC API 接入现有视频处理管道。典型集成方式:

  • 视频编辑软件插件(如 DaVinci ResolveAdobe PremiereOFX 插件):提供画框或点击选目标,后台调用 SAM2Matting 生成 alpha matte 序列,直接应用于时间线。
  • 实时通信 SDK:在 WebRTC 采集后、编码前插入抠图模块,利用硬件加速(CUDA / CoreML)实现低延迟背景替换,适配主流会议客户端架构。

具体落地用例

  1. 在线会议虚拟背景服务
    云视频处理平台将 SAM2Matting 作为后端微服务,客户端仅需发送初始帧的点击或框提示,后续帧自动跟踪并生成 alpha matte。相比传统基于深度学习的分割模型,边缘细节(如发丝、眼镜)更逼真,且对快速运动、遮挡鲁棒,显著提升远程协作的临场感。

  2. 电商直播实时背景合成
    直播软件集成该模型,主播通过鼠标框选指定商品或自身后,系统实时生成 alpha 通道,允许运营人员动态替换品牌背景或促销信息,无需专用绿幕。该方案降低了硬件门槛,同时通过 Pseudo-Trimap 等优化策略保持了高频纹理的锐度,提升商品展示的专业度。

局限

  • - 尽管 SAM2Matting 声称对跟踪不准确具有一定鲁棒性,但其核心仍完全依赖于**预训练 VOS 跟踪器**(如 SAM2 或 SAM3)提供的目标区域。当面对与跟踪器训练数据分布差异较大的场景(如严重的运动模糊、罕见物体外观或复杂遮挡)时,跟踪器本身可能失效,导致**区域提议桥**接收到的位置信息偏差,进而影响后续的伪三值图生成和 alpha 预测。虽然在消融实验中验证了对轻微跟踪误差的抵抗,但根本性的跟踪失败仍会传播为抠图错误,限制了在极端 in-the-wild 条件下的可靠性。
  • - 该方法仅在**图像抠图数据集**上进行训练,未利用视频时序信息进行显式的帧间约束。虽然利用跟踪器的内存传播机制隐式地提供了时序一致性,但这种一致性并未通过像素级损失或光流等时序先验进行优化。在需要长时间稳定的场景(如前景长时间离开画面后重新出现、缓慢的光照变化或背景运动)中,alpha 序列可能出现闪烁或漂移,而这种由纯图像训练带来的时序不稳定性在视频抠图中是常见的挑战。如何将时序平滑性显式融入训练是未来改进方向。
  • - 与其他基于提示的视频抠图方法类似,SAM2Matting 要求用户在**初始帧**明确指定目标(掩码、框或点),这限制了其在全自动视频处理流水线中的应用。尽管支持多种提示类型提升了灵活性,但仍然需要人工参与来定义前景对象。对于一些期望完全自动抠图的应用(如实时视频会议、批量视频编辑),该方法目前无法摆脱对初始交互的依赖。未来的工作可探索将视觉语言模型等语义线索引入,实现无需提示的自动目标发现与抠图。
论文Ruiqi Shen2026-06-25原文

相关内容