论文

AuralSAM2: 通过金字塔音频-视觉特征提示让 SAM2 听见

AuralSAM2: 通过金字塔音频-视觉特征提示让 SAM2 听见

Segment Anything Model 2 (SAM2) 在视频片段的可提示分割中展现出强大的泛化能力,但其与音频模态的集成仍未充分探索。现有方法要么通过基础模型将音频转换为视觉提示(如边界框),要么向图像编码器注入适配器进行音频-视觉融合。然而,在人在回路场景中,这两种方法均因提示精度有限和推理开销增加而存在不足。特别是,基于适配器的方法常遭受音频提示稀释问题,即信号在网络中传播时逐渐减弱。 为此,本文提出 AuralSAM2,它在很大程度上保留 SAM2 可提示分割能力的同时集成音频。其核心模块 AuralFuser 融合音频与视觉特征,生成稀疏和密集提示。基于音频引导并依托 SAM2 的特征金字塔,这些提示将听觉线索传播至各视觉层,增强跨模态影响。为进一步对齐模态,引入音频引导对比损失,强调主要视觉特征中的听觉相关性。 在公开基准上,该方法仅对可提示分割的交互效率产生微小影响,即带来显著的精度提升。代码已开源。

论文精读

TL;DR AuralSAM2 创新性地将音频信号转化为 SAM2 金字塔的多层视觉提示,通过对比损失强化跨模态对齐,在保持即时交互的同时大幅提升视听分割精度。

问题

问题背景

音频驱动的视频对象分割(AVS)旨在根据声音信号定位并分割视频中的发声物体。随着 Segment Anything Model (SAM) 系列在视觉提示分割上的成功,业界开始探索将音频模态融入 SAM2 的交互式分割范式,以实现“听声辨物”的能力。

现有方法局限

目前主要有两类技术路线:

  • 音频转视觉提示:利用上游模型(如语音识别或声音分类)将音频转换为边界框或点,再输入 SAM2。此方式严重依赖提示转换的精度,且在多声源、弱声音场景下容易失效,导致分割错误传播。
  • 适配器注入:在 SAM2 的图像编码器中插入轻量级融合模块(如 GAVS, SAMA-AVS),直接混合音频特征。但这类方法普遍面临 音频提示稀释(audio prompt dilution)——音频信号在经过深层网络传播时逐渐衰减,难以有效影响高层视觉特征,同时增加了推理延迟,破坏了 SAM2 原有的实时交互性。

为什么这个问题难/重要

技术挑战主要体现在:

  1. 跨模态对齐与保留:如何在融合音频信息的同时,不破坏 SAM2 强大的视觉先验和零样本泛化能力,避免灾难性遗忘。
  2. 层次化提示传播:音频线索需要贯穿视觉特征金字塔(从浅层到深层),解决信号在深层网络中的弱化问题,这对多尺度视觉理解至关重要。
  3. 交互效率:在 human-in-the-loop 场景中,每帧推理时间必须保持在毫秒级,任何额外计算开销都会影响用户体验。

该问题的重要性源于多模态交互的行业趋势——从视频编辑、监控分析到增强现实,能够根据自然语音指令“分割我说到的物体”将成为下一代智能影像工具的刚需,而现有方法在精度与速度上的折衷远未达到实用门槛。

行业类比

类似自动驾驶中融合激光雷达与摄像头的多模态感知,音频-视觉分割也需在保留单模态强能力的前提下,用最少的计算代价实现跨模态增强,而不是简单“叠加”两个模型。

核心洞察

  • **金字塔提示注入** 绕过音频提示稀释: 现有适配器方案 (如 GAVS、SAMA-AVS) 将音频注入图像编码器, 但音频信号在网络逐层传播中会逐渐衰减, 导致分割精度下降. AuralSAM2 通过 AuralFuser 直接生成稀疏与密集提示, 并沿 SAM2 的特征金字塔逐层注入, 让音频信息在多个视觉层级上重复强化. 这一设计既保留了 SAM2 原生的提示式交互能力, 又避免了适配器引入的额外推理开销, 更贴合人机交互场景对实时性的需求.
  • **音频引导对比损失** 实现高效跨模态对齐: 多模态融合通常依赖复杂的交叉注意力或专用对齐模块, 计算成本高. AuralSAM2 引入的 AudioCon 损失在主导视觉特征上施加音频相关性约束, 通过对比学习拉近同语义的音视对、推远无关对. 这种轻量级策略无需新增推理分支, 仅在训练阶段引导模型学会将听觉线索聚焦于相关视觉区域, 为多模态分割提供了一种低开销、易部署的对齐范式.

方法

输入与预处理

AuralSAM2 以音频-视频对作为输入,其中视频帧经过 SAM2 的图像编码器提取多尺度视觉特征金字塔,音频则通过预训练音频编码器(如 VGGish)转换为特征序列。该方法不依赖外部模型将音频转换为边界框等显式视觉提示,而是直接融合原始视听特征,避免了中间转换带来的信息损失和额外推理开销。

核心模块:AuralFuser 与金字塔式提示生成

AuralSAM2 的核心是 AuralFuser 模块,它负责将音频特征与视觉特征融合,生成两类可注入 SAM2 的提示:

  • 稀疏提示(sparse prompts):类似于点或位置编码,定位最相关的空间区域;
  • 密集提示(dense prompts):提供逐像素的跨模态关联信号。

融合过程充分利用 SAM2 的金字塔特征结构:音频信号被反复注入不同尺度的视觉层,形成自顶向下的音频引导通路。这种金字塔式提示传播(Pyramid Audio-Visual Feature Prompting)有效缓解了传统适配器方法中常见的“音频提示稀释”问题——即音频信号随网络深度增加而逐渐衰减。

训练策略:音频引导对比损失

为实现更好的模态对齐,AuralSAM2 引入音频引导对比损失(AudioCon),它在视觉特征图的显著区域增强与音频相关的表达。具体做法是:在视觉特征上施加损失,使与音频语义一致的区域响应更强、不一致的区域被抑制,从而让模型学会关注“发声物体”的关键视觉特征,无需额外标注即可提升分割精度。

输出与推理效率

AuralSAM2 最终输出像素级分割掩码,与原生 SAM2 完全兼容,支持在交互式场景中结合人工提供的点、框等视觉提示进一步修正结果。得益于轻量级设计,AuralFuser 对 SAM2 原有的推理速度影响极小,在保持高效交互的同时实现了显著的精度提升。

与同类方法的差异

相比 GAVS 等基于适配器的方法,AuralSAM2 不将音频压缩为单一向量注入编码器,而是通过稀疏+密集双路提示直接作用于 SAM2 的记忆与解码阶段,更彻底地保留了音频的空间定位能力,且无需额外后处理或重训练视觉骨干网络。

实验

实验设计

AuralSAM2 在公开视听分割基准上进行评估,主要与三类方法对比:

  1. 适配器方案GAVSSAMA-AVS,它们在 SAM2 图像编码器内注入适配器以融合音频。
  2. 音频转视觉提示AL-REF 等,通过基础模型将音频转为框或点。
  3. 人类在环模拟SAM2 (Ensemble),结合上述方法的输出与来自真值的点/框提示,测试交互场景下的上限。

评估指标包括分割精度(如 Jaccard 指数F-score)与推理效率。所有实验均保持 SAM2 的原始提示分割能力,仅添加 AuralFuser 模块与音频引导对比损失 (AudioCon)。

关键发现

  • 音频提示传播有效:通过 SAM2 的特征金字塔注入稀疏与密集提示,听觉信号可跨视觉层强化跨模态影响,克服了适配器方法中常见的音频提示稀释问题。
  • 模态对齐改善AudioCon 损失强调与音频相关的显性视觉特征,使融合更具针对性。
  • 效率几乎无损:AuralSAM2 在取得显著精度增益的同时,对交互式分割的推理效率影响极小,这在人类在环场景中至关重要——现有方法往往因推理开销增加而不可用。

与基线的深度对比及工程启示

相对适配器方案,AuralSAM2 未修改图像编码器,保留了 SAM2 原本强大的视觉提示分割能力,避免因特征空间扭曲导致的通用性下降。其即插即用的 AuralFuser 设计,使得在实际工程中部署时,只需加载预训练权重并接入音频流,无需重新训练整个 SAM2 模型,大幅降低迁移成本。

相较音频转提示的方法,AuralSAM2 直接利用原始音频特征生成提示,不依赖外部模型转换,减少了级联误差与延迟,尤其适合低延迟交互应用。实验验证了金字塔级联的提示注入比仅在单层融合更有效,这为多模态分割任务的架构设计提供了明确指导:

"guided by audio and built upon SAM2’s feature pyramid, these prompts propagate auditory cues across visual layers, reinforcing cross-modal influence."

未来工作可探索将该思路拓展至其他基础模型,或结合自监督预训练进一步降低对标注音频数据的需求。

行业影响

落地场景

AuralSAM2 将音频感知注入 SAM2 的可提示分割流程,使视频中发声物体能被精准定位与分割,适用于多种产品形态:

  • 内容创作与直播:Vlog 拍摄时,说话人自动抠像可简化多机位剪辑;电商直播中,演示者手持商品并伴有讲解声,系统实时分割商品区域,叠加 AR 信息或购买链接,提升转化。
  • 智能监控与安全:结合声音事件(玻璃破碎、警报、呼救),即时分割出声源(破碎窗户、人员),提升异常检测的精确度并降低误报。
  • 混合现实与人机交互:在 MR/AR 头显中,用户注视场景并询问“哪个在响?”,系统通过音频线索分割并高亮发声设备,实现自然的多模态交互。

商业价值

该方法在保持 SAM2 点击/框选交互效率的同时,以极低的推理开销(论文指出对交互效率影响 minimal)引入音频模态,带来三重价值:

  • 降本:自动化音频-视觉分割减少视频标注和抠像的人工耗时,尤其适用于 UGC 内容批量处理的场景。
  • 增收:为专业剪辑工具(如 Adobe Premiere 插件)、云视频 API 或直播软件提供差异化功能,可形成增值订阅或按量计费模块。
  • 体验升级:在教育、会议、游戏直播中,音频触发分割可让讲解者自然成为焦点,提升沉浸感与用户粘性。

集成方式与现有工作流接口

核心模块 AuralFuser 可作为 SAM2 的轻量插件集成:

  • 离线管线:接收视频帧及音频流,通过 Python/C++ SDK 输出分割掩码;可导出 ONNX 或 TensorRT 模型,适配 NVIDIA GPU 或 Apple Silicon 端侧推理。
  • 实时流式处理:与 GStreamer 或 FFmpeg 滤镜链结合,处理摄像头+麦克风输入,输出带 mask 的元数据,供下游应用消费,便于嵌入边缘设备。
  • 多模态 Agent 协同:与大语言模型解析的用户语音指令衔接,提取目标音频片段后交 AuralSAM2 执行分割,构造理解-分割-交互的闭环。

原作者方案通过 pyramid audio-visual feature prompting 缓解了“音频提示稀释”问题,使跨模态影响贯穿视觉层级,为音频-视觉分割提供了工程上可落地的路径。代码已开源:https://github.com/yyliu01/AuralSAM2

局限

  • **跨域泛化能力不足**:AuralSAM2 在公开基准(如 AVSBench)上的评估主要基于受控环境下的音视频数据,论文未展示对域外音频(如高噪声、混响或多语种语音)的鲁棒性分析。此外,AuralFuser 依赖预训练的音频编码器(文中虽未点名,推测为 ImageBind 或 CLAP 类模型),这类编码器若未在目标场景微调,易导致**音频提示稀释**的残留问题,尤其是在视觉特征占主导时,音频信号可能被淹没,影响分割精度。实际部署中,若换用不同的音频 backbone,融合效果可能骤降,这限制了其作为通用组件的可靠性。
  • **交互效率的隐蔽开销**:论文称方法对 promptable segmentation 的交互效率影响极小,但该结论建立在**模拟 human-in-the-loop** 的离线实验上——使用真值框和点作为提示,而非真实用户交互。实际交互中,AuralFuser 需要实时处理音频流并生成稀疏/密集提示,这对计算延迟和内存占用提出额外要求。尤其当 SAM2 本身已在视频序列上执行密集传播时,叠加音频分支可能导致帧率显著下降,在边缘设备或低延迟应用中难以满足实时性。此外,AuralFuser 仅被轻量提及,其推理开销的具体数值(如 FLOPs、延迟增量)并未与纯视觉 SAM2 做细致对比,这使得工程可行性存疑。
  • **多声源场景下的歧义性**:AuralSAM2 擅长分割与音频信号对应的 sounding object,但当场景中存在多个发声物体、且部分声源间歇性出现时,音频提示可能产生**歧义映射**。例如同时有人声和乐器声,模型倾向于输出融合区域而非独立实例,这与 SAM2 原生强大的视觉实例分离能力形成冲突。论文未讨论在多实例、部分重叠声源下的分割策略,也未提供相应的失败案例分析。对于实际应用(如监控、会议记录),此弱点意味着需要额外设计解耦机制,从而削弱了其开箱即用的优势。
论文Yuyuan Liu2026-05-14原文

相关内容