论文

InstructSAM: 根据任意指令分割任意实例

InstructSAM: 根据任意指令分割任意实例

本文提出 InstructSAM,一个统一且精简的框架,用于在任意指令下进行多实例分割。我们将指令驱动的实例分割公式化为集合结构查询预测问题,并设计了一个显式的推理到实例查询接口,优雅地桥接视觉语言模型(VLM)和 SAM3。 具体而言,一组可学习的实例查询被注入 VLM,并与指令和视觉信息进行上下文关联,使每个查询成为实例感知槽。混合注意力机制进一步促进这些查询、视觉令牌和指令令牌之间的交互,改善实例枚举并减少重复预测。生成的 LLM 条件查询被投影到 SAM3 的检测器查询空间,以在前向传播中驱动准确的多实例分割。该设计使 SAM3 具备高层指令理解、组合推理和实例级集合预测能力,而无需修改其核心架构。 为支持训练和评估,我们构建了 Inst2Seg,一个高质量、大规模的基于指令的实例分割数据集和基准,将自由形式指令与实例级掩码耦合。大量实验表明,仅 2B 规模的 InstructSAM 在复杂指令驱动和短语级指代分割基准上均取得强劲结果,优于先前的端到端方法和 SAM3 的代理管道,同时实现高效的单次多实例预测。

论文精读

TL;DR InstructSAM 通过可学习实例查询将 VLM 与 SAM3 对齐,实现任意指令的多实例单次分割,在复杂推理上超越 SAM3 agentic 管线。

问题

问题背景

实例分割是具身智能、自动驾驶、医疗影像等应用的基础能力。随着 Segment Anything Model (SAM) 系列不断迭代,SAM3 已将可提示分割拓展至开放世界概念级。但在真实交互中,系统需要根据任意自由形式的自然语言指令(如“分割出所有红色且被遮挡的水果”)同时定位并分割多个实例,而非仅响应简单的点、框或单一类别文本提示。

现有方法局限

当前方案主要存在两种范式的缺陷:

  • Agent 式流水线(如 SAM3 的 agentic pipeline):将复杂指令拆解为多步推理循环,每次调用 SAM 生成候选掩码,再通过验证与筛选输出最终结果。这种方式推理代价高、延迟大,且多步误差累积会导致召回不足或重复预测。
  • 端到端短语级指代分割:现有文本驱动的模型多针对单一短语(如“左边的杯子”)设计,缺乏对组合逻辑指令(属性、关系、计数等)的深层理解,无法在一次前向传播中输出实例数量可变的精确掩码集合。

为什么这个问题难/重要

核心挑战在于需要将自然语言的组合语义精准映射为图像中的集合结构化实例预测:既要理解指令中隐含的实例数量、属性约束与空间关系,又要保证每个实例的分割精度,同时不破坏基础分割模型的泛化能力。这要求模型同时具备高阶视觉语言推理、集合级目标枚举与单实例细粒度定位的复合能力。业界对指令驱动的通用视觉基础模型高度关注,它是迈向可对话操作的视觉助手的关键技术节点。

行业类比

该任务与“交互式批量图像编辑”场景高度契合,例如用户说“将画面里所有戴眼镜的人调亮”,编辑引擎必须先依据指令一次性分割出所有目标实例,才能批量施加调整。

核心洞察

  • 通过将指令驱动的实例分割建模为集合结构查询预测,InstructSAM 利用可学习实例查询在单次前向传播中直接输出多实例掩码,避免了传统方法中逐区域提议或迭代推理的低效问题。这种设计将高层的指令理解和组合推理与低层像素级分割解耦,但又通过查询投影紧密耦合,相比 SAM3 的 agentic pipeline 或两阶段模型,显著减少了推理时间和重复预测,对于实时交互系统尤为重要。
  • InstructSAM 提出了显式推理到实例查询接口,将 VLM 生成的条件查询注入 SAM3 的检测查询空间,使 SAM3 在无需修改核心架构的前提下获得了对任意指令的理解能力。这不同于之前针对 SAM 的调优方法(如引入额外解码器或修改提示编码器),而是通过轻量的查询投影保持了 SAM3 原有的强泛化能力,使得模型可以统一处理复杂推理分割和短语级指称分割,降低了多任务部署成本。

方法

InstructSAM 将指令驱动的多实例分割形式化为一个 集合结构查询预测(set-structured query prediction)问题,整体流程可概括为:

  1. 输入:图像 + 任意自由形式的自然语言指令。

  2. 核心模块

    • 并行实例查询库(Parallel Instance Query Bank):一组可学习的查询(instance queries)被注入到视觉语言模型(VLM)中,并与指令和视觉特征一起进行上下文编码,使每个查询演化为一个 实例感知槽(instance-aware slot)。
    • 混合注意力(Hybrid-Attention):在 VLM 内部,设计了一种促进实例查询、视觉 token 和指令 token 三者交互的注意力机制,增强模型对实例个数的感知并抑制重复预测。
    • LLM 条件查询投影:经过 VLM 上下文化后的查询被映射到 SAM3 的检测器查询空间,直接驱动 SAM3 的掩码解码器。
  3. 输出:在单次前向传播中生成所有符合条件的实例掩码,无需迭代式提示或后处理。

训练时,通过掩码匹配损失(如匈牙利匹配)端到端优化整个流程,并辅以 Inst2Seg 数据集提供的指令-掩码对齐监督。

与基于代理(agentic)的多次调用 SAM 或先检测后分割的级联方法不同,InstructSAM 在一个统一框架内完成了从高层指令理解到实例级集合预测的全过程,兼具高效与精确。

实验

实验设计

InstructSAM 在 指令驱动的多实例分割短语级指代分割 两条线上验证能力。核心设计是把指令理解、组合推理与掩码预测压缩进一个前向过程,所以基准选择必须覆盖 自由形式指令单短语引用 两种输入。

  • 论文新构建的 Inst2Seg 数据集是关键测试平台,提供成对的自然语言指令与实例级掩码,规模大且标注质量高。
  • 同时也在公开的短语级指代分割基准上评估,验证模型在更简短、更明确的指令下的泛化能力。
  • 对比对象包括 先前端到端方法 以及 SAM3 的 Agent 流水线,后者需要分步调用推理与分割模块,而 InstructSAM 只需一次前向。

关键发现

  • 单次前向即可完成多实例分割,不再需要反复提示或额外的目标检测模块。这对实时性要求高的工程场景(如机器人感知、交互式编辑)极具吸引力。
  • 仅 2B 参数的模型在复杂指令和短语级指代分割任务上均取得强结果,说明通过将可学习实例查询注入视觉语言模型,可以用较小算力获得高效的分割能力。
  • 混合注意力机制有效减少重复预测,查询之间显式的交互促进了更准确的实例枚举和去重。

与基线对比深度解读

SAM3 的 Agent 流水线 相比,InstructSAM 的核心优势是 端到端效率

  • SAM3 需先解析指令,再逐步为每个实例生成提示并调用分割头,线性依赖于实例数量,容易出现错误累积。
  • InstructSAM 将所有实例作为一组结构化的实例感知槽 一次性推理,推理时间几乎不随实例数量增长,且避免了多步交互带来的漂移。
  • 与同类端到端方法相比,InstructSAM 的显式推理-实例查询接口 更好地对齐了高层次指令理解与像素级掩码输出,降低了漏报与过分割。这一设计为后续在开放世界场景中集成基础分割模型提供了直接可用的范式。

行业影响

落地场景

InstructSAM 将任意指令直接映射到多实例分割掩码,天然适配需要自然语言交互的视觉任务。典型用例包括:

  • 电商商品图处理:运营人员输入“把图片里所有带logo的运动鞋扣出来”,系统一次性输出所有实例的精确分割,无需逐一遍历点击。相比传统 prompt-based 模型(如 SAM3),显著减少人工操作步骤。
  • 自动驾驶数据标注:针对长尾场景(如“标注雨天中打伞的行人”),标注员用自然语言描述即可批量生成实例掩码,不再依赖预定义类别,大幅提升标注效率与覆盖面。
  • 内容安全审核:对 UGC 平台,输入“找到画面中所有注射器或违禁药品”,直接从图像中定位并分割敏感物体,辅助人工或自动化审核流水线。

商业价值

核心价值在于降低复杂分割任务的人机交互成本缩短工程链路

  • 降本:传统 agentic 流水线需多次调用 VLM + SAM 并解析中间结果,InstructSAM 单次前向即可完成,推理成本与延迟均大幅下降,尤其适合高吞吐业务(如电商秒杀商品批量处理)。
  • 增收/体验提升:基于指令的灵活分割可赋能交互式设计工具(如虚拟试穿、商品图更换背景),用户只需说出需求即可获得高质量分割结果,提升产品粘性和转化率。
  • 数据飞轮:配合新构建的 Inst2Seg 数据集和指令遵循范式,模型可通过用户反馈持续微调,适应业务特有的指令分布,形成数据驱动的迭代闭环。

与现有产品/工作流的接口

InstructSAM 的设计本质上是 VLM + SAM3 的零侵入桥梁,集成了现有分割基础架构:

  • 模态对齐:通过在 VLM 内部注入可学习的 实例查询(instance queries) 和混合注意力,将 VLM 的文本理解结果投射为 SAM3 检测器的查询格式,无需修改 SAM3 核心权重。
  • 即插即用集成:在实际部署中,可将 InstructSAM 作为微服务插入现有视觉 pipeline:前接任何支持指令输入的 VLM(如 LLaVA),后接 SAM3 的掩码解码器,形成 指令 → 查询 → 掩码 的标准化接口。
  • 与 RAG/Agent 结合:在需要外部知识或链式推理的场景(例如“找出图中所有比苹果更贵的水果”),可保留 InstructSAM 作为分割执行器,上游由 Agent 调用搜索引擎或数据库获取视觉属性,下游直接输出实例分割结果,兼顾灵活性和效率。

局限

  • - **模型容量与场景覆盖的固有限制**:InstructSAM 的可学习实例查询库预设固定数量的查询槽,限制了单张图像的最大实例数。在密集场景(如人群、细胞)中,槽位可能不足;在稀疏场景中则存在冗余计算。混合注意力虽能抑制重复预测,但无法突破容量上限。同时,模型依赖 SAM3 的分割能力,若 SAM3 在特定域(如 medical image 或 tiny objects)表现不佳,InstructSAM 无法独立纠正,灵活性受限于基础模型的边界。
  • - **数据集驱动的泛化风险**:Inst2Seg 数据集通过模板化指令和预训练检测模型自动生成伪标签,虽规模宏大,但覆盖的指令类型和视觉概念仍可能有限,难以完全模拟真实开放域的自由形式指令。伪标签噪声会累积偏差,且数据构造过程可能导致模型在未见过的复杂组合或罕见概念上表现脆弱,影响 open-world 泛化。作者未讨论 distribution shift 下的鲁棒性分析。
  • - **训练效率与多任务保留的折衷**:方法需要对 VLM 和 SAM3 的部分模块进行联合微调,这要求较高的计算资源(2B 规模已需大量 GPU 内存),且微调 VLM 可能损害其在原始对话或推理任务上的能力。论文未探索参数高效微调(如 adapter 或 prompt tuning)的可能性,也未验证多任务连续学习场景下模型能力保持情况,限制了其作为即插即用模块在已有 VL 系统中的部署实用性。
论文Yuqian Yuan2026-05-25原文

相关内容