论文

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

基于多模态大语言模型(MLLM)的分割面临一个核心分割三难困境:高分割性能、保留对话能力和快速推理。嵌入预测方法可能通过像素级目标破坏语言建模,而下一词生成对密集掩码而言效率低下。我们提出全掩码预测(All-Mask Prediction),将自回归对话与非自回归掩码预测解耦。其二元实例STAMP(Simultaneous Textual All-Mask Prediction)发射词表内的 <SEG 触发符,将图像对齐的掩码令牌与对应的图像块特征融合,并使用混合注意力在一次前向中将所有令牌分类为前景或背景。 thereby 结合了强指代分割与推理分割,同时保留了多模态能力和高效推理。 然而,二元掩码无法在无需重复目标特定预测的情况下保留多个语义或实例身份。因此我们提出结构化全掩码预测(Structured All-Mask Prediction) 并开发了 STAMPlus。它生成带有显式 ID 和可选框的目标列表,将这些 ID 绑定到共享的多类掩码空间,并在一次非自回归前向中联合预测所有目标。一个统一的检查点保留了 STAMP 的指代和推理能力,同时扩展到开放词汇语义分割、实例感知分割和遥感小目标分割,其中高分辨率掩码令牌缩放保留了更精细的空间证据。 在这些设置中,STAMPlus 实现了最先进的分割性能,保持了通用多模态指令跟随,并将 12 类别的延迟从重复 STAMP 推理的 13.50 秒降低到 5.16 秒。进一步分析表明,准确的目标线索改善了分割,学习到的空间基础有益于“再看一眼”推理。总体而言,STAMPlus 解决了超出单目标预测的三难困境。

论文精读

TL;DR STAMPlus 将自回归对话与非自回归掩码预测解耦,通过结构化全掩码预测一次性输出多目标掩码,在分割性能、推理速度与多模态对话能力间实现平衡。

问题

问题背景

基于多模态大语言模型 (MLLM) 的分割任务正追求同时满足 高分割精度、保留对话能力 和 快速推理 的三难困境 (segmentation trilemma)。现有方案常在任一维度上妥协,无法在统一框架中兼顾三者。

现有方法局限

主流路线分为两类,各有明显短板:

  • 嵌入预测方法 (如 LISA) 引入像素级对比损失,与语言建模目标不兼容,会破坏 MLLM 的通用对话能力,且训练时需要显式的分割标注。
  • 逐 token 生成方法 (如 GLaMM、PixelLM) 将掩码作为离散 token 序列自回归生成,对密集分割而言推理速度慢、效率低;同时,其掩码表示受限于单目标或无序类别,难以保留多实例的身份区分。
  • 多数方案一次只能预测单一目标 (single-target),重复推理才能获得多类别/多实例结果,大幅增加延迟,无法应对开放词汇语义分割、实例感知等场景。

为什么这个问题难/重要

核心挑战在于 解耦 语言生成与密集视觉感知:

  • 语言生成需要自回归建模以保持交互质量,而掩码预测天然适合非自回归并行输出,二者在序列结构与优化目标上冲突。
  • 多目标场景要求掩码同时编码 语义类别 与 实例 ID,这对模型的结构化理解能力提出更高要求。
  • 高分辨率遥感小目标、复杂场景的开放词汇分割对掩码的细粒度空间证据保留尤为敏感,需要避免信息压缩损失。 业界关注该问题,因为若能在单个 MLLM 中统一解决上述矛盾,将极大降低部署复杂性和推理成本,推动多模态智能体在真实视觉理解任务中的落地。

行业类比

这类似于编译器中 前端解析与后端代码生成 的分离:对话生成如同语法分析,需保持灵活交互;而结构化掩码预测如目标代码生成,需一次性并行输出,两者解耦后整体效率与能力大幅提升。

核心洞察

  • 将自回归对话与非自回归掩码预测解耦,避免了像素级目标对语言建模的干扰,同时实现一次前向完成所有 token 的分类,大幅提升推理效率。与依赖逐 token 生成的多模态分割方法相比,STAMPlus 在保持强大多模态对话能力的同时,将多类别分割延迟从 13.5 秒降至 5.16 秒,为实时交互式视觉感知提供了新范式。
  • 通过结构化目标列表(显式 ID 和可选边界框)绑定共享多类掩码空间,STAMPlus 能够单次非自回归预测多个目标的语义和实例掩码,统一了引用分割、开放词汇语义分割、实例分割等任务。这突破了二进制掩码方法需要重复目标特定预测的限制,用单一检查点覆盖更广泛的分割场景,同时保持 fine-grained 空间证据,展现了 MLLM 一体化视觉理解的潜力。

方法

输入与总体框架

STAMPlus 以 图像 和 文本指令 为输入,采用两阶段解耦设计:先通过自回归语言模型生成结构化目标描述,再通过非自回归模块一次性预测所有目标的掩码。这种“先对话后分割”的范式将语义理解与像素级预测分离,避免相互干扰。

阶段一:结构化目标生成

在 MLLM 的自回归解码过程中,当需要分割时,模型不直接输出掩码,而是生成一个 结构化目标列表。每个目标带有显式的 身份 ID 和可选的 边界框坐标,例如 [ID:1, box:(x1,y1,x2,y2); ID:2, ...]。这一阶段保留了 MLLM 的对话与推理能力,因为文本输出方式未发生改变。

阶段二:结构化全掩码预测

接收到阶段一的 ID 列表后,视觉编码器从输入图像中提取 patch 特征,并将可学习的 掩码令牌 (mask tokens) 以图像对齐的方式与 patch 特征融合。关键创新在于 共享多类掩码空间:所有目标 ID 被绑定到同一空间的不同通道或维度,通过 混合注意力 (hybrid attention) 机制,模型在一个前向传播中同时对每个 patch 进行分类,输出每个 ID 对应的前景/背景概率。STAMPlus 还引入 高分辨率掩码令牌缩放 技术,在保持计算效率的同时提升对微小目标的细节保留。

输出与差异点

最终输出为与目标 ID 对应的多类掩码图,支持指代分割、推理分割、开放词汇语义分割及实例分割。与先前方法相比,STAMPlus 的核心区别在于:它不使用逐令牌的掩码生成或嵌入损失,而是将多目标掩码预测统一为一次非自回归分类,从而在维持 MLLM 对话能力的同时,将 12 类目标的推理耗时从重复 STAMP 推理的 13.50 秒降至 5.16 秒,真正解决了分割性能、对话保持与推理速度的三难问题。

实验

实验设计

STAMPlus 在单目标推理分割(自然图像与遥感小目标)、开放词汇语义分割、实例感知分割等多个任务上进行了评估,并与基于 MLLM 的分割方法对比。同时,设计了分割-理解交互实验,分析目标线索对分割质量的提升以及分割结果对多模态理解的增益。效率分析则关注在 12 个类别上联合预测的延迟,对比重复调用 STAMP 的耗时。

关键发现

  1. 性能与效率兼得:STAMPlus 在统一模型下保持了 STAMP 的单目标参考分割能力,并扩展到多目标结构化分割,在各项任务均取得 SOTA 表现。
  2. 推理加速显著:通过一次非自回归的前向传播同时预测所有目标,12 类别的总延迟从 STAMP 的 13.50 秒 降至 5.16 秒,速度提升约 2.6 倍,解决了逐目标预测的效率瓶颈。
  3. 空间先验的重要性:准确的目标线索(如 ID 和框)显著改善分割精度;学习到的空间定位能力有利于“再思考”式推理。
  4. 高分辨率保障细节:针对遥感小目标,高分辨率 mask token 缩放保留了更精细的空间证据,避免了传统方法中的细节丢失。

与基线对比的深度解读

传统的嵌入预测方法在引入像素级目标时会破坏语言模型的对齐,而逐 token 生成掩码效率极低。STAMP 虽通过全掩码预测解耦了对话与掩码,但只能处理单目标,无法保留实例或语义身份。STAMPlus 提出结构化全掩码预测,在一次推理中联合输出带显式 ID 的多目标掩码,直接弥合了单目标与多目标分割的鸿沟。对比重复调用 STAMP,STAMPlus 不仅延迟降低到原来的 38%,还避免了多次前向传播导致的内存与计算冗余。同时,其开放词汇能力明显优于仅依赖固定类别集的方法,展示了统一的掩码空间绑定策略在多任务场景下的强大泛化能力。

行业影响

STAMPlus 通过结构化全掩码预测,首次在单个 MLLM 中平衡分割精度、对话能力与推理效率,为需要实时视觉理解与交互的产品提供了新的模型范式。

落地场景

  • 交互式图像/视频编辑工具:支持用户用自然语言指定多个目标,一次性生成实例级掩码,实现快速背景替换、物体移除或风格化。
  • 机器人视觉与具身智能:在复杂场景中同时识别并分割多个物体,保持对话交互,可服务于拣选、导航等任务。
  • 自动驾驶感知系统:多目标同时分割(车辆、行人、交通标志)与自然语言解释结合,提升人机信任与安全接管效率。
  • 电商与内容平台:商品图片自动抠图、多物体关联文本描述,赋能搜索、推荐与创作工具。

商业价值

  • 降本:将 12 类分割的推理时间从 13.50s 压缩至 5.16s,大幅降低 GPU 时间成本,使高精度分割在实时场景中可行。
  • 增收:统一模型保留通用多模态对话能力,避免为不同分割任务维护多个专用模型,减少部署与维护开销。
  • 体验提升:单次非自回归推理即可输出实例级多目标掩码,支持“看两次”(look-twice)的推理链,让产品交互更流畅、更智能。

与现有工作流的集成

STAMPlus 可作为一个 分割头模块 插入主流 MLLM(如 LLaVA )中。输入图像与文本指令后,模型首先生成包含目标 ID 的结构化文本,然后通过 <SEG> 触发符激活全掩码预测分支,直接输出多类掩码。该分支与自回归对话解耦,不影响原有语言能力,可无缝对接现有的多模态推理管线。同时,高分辨率掩码 token 缩放机制允许灵活适配不同分辨率的编码器,便于在边缘设备上部署。

典型用例

  1. 跨境电商商品图自动编辑:商家上传一张包含多个商品的场景照片,输入指令“提取所有鞋类产品,生成透明背景图”。STAMPlus 一次性输出实例级分割掩码,并保持对话能力以应对后续调整(如“把红色那双调亮”),无需多轮推理,大幅提升商品上架速度。
  2. 自动驾驶多目标感知与人机交互:车辆感知系统实时解析前向画面,同时分割出所有交通参与者,并在对话界面给出解释(如“前方有两位行人和一辆自行车,正从右侧逼近”)。结构化全掩码预测确保低延迟,且模型不丧失对复杂路况的推理理解,有助于安全决策。

局限

  • 方法依赖第一阶段生成的目标列表(target list)和可选边界框(optional boxes),若该阶段产生错误或遗漏,会导致后续结构化掩码预测失效,尤其对于复杂场景中重叠或小目标,该阶段的鲁棒性未充分验证。论文未深入探讨当目标数量或类别极大时的扩展性,比如在 COCO 全景分割等任务中,共享多类掩码空间的容量可能成为瓶颈。
  • 实验主要聚焦于自然图像和遥感小目标分割,虽然覆盖了开放词汇语义和实例感知分割,但缺少与更多类别密集预测任务(如全景分割、视频分割)的系统对比。此外,效率分析仅对比了重复 STAMP 推理的延迟,未与最新的高效分割 MLLM(如 LISA 的变体或生成式分割方法)进行运行时和内存占用的全面比较。
  • 模型训练需要多阶段(对话生成和掩码预测),且使用了高分辨率掩码 token 缩放,这可能增加训练复杂度和数据需求。论文未详细说明在不同规模 LLM 主干上的泛化性能,且 Star count 较低(40)可能意味着社区验证尚不充分,实际部署的工程挑战(如推理优化、量化等)有待探索。
论文Jiazhen Liu2026-08-03原文

相关内容