MAOAM: 基于视觉-语言模型的统一对象与材质选择
选择是交互式图像编辑中的核心操作。为实现实用化,用户应能通过文本或点击交互来指定并消歧所需选择区域,且系统应支持不仅选择对象,还能选择其他标准如材质。基于材质的选择对于重新纹理表面或编辑特定材质实例等任务很有价值。然而,现有的基于视觉-语言模型 (VLM) 的选择方法以对象为中心,通常仅支持单一交互模态,限制了其适用性。 为此,本文提出Mask Any Object And Material (MAOAM),一个统一的选择框架,能够在文本和点击交互中实现精确的对象级和材质级选择。MAOAM 利用带有分割头的 VLM 根据用户提示生成像素级精确掩码:VLM 解释用户的选择意图(对象或材质级)并编码视觉实体、属性和空间关系,而分割头将输出令牌解码为掩码。一个关键挑战是缺乏带有文本标注的材质选择数据集。我们提出一种可扩展的数据生成流程:收集带有材质掩码的真实与合成图像,并利用 VLM 生成具有丰富视觉语义的材质描述。 我们通过多任务目标训练 MAOAM,涵盖点击和文本选择,并辅以从材质描述中衍生的辅助 VQA 任务,以促进更深层的材质理解。尽管仅使用单模态提示训练,我们的模型在推理时结合文本与点击时表现出涌现性改进,从而实现灵活的图像编辑工作流。实验表明,在多种对象、材质和交互场景下,MAOAM 能实现准确且连贯的选择,突显了其鲁棒性。
论文精读
TL;DR MAOAM 基于视觉语言模型统一对象与材质选择,支持文本/点击交互,通过合成材质数据与多任务训练突破标注瓶颈,并涌现多模态组合能力。
问题
图像编辑的核心操作之一是选择,它使得局部调整、合成与重纹理化成为可能。近年来,视觉语言模型 (VLM) 在图像分割领域进展迅速,能够根据文本描述或点击交互生成精准的掩膜。然而,现有方案普遍以对象为中心,仅支持对“人物”“汽车”等明确物体的选择,难以处理材质(如“木质”“布料”)这类视觉属性。此外,多数模型仅支持单一交互模态(纯文本或纯点击),且无法有效融合多模态提示,限制了更灵活的编辑流程。
现有方法局限:
- 对象级选择偏置:基于 VLM 的分割模型(如 GLaMM、Sa2VA)的训练数据集中于对象实例(如 COCO),缺乏材质掩膜与对应语言描述,导致材质选择能力缺失。
- 交互模态割裂:点击与文本选择通常由不同模型或分支处理,未能在统一架构内融合,用户无法通过“点击+描述”组合来消歧义或精细调控选区。
- 数据集匮乏:材质选择需要像素级材质标注与丰富的自然语言描述,但现有公开数据集很少提供此类信息,手工标注成本高昂且主观性强。
为什么该问题重要且困难:
- 技术挑战:材质是连贯、无明确轮廓的区域,往往不遵循物体边界,对模型的空间推理和属性理解要求远高于对象分割。VLM 必须学会将“木纹”“金属光泽”这类低级视觉模式与高级语义关联。
- 数据管道构建难度:真实图像中材质掩膜标注稀缺,而合成数据虽可提供精准标签,却存在领域鸿沟。如何利用 VLM 生成高质量材质描述并过滤噪声,是训练可靠模型的关键。
- 工业需求迫切:在图像编辑、3D 重新纹理、电商素材批量处理等应用中,材质级选择能极大提升工作效率,减少手动抠图。例如,设计师常需替换场景中所有“皮质”表面,而非一个个选中物体。
行业类比:如同 Adobe Photoshop 的“选择主体”功能将对象选择效率提升了一个量级,MAOAM 试图为材质和对象选择提供一个统一的智能接口,让交互式图像编辑从“选东西”进化到“选材质”。
核心洞察
- - MAOAM 首次将视觉语言模型的选择能力从对象拓展至材料,填补了交互式图像编辑中基于材料的像素级选择空白。现有 VLM 选择方法如 GLaMM、Sa2VA 等主要聚焦实例/对象分割,但无法处理跨实例的材料区域(如木材、金属)。MAOAM 通过可扩展的材料掩码-描述生成管线,使模型理解材料视觉语义,并统一对象与材料选择于同一架构,在重纹理化等真实编辑任务中更具实用价值。
- - 训练与推理的模态解耦带来 emergent multimodal interaction,仅用单模态提示训练,即可在推理时融合文本与点击,实现更精准的选择。模型在文本或点击单模态数据上进行多任务训练,但面对文本+点击的联合提示时,能零样本组合空间与语义信息消歧,远超训练分布。这种特性为交互系统提供了低成本的模态扩展路径,无需额外构造多模态配对数据,显著提升编辑灵活性。
方法
整体框架
MAOAM 构建在 视觉-语言模型(VLM) 之上, 由一个 VLM 编码器与一个分割头(segmentation head) 组成, 形成端到端的统一选择框架。 系统接收图像、 文本查询或点击坐标(以星形标记 overlay 在图像上), 输出像素精度的选择掩码。
输入与意图解析
用户输入可以是自然语言查询(如“select the wooden surface”)、 点击点(单点或多点), 也可在推理时同时提供文本与点击以实现更强的消歧能力。 VLM 首先解释用户意图: 目标是否为物体级选择, 还是材质级选择; 同时编码视觉实体、 属性及空间关系。 点击被转化为视觉标记叠加在图像上, 文本则通过 VLM 的语言分支处理, 两者在多模态注意力中交互。
关键模块
- VLM 编码器: 基于 LLaVA-v1.5 或 Qwen2.5-VL 等架构, 负责理解场景语义并定位用户意图对应的区域。 输出一个可学习的 select token(或一组 token), 该 token 携带了被选目标的视觉-语义特征。
- 分割头: 接收 select token 的隐藏状态, 像 SAM 等分割解码器一样, 将其解码为与原图分辨率对齐的二值掩码。 这保证了掩码的像素精度。
训练策略
训练采用多任务学习目标:
- 点击选择损失: 基于标准掩码监督(DICE + BCE)。
- 文本选择损失: 同上, 使用生成的材质描述训练。
- 辅助 VQA 任务: 利用材质描述自动生成问答对, 帮助模型更深入地理解材质属性, 提升语义对准能力。
为解决材质选择数据稀缺的问题, 提出可扩展的数据生成管线:
- 收集真实与合成图像, 搭配材质掩码(来自合成材质数据集或 matting 工具)。
- 用 VLM 为每个材质区域生成丰富、 视觉语义对齐的文本描述。
- 从描述中自动衍生 VQA 样本, 构造“哪种材质是光滑且反光的?” 等问答, 强化模型对材质的理解。 所有任务共享 VLM 骨干, 通过 LoRA 或全量微调优化。
推理与涌现式多模态
虽然训练时仅使用单一模态提示(纯文本或纯点击), 但在推理阶段, 同时提供文本和点击会让模型自发涌现出更强的合成能力: 点击提供精确的空间锚点, 文本提供语义约束, 两者互补可消解歧义。 这为交互式图像编辑提供了灵活的工作流。
与同类方法的差异
与 GLaMM、 Sa2VA 等仅支持物体选择或单一交互模态的 VLM 分割方法不同, MAOAM 首次统一了物体与材质的选择, 并通过多任务训练和数据合成管线解决了材质分割标注缺失的难题, 使模型能够同时理解“什么物体”和“什么材质”, 且支持灵活的文本-点击联合推理。
实验
实验设计
MAOAM 被设计为一个统一的选择框架,同时支持对象级与材料级的选择,并通过文本和点击两种交互方式指定目标。训练时,模型接收来自对象数据集(如 RefCOCO、EntitySeg)和自建材料数据集的混合样本,采用多任务目标:点击驱动的选择、文本驱动的选择,以及一个源于材料描述的辅助 VQA 任务——该任务旨在加深模型对材料语义的理解。为解决材料选择缺乏文本标注的问题,作者提出了一条可扩展的数据生成管线:收集真实与合成图像及其像素级材料掩码,再借助 VLM 自动生成富含视觉语义的描述,经人工验证后用于训练。在推理时,用户可单独提供文本或点击,也可同时给出二者,以探究多模态交互带来的应急改进。
关键发现
定量评估显示,MAOAM 在对象选择与材料选择上均达到准确、连贯的分割效果,对复杂场景和长文本查询表现出良好的鲁棒性。尤为突出的是,尽管模型仅在单模态提示下训练,但推理时结合文本与点击竟带来了超出预期的性能提升——这种涌现行为验证了统一框架的泛化能力。定性分析进一步表明,该模型具备空间与语义推理能力,能够正确区分不同材质(如木材、金属)并生成像素精确的掩码,支持图像编辑中的重纹理化等下游任务。
与基线对比
相较于传统 VLM 选择方法——通常仅面向对象、且只支持一种交互模态——MAOAM 的统一架构显著提升了实用性。通过将对象和材料选择融入同一模型,并兼容文本与点击两种自然互动方式,它规避了多模型切换的工程开销。同时,数据生成管线利用 VLM 弱监督能力缓解了对昂贵人工标注的依赖,相比于依赖纯人工标注的材料分割方法,成本更低且更易扩展。多任务与辅助 VQA 的设计则让模型不仅“学会分割”,更“理解材料属性”,这是之前以对象为中心的方法所不具备的。这些创新使得 MAOAM 在现实交互式编辑工具中具有更高的部署价值。
行业影响
落地场景
MAOAM 将点击与文本驱动的物体/材质选择统一到单个 VLM 中,直接切入交互式图像编辑核心流程。典型产品落地点包括:
- 专业创意工具:如 Adobe Photoshop、Figma 等,通过“点击+自然语言”精准选择任意物体或同一材质的所有实例(例如“选择所有木质表面”),大幅简化选区操作。
- 电商商品管理:后台编辑商品图时,能一键选中特定材质区域并进行换色、纹理替换,无需手工抠图,支持大批量 SKU 快速上架。
- 工业视觉质检:在产线图像中自动筛选出特定材质缺陷(如金属划痕、织物瑕疵),辅助标注与缺陷分类。
- 医疗影像分析:从 CT/MRI 中根据语义描述选择组织区域(如“所有增强区域”),辅助医生量化病灶体积。
商业价值
- 降本提效:将传统需要精细手动描边的选区任务转为多模态交互,单次选择耗时可从分钟级降至秒级,在内容生产、电商修图等劳动力密集型环节节省大量人力。
- 增收与差异化:为订阅制工具增加高价值功能(例如“一键材质替换”),提升产品竞争力和用户粘性,直接驱动付费转化。
- 体验提升:用户不再受限于单一交互模式,可先用点击锚定大致位置,再以文本描述精细化调整(如“选中的地面材质”),零学习成本即可处理复杂场景,降低专业工具的使用门槛。
与现有产品/工作流的接口
MAOAM 基于 VLM 架构(如 LLaVA-v1.5 / Qwen2.5-VL),输出像素级分割掩码,天然兼容现有图像处理管线。集成方式包括:
- 插件/SDK 嵌入:为 Photoshop、GIMP 等桌面软件提供 C++/Python 推理插件,读取图层叠加的点击坐标与描述文本,返回精准选区。
- 云端 API 服务:封装为 RESTful API,接收图片、点击位置及文本查询,返回掩码或抠图结果,无缝接入电商后台、内容管理平台(CMS)的工作流。
- 数据标注平台:集成到 Labelbox、CVAT 等标注工具中,替换传统多边形标注,利用多模态提示半自动化生成高质量实例/材质分割标签,使数据标注效率提升 5 倍以上。
具体落地用例
- 电商商品图编辑:商家上传白底服装图,编辑时点击纽扣并说“选择所有金属纽扣”,模型自动分割所有纽扣区域,随后一键替换为其它材质,整个过程无需任何框选操作。
- 影视后期特效:在 Davinci Resolve 或 Nuke 中,调色师点击路面并输入“选择所有沥青区域”,即时生成准确遮罩,用于局部曝光调整,取代逐帧绘制动态遮罩的繁琐工序。
局限
- **材料选择标注数据稀缺,合成数据存在领域偏差**:论文构建了材料描述生成流水线,利用VLM为合成与真实图像生成文本标注,但材料类别的细粒度差异(如不同木材、织物)难以通过文本完全捕获;合成数据的材质丰富度与真实世界分布仍有差距,模型可能对未见过的新材料或复杂光照下的材质分割泛化不足。
- **复杂交互与遮挡场景下的鲁棒性未充分验证**:MAOAM在点击与文本联合推理时表现出涌现能力,但论文未系统评估多轮交互、部分遮挡或材质混合区域(如半透明表面、渐变材质)下的分割精度;当用户意图模糊时(如“金属部分”且存在多种金属),模型可能出现歧义,且缺乏交互消歧机制的深入分析。
- **模型对长文本与空间推理的稳定性依赖训练分布**:论文提及其对输入文本长度具有鲁棒性,但未测试到超出训练数据长度的复杂指令;空间关系推理(如“椅子左侧的木材质”)在复杂场景中可能出现错误,且点击表示(星形覆盖)可能改变原始像素分布,对某些材质(如高光表面)的边界准确性造成影响。