论文

InstanceControl: 无需实例标注的可控复杂图像生成

InstanceControl: 无需实例标注的可控复杂图像生成

现有可控图像生成方法(如 ControlNet)通过引入视觉条件(如深度图)指导图像生成,性能出色,但在复杂多实例场景中常出现实例间属性混淆。近期方法尝试通过手动实例标注缓解问题,但标注工作耗时耗力。 本文提出 InstanceControl,一种无需实例标注的新型多实例可控生成方法。我们指出现有方法的主要瓶颈在于无法准确将实例描述与其在视觉条件中的对应区域关联。为此,利用 视觉语言模型 (VLM) 自动从文本提示中解析实例描述,并基于视觉条件预测实例掩码,从而建立文本与条件间的实例级对应。由于预测掩码可能包含噪声,我们进一步引入 自适应掩码细化策略,在生成过程中动态优化掩码。 大量实验表明,InstanceControl 在保真度和实例级控制精确度上均优于现有方法,为复杂场景下的可控生成提供了高效解决方案。

论文精读

TL;DR InstanceControl 利用 VLM 自动建立文本与视觉条件的实例对应,无需手动标注即可实现精准多实例可控生成,有效解决属性混淆。

问题

问题背景

可控图像生成领域正致力于将视觉条件(如深度图、边缘图)与文本提示结合,实现对生成内容的空间控制。ControlNet 等方法已能有效融入条件,但在多实例复杂场景中仍面临挑战,尤其当需要为不同实例赋予不同属性时。

现有方法的局限

主流可控生成模型(如 ControlNet、T2I-Adapter)通过全局条件注入来控制整体布局,但缺乏实例级对应机制。这导致在“一只红猫和一只蓝狗”这类多实例提示下,颜色或类别属性易混淆——模型可能将红色赋予狗,或混淆两个实例的位置。近期工作尝试通过人工标注实例掩码来强化对应,但这类标注成本极高且难以扩展,尤其对细粒度或开放域场景。此外,现有方法往往将实例描述与其在视觉条件中的区域割裂处理,无法建立文本片段与空间区域的精准绑定

为什么这个问题难且重要

核心技术挑战在于:跨模态细粒度对齐。视觉条件(如深度图)本身不携带语义信息,而文本提示中的实例描述(如“红猫”)需准确关联到条件图的对应区域。这要求模型同时具备语义理解、指代分割和生成控制能力。手工标注虽能缓解,但违背了自动化生成初衷。业界对个性化内容生成多目标场景编辑的需求日益增长,解决该问题可大幅降低可控生成的门槛,推动AIGC在影视、设计、仿真等领域的落地。

行业类比

类似自动驾驶中,感知模块需将“前方行人”与激光雷达点云中的某个聚类精确关联,否则决策将出错——可控生成同样需要视觉条件与文本描述的实例级绑定。

核心洞察

  • **视觉语言模型充当实例级对齐桥梁,消解了手工标注依赖**。现有方法如 ControlNet 在单实例场景表现良好,但面对多实例时因缺乏文本描述与视觉条件区域的精确对应而出现属性混淆。InstanceControl 让 VLM 同时解析文本中的实例描述并预测视觉条件上的实例掩码,自动建立细粒度对应,从而在无需任何人工标注的情况下实现实例级操控,与需要密集标注的 OMG 等方法形成根本差异,大幅降低了使用门槛。
  • **动态掩码精炼策略克服了 VLM 预测的粗糙性,将离线掩码转为在线优化信号**。VLM 预测的初始掩码通常存在噪声和边界模糊,直接注入生成器会导致控制失真。本文提出自适应掩码精炼,在去噪过程中根据生成内容逐步优化掩码,使其与当前生成的特征图保持空间对齐。这种在线闭环调整不同于以往固定掩码的注入方式,有效解决了预计算掩码与生成状态不一致的问题,显著提升了实例归属的准确性。

方法

InstanceControl 面向多实例可控生成场景,输入为文本提示(如 “a red apple and a green apple”)与视觉条件(如深度图),目标是生成符合空间结构且实例属性准确绑定的图像。方法核心分为三个阶段:

实例级文本-视觉条件关联:利用预训练视觉语言模型(VLM, 如 Qwen-VL)自动解析文本提示,提取各实例描述短语,并基于视觉条件预测对应的实例分割掩码,建立细粒度的 “词-区域” 对应关系,彻底替代人工标注。

实例感知的可控生成:将得到的实例掩码作为额外条件通道注入基于 ControlNet 的扩散模型。在去噪过程中,掩码强制模型将特定文本属性绑定到正确空间位置,同时原始视觉条件维持整体几何约束,避免多实例属性混淆。

自适应掩码细化:针对 VLM 预测掩码可能存在的边界噪声,引入自适应细化机制,在扩散不同时间步利用逐渐清晰的图像特征动态修正掩码,逐步提升边缘精度,确保生成质量。

最终输出在保持高保真度的同时,实现了精确的实例级空间与属性控制。

与 InstanceDiffusion 等需人工精细标注掩码的方法不同,InstanceControl 完全依赖 VLM 自动完成掩码预测与在线修正,显著降低了部署门槛。

实验

实验设计

作者围绕实例级可控生成设计了多维度实验,旨在验证 InstanceControl 在复杂多实例场景下的控制精度与生成质量。实验主要包含三个部分:

  • 与主流基线对比:选取 ControlNet 以及近期支持实例级控制的方法(如 InstanceDiffusionMultiInstance 等),在相同的文本提示与视觉条件下进行定量与定性比较。
  • 消融研究:逐步移除自适应掩膜精炼(adaptive mask refinement)VLM 实例对齐等模块,验证各组件的贡献。
  • 掩膜质量分析:单独评估 VLM 预测的实例掩膜与人工标注的 IoU/AP,考察自动标注的可靠性。 实验并未在特定公开数据集上固定评测,而是构造了包含多目标、遮挡、相似属性实例的测试集,以突出在真实复杂场景下的实用性。

关键发现

即使没有人工实例标注,InstanceControl 仍能显著减少属性混淆,尤其在相同类别多实例场景下,可将身份交换的错误率降至接近有监督方法的水平。主要发现包括:

  • VLM 提供的实例-条件对应是解决属性混淆的核心,直接使用文本整体嵌入的基线方法几乎无法区分实例。
  • 自适应掩膜精炼能够有效修正 VLM 初始预测中的噪声区域,在去噪过程中动态优化边界,使生成图像的实例轮廓与视觉条件(如深度图)高度吻合。
  • 对于实例数量增加的情况,模型无需额外分支或显式实例编码器,保持了模块化与可扩展性。

与基线的深度对比

相较于需要人工标注实例掩膜的方法(如 InstanceDiffusion),InstanceControl 的优势在于完全自动化,消除了数据准备阶段的瓶颈。与 ControlNet 相比,InstanceControl 不是简单堆加条件编码,而是显式建模「文本描述→实例区」的对应,使得在遮挡、重叠等困难条件下仍能正确绑定属性。不过,VLM 提供的掩膜质量仍受上游模型性能影响,在高度模糊或罕见姿态下可能出现对齐偏差,这成为当前方法的一个上限,也是未来将 VLM 与扩散模型进一步联合微调的动机。

行业影响

落地场景

InstanceControl 消除了多实例可控生成对人工实例标注的依赖,使得复杂场景下的空间控制变得更加自动化。其核心能力可广泛应用于:

  • 电商与广告素材生成:根据布局条件(如深度图、草图)与多商品文本描述,批量生成多实例商品场景图,每个商品属性准确对应到指定区域。
  • 游戏与影视概念设计:快速按分镜草图与多角色描述生成概念图,避免角色特征混淆,加速前期创意迭代。
  • 内容平台个性化素材:结合用户输入的多种视觉元素描述与位置约束,生成自定义背景、插画等,提升 UGC 创作体验。
  • 合成数据增强:为自动驾驶、机器人等场景生成多目标复杂场景训练数据,可精确控制每个目标的视觉属性与位置。

商业价值

  • 降本:免去人工为每张训练图像进行实例级标注的繁重工作,显著降低数据准备成本,适合大规模工业化部署。
  • 增效:生成结果中实例属性错配率大幅下降,减少了人工后期修图与筛选成本,模型产出可直接用于生产管线。
  • 体验提升:在 C 端创作工具中,用户只需提供文本描述与粗略视觉条件即可获得精准控制的结果,降低了专业门槛,扩大了潜在用户群。
  • 增收:更高质量的素材可提升广告点击率、用户生成内容的传播度,间接带动转化与平台活跃度。

与现有产品/工作流的接口

InstanceControl 作为一个即插即用的模块,与主流 Stable Diffusion + ControlNet 管线天然兼容:

  • 模型层面:可在预训练扩散模型与 ControlNet 的基础上,增加 InstanceControl 分支,无需重新训练整个生成器。
  • 推理流程:只需传入文本提示与视觉条件,VLM 自动完成实例解析与掩码预测,输出实例感知的控制信号,无缝接入现有生成引擎。
  • 工具链集成:可以插件形式集成到 ComfyUI、Automatic1111 WebUI 等开源社区工具中,方便设计师快速使用。
  • 数据闭环:生成的图像可用于训练下游任务模型(如检测、分割),并通过模型反馈优化控制质量,形成迭代优化管线。

具体落地 Use Case

  • 电商场景:在商品主图制作中,输入“左侧放红色运动鞋,右侧放蓝色背包,中间放一瓶水”的文字描述和对应的深度布局图,InstanceControl 生成一张布局严格对应、商品属性准确的多商品展示图,直接用于商品详情页或广告 banner,免去人工置景拍摄。
  • 内容平台:在漫画/插图创作辅助中,用户提供多角色描述(“戴眼镜的学者坐在书桌前,他旁边是一只黑猫”)与线稿草图,系统生成角色区分明显、空间位置正确的场景图,创作者可直接在此基础上精修,大幅缩短创作周期。

局限

  • InstanceControl 严重依赖 VLM 的实例解析与掩码预测能力,VLM 的错误(如漏检、错误关联实例、粗糙掩码)会直接传递到生成过程,导致实例属性混淆或生成失败。论文未讨论对 VLM 噪声的鲁棒性,也未提供当 VLM 失效时的回退机制,这限制了在复杂场景(如严重遮挡、细粒度实例)中的可靠性。
  • 自适应掩码细化虽然提升了精度,但增加了生成过程的在线计算负担。论文未报告推理时延或额外显存开销,与原有 ControlNet 等轻量控件相比,其实时部署代价尚不明确,可能制约交互式应用等对延迟敏感的场景。
  • 实验主要在常规多实例数据集上验证,对于极端视角、罕见类别、细粒度属性区分等挑战性场景,方法的泛化性未得到充分评估。此外,该方法假设文本提示已包含清晰的实例描述,当用户提供模糊或非结构化提示时,实例解析可能失败,未展示对此类情况的处理能力。
论文Xiaoyu Liu2026-06-30原文

相关内容