Paint-Anything:面向图像生成与编辑的统一任意颜色控制
专业设计需要任意颜色控制:在图像生成与编辑中,用任意 24 位十六进制值指定目标物体的颜色。已有工作探索过颜色生成、编辑与上色,但往往依赖专门的色彩表示或特定的推理流程。大语言模型的进展提供了更简单的起点——即便是紧凑模型也能将 hex 值与颜色语义关联起来。 我们提出 Paint-Anything,通过物体级颜色监督学习一个共享的 hex-prompt 接口,同时服务于生成与编辑。我们设计了数据流水线,经由物体定位、感知颜色标注与编辑对合成,从真实图像构建出 Paint-500K。由于阴影使真实图像的标注只能逼近真实颜色,我们补充了纯色锚点(pure-color anchors),其像素与配对的 hex 值完全一致;这些锚点仅在高噪声时间步使用,低噪声训练仍交给自然图像。 我们进一步提出 Any Color Benchmark (ACBench),包含 ACBench-T2I 与 ACBench-Edit,用于衡量两个任务上的物体级 hex 颜色保真度。在 FLUX.2-4B 上,Paint-Anything 相比基座模型将 ACBench-T2I 与 ACBench-Edit 分数分别提升 85.3% 与 28.3%,消融实验也支持该训练方案。此外,在对比方法中它取得了最高的平均 CompColor 分数。
论文精读
TL;DR Paint-Anything 用共享 hex-prompt 接口统一图像生成与编辑中的任意 24 位颜色控制,通过对象级监督与纯色锚点训练,在 FLUX.2-4B 上将对象级颜色保真度分别提升 85.3% 和 28.3%。
问题
问题背景
专业设计流程中,任意颜色控制 是核心需求:需要为对象指定精确的 24 位 hex 值,用于图像生成与编辑。
现有方法局限
- 早期颜色生成、编辑或上色工作依赖专用颜色表示(如调色板、颜色嵌入)或分阶段推理流程(先定位再着色),难以直接集成到通用文生图扩散模型。
- 即便大语言模型(LLM)能理解
hex语义,但将其作为条件接入扩散模型仍存在表示对齐 gap。 - 真实图像的颜色标签受光照与阴影影响,只能提供近似值,缺乏像素级精确监督,导致模型对目标颜色还原不准。
技术挑战与重要性
- 24 位
hex空间有 2^24 种颜色,模型需在对象级语义绑定下区分细微色差,而非学习笼统的颜色词。 - 训练数据中颜色标注成本高、噪声大;如何提供精确颜色锚点又保持自然图像分布是数据工程难点。
- 业界对可控生成的关注度持续上升,精确颜色控制直接影响设计工具、电商素材生成、广告创意等生产力场景的可用性。
类似需求可类比于代码生成中要求输出精确变量名或 API 签名,而非"写一个排序函数"这种模糊描述——生产环境需要确定性。
核心洞察
- 将任意 24-bit hex 颜色作为统一提示接口,直接复用语言模型已有的颜色语义关联,避免为颜色控制设计专用 token 或推理流程。与之前 color generation/editing 工作依赖专用颜色表示或特殊推理过程不同,该方法训练时仅需对象级颜色监督,工程上更易集成到现有扩散模型,且能同时服务于生成与编辑任务。
- 用纯色锚点(pure-color anchors)在高噪声时间步补充监督,解决真实图像标签受阴影影响只能近似颜色的缺陷。这与只依赖自然图像标签的 pipeline 形成差异:通过只在早期去噪阶段注入精确锚点,保留低噪声阶段的自然图像细节,在颜色精确性与图像质量之间取得平衡,避免了近似标签带来的颜色偏差累积。
- 同时覆盖生成与编辑任务的统一对象级颜色监督,并配合 ACBench-T2I / ACBench-Edit 基准评测,使方法可量化比较。在 FLUX.2-4B 上,相对基座模型 ACBench-T2I 与 ACBench-Edit 分别提升 85.3% 与 28.3%。与以往分别设计 colorization/editing 模型的做法不同,单一 hex-prompt 接口和共享训练目标提升了工程可维护性,基准也为后续 any-color 控制研究提供统一衡量标准。
方法
方法概述
Paint-Anything 以文本提示和对象级 hex 颜色(如 #3A7BD5)作为输入,通过共享的 hex-prompt 接口 注入扩散模型,同时支持文生图和编辑任务。模型基于 FLUX.2-4B 微调,不依赖专用颜色编码或额外推理分支。
- 数据管道:首先利用对象定位模型从真实图像中检测目标区域,再通过感知颜色标记算法估计对象的平均 hex 值,并合成编辑对(保持结构不变、仅改变目标颜色),最终构建 Paint-500K 数据集。
- 混合监督训练:由于真实图像的阴影/高光会使标签色与实际渲染色存在偏差,训练时引入 纯色锚点——由纯色填充的合成样本,其像素值与配对 hex 完全一致。这些锚点仅在高噪声时间步(扩散早期)参与训练,低噪声阶段依旧以自然图像为主,从而平衡精确颜色控制和真实纹理生成。
推理时,用户只需在提示中给出目标 hex 值,模型即可在指定对象的像素级颜色上保持高保真。评测采用 ACBench-T2I 与 ACBench-Edit,分别计算生成和编辑任务的对象级颜色一致性。
与先前依赖专用颜色表示或分阶段推理的方法不同,Paint-Anything 将 hex 值作为自然语言 token 的一部分,借助预训练语言模型的颜色语义关联完成统一控制。
实验
实验设计
- 训练数据 Paint-500K 从真实图像构建,流程包括 object grounding、perceptual color labeling、editing-pair synthesis;另加入 pure-color anchors 提供像素级精确 hex 匹配。
- 训练时 pure-color anchors 仅用于 high-noise timesteps,低噪声阶段使用自然图像,避免阴影导致的近似颜色干扰。
- 评估采用 ACBench,含 ACBench-T2I 和 ACBench-Edit 两个子基准,衡量 object-level hex color fidelity。
- 基座模型为 FLUX.2-4B,训练后直接对比。
关键发现
- 在 FLUX.2-4B 上,ACBench-T2I 分数相对基线提升 85.3%,ACBench-Edit 提升 28.3%。
- 在所有比较方法中,Paint-Anything 取得最高的平均 CompColor 分数。
- 消融实验证实 pure-color anchors 与分阶段训练策略的有效性。
基线对比解读
- 相对基线的巨大提升表明,共享 hex-prompt 接口能有效将 LLM 的颜色语义与扩散模型生成对齐。
- Pure-color anchors 只在 high-noise timesteps 注入,避免低噪声阶段受自然图像近似颜色的干扰,在颜色保真与生成质量间取得平衡。
- 相比依赖专用颜色表示或专用推理的方法,Paint-Anything 以更简洁的统一接口实现 comparable 甚至更好的效果。
行业影响
落地场景
Paint-Anything 的 any-color 控制可嵌入 AIGC 图像生成与编辑产品,典型场景包括:
- 电商 SKU 批量生成:品牌方输入商品底图和目标 hex 色值,自动生成同款多色商品图,无需重新拍摄。
- 设计工具实时配色:在 Figma 类平台或 Canva 模板中,用户指定品牌色 hex,模型直接重绘元素或背景,保证视觉一致性。
- 内容平台滤镜/贴纸:用户自定义颜色主题,生成个性化头像、壁纸或营销素材。
商业价值
- 降本:减少人工调色与后期修正,单张商品图制作时间从数十分钟降至秒级,支持大规模 SKU 扩展。
- 增收:通过更精准的颜色交付,提升广告点击率和电商转化率;同时为 SaaS 工具增加高级订阅点。
- 体验提升:任意 24-bit hex 控制避免近似色偏差,设计师无需学习复杂调参,直接复用现有色板。
与现有工作流的接口
Paint-Anything 可作为 扩散模型插件 集成到主流推理栈:
- 在 ComfyUI / AUTOMATIC1111 中新增节点,接收
hex_color和object_mask参数。 - 提供 API 形态,将颜色控制打包为
ColorAdapter,与 LoRA / ControlNet 类似,加载到 FLUX 或 Stable Diffusion 基础模型。 - 训练数据 Paint-500K 可迁移为其他模型的微调数据集,评测基准 ACBench 用于回归测试颜色保真度。
典型 use case:某全球电商平台为同一款 T 恤生成 12 种颜色变体,调用 Paint-Anything 服务输入 hex 色板,模型直接输出合规商品图,节省摄影棚拍摄成本;某在线设计工具允许用户输入品牌主色 hex,一键将模板中所有元素重绘为统一色调。
局限
- - 数据标注受阴影等因素影响,真实图像标签仅为近似颜色。虽然纯色 anchor 在高噪声阶段补充精确监督,但低噪声阶段仍使用带噪声的真实标签,可能导致最终生成的物体颜色与指定 hex 存在偏差,尤其在复杂光照或半透明物体场景下,颜色保真度有上限。该方法对材质反射、环境光影响的建模能力受限。
- - 实验仅在 FLUX.2-4B 单模型上验证,未展示在其他基础扩散模型上的迁移效果,hex-prompt 接口的普遍性尚待检验。ACBench 由作者构建,数据分布可能偏向训练集,外部评测的公平性需要更多独立验证。此外,编辑任务中对非目标区域颜色一致性的保持策略未充分说明。
- - 方法局限于物体级颜色控制,难以应对全局色调调整、多物体颜色协调、连续渐变或纹理化颜色等更复杂的设计需求。纯色 anchor 训练可能牺牲颜色细节和纹理真实感,生成图像虽色值准确但质感可能不自然。在真实产品设计场景中,这类限制可能影响实用性。