论文

ReGain:在合成图像个性化中恢复主体保真度

ReGain:在合成图像个性化中恢复主体保真度

DreamBooth 通过对主体少量图像微调来实现个性化,而这些图像如今越来越多来自 diffusion model 而非相机。本文发现,用这类 合成图像 微调会损害主体保真度,表现为颜色过饱和与高频细节过多。为定位成因,作者从同一 base model 出发、用同一 DreamBooth 配方训练两个模型:一个用主体真实照片,另一个用前者生成的该主体合成图像。 作者将退化归因于 classifier-free guidance (CFG)。在合成图像上个性化的模型,其条件与无条件噪声预测之间的夹角——以及二者差值的范数——远大于在真实照片上个性化的模型。这种膨胀随频率升高而加剧,并在语义接近主体的其他 prompt(如类别名词)上出现,而在无关 prompt 上不出现。 为此提出 ReGain:一种在 采样阶段 施加、无需训练的校正方法。它测量 guidance 各频段相对于 base model 的膨胀程度,并按比例将该频段缩回,且不需要任何真实照片。 在 Stable Diffusion v1.5 上,ReGain 以 DINO、DINOv2 和 CLIP-I 衡量,弥补了 51-64% 与真实照片个性化模型之间的主体保真度差距;在 SDXL 与 SD 3.5 上同样提升了主体保真度,并在三种 backbone 上保持文本对齐。

论文精读

TL;DR ReGain 发现合成图像 DreamBooth 个性化中 CFG 高频引导膨胀是主体失真的根源,提出训练无关的频带缩放校正,无需真实照片即可大幅恢复保真度。

问题

问题背景

文本到图像扩散模型(如 Stable Diffusion) 的个性化依赖 DreamBooth 等方法,在少量主体图像上微调,使用户能将主体置于任意新场景。随着文本生成图像技术的普及,用户越来越容易用扩散模型输出的合成图像替代真实照片作为训练数据。

现有方法局限

现有 DreamBooth 类方法天然假设训练图像来自真实拍摄,未考虑合成图像引入的系统性偏差。作者通过对比实验发现:在合成图像上微调后,模型生成的主体保真度显著下降,出现色彩过饱和与高频细节过度增强。进一步定位到 分类器自由引导(CFG) 的异常——合成图像微调模型的 CFG 条件与无条件噪声预测之间的夹角远大于真实照片微调模型,且二者差值的范数膨胀,尤其在高频带更明显。此前工作多关注真实图像多样性或正则化策略,没有针对合成图像来源的校正机制。

为什么这个问题难/重要

技术挑战在于:合成图像本身已经带有上游生成模型的偏差,微调会进一步放大这些偏差;而实际场景中用户往往没有同一主体的真实照片可作为参照。无真实参考条件下修复主体保真度,需要解耦并抑制 CFG 中源于合成图像的过度引导成分,同时保持文本对齐。随着生成式 AI 的广泛应用,使用合成数据训练下游模型已成为常见流程,如何保证合成数据驱动的个性化不损失视觉质量,是业界部署中亟待解决的问题。

行业类比

类似于使用 AI 生成的伪标签或合成数据训练视觉模型时,需要校正分布偏移以避免性能退化,ReGain 相当于在采样阶段做了一次"引导校准"。

核心洞察

  • 合成图像个性化导致 subject fidelity 下降的根源是 CFG 引导在频域上的异常膨胀,而非简单的数据分布偏移。 该视角的独特性在于:**DreamBooth 类方法** 通常把合成图像退化归因于训练图像的质量或多样性,而 ReGain 通过解耦实验发现,即使使用同一 base model 和相同训练配方,合成图像训练出的模型其 conditional 与 unconditional 噪声预测夹角和高频段差异显著增大。这种频段级别的诊断**与专注于文本对齐或正则化** 的 baseline(如 prior-preservation loss)形成对比,直接指向采样阶段的引导校正,无需修改训练目标。
  • ReGain 提供了一种 training-free 且不依赖真实照片的采样时校正方法,用 base model 自身作为参照量化引导膨胀。 与需要真实照片作为 ground truth 或额外对抗训练的同类工作不同,ReGain 仅利用 base model 的固有先验,按频率逐段估计 guidance 相对 base model 的放大系数并缩放回正常水平。在 SD1.5 上关闭了 51–64% 的 subject-fidelity 差距(由 DINO、DINOv2、CLIP-I 衡量),并跨 SDXL 和 SD 3.5 保持有效性。工程上可即插即用,对已有合成图像个性化流程无侵入。

方法

方法思路

ReGain 解决的核心问题是:在合成图像上做 DreamBooth 个性化后,CFG 引导向量在高频段出现异常膨胀,导致生成结果过饱和、细节过度锐化。该方法训练无关,仅在采样时校正引导向量。

输入 → 关键模块 → 输出

输入:一个已个性化到合成图像的扩散模型(如 Stable Diffusion v1.5),以及同一 base model 的原始权重。采样过程中,每一步需要计算条件噪声预测 ε_cond 与无条件噪声预测 ε_uncond。

关键模块:

  1. 引导向量提取:对个性化模型,取 ε_cfg = ε_cond - ε_uncond 作为待校正的 CFG 引导向量。同时从 base model 在同一时间步、同一文本条件下提取参考引导向量 ε_cfg_base。
  2. 频域分解与膨胀度量:将两个引导向量分别做二维傅里叶变换,按频率环带划分频段。对每个频带计算个性化模型引导向量与 base model 引导向量的幅值比,得到逐频带膨胀系数。
  3. 缩放校正:对于膨胀明显的高频频带,将个性化模型的引导向量在该频带幅度乘以一个小于 1 的缩放因子,使高频分量回落到 base model 的水准;低频带通常保持不变。
  4. 去噪更新:将校正后的引导向量变换回空间域,与无条件预测 ε_uncond 重新组合,得到修正后的条件噪声预测,用于后续去噪步骤。

输出:采样得到的图像,其主体颜色和纹理更接近真实照片训练时的效果,同时保留文本对齐能力。

与同类方法的差异

与需要真实参考图像或改动训练过程的防过拟合 / 正则化方法不同,ReGain 完全在采样阶段操作,仅以 base model 的引导向量作为先验,不需要任何真实照片。

实验

实验设计

  • 构建对照:同一基础模型(Stable Diffusion v1.5)分别用真实照片和合成图像进行 DreamBooth 微调,合成图像由真实照片微调模型生成。
  • 分析 CFG 在两种模型上的差异,测量条件/无条件噪声预测角度与差值范数,并按频段分解。
  • 提出 ReGain:训练无关采样校正,基于基础模型的频段膨胀比例缩放 CFG 差值。
  • 评估在 SD v1.5 上使用 DINO、DINOv2、CLIP-I 衡量主体保真度,并验证 SDXL、SD 3.5 的泛化。

关键发现

  • 合成图像微调导致 CFG 角度与差值范数显著膨胀,高频成分增幅最大。
  • 该现象出现在语义相近提示词(如类名词)上,但不影响无关提示词。
  • ReGain 在 SD v1.5 上弥合 51-64% 的主体保真度差距(DINO/DINOv2/CLIP-I),并保持文本对齐。
  • 在 SDXL 和 SD 3.5 上同样改善主体保真度,无需真实照片。

对比解读

  • ReGain 为非训练方法,无需真实照片,相比真实照片微调模型仍有差距,但大幅缩小。
  • 相较于其他需真实照片或训练的校正方法,ReGain 的采样时频段缩放具备更高实用性和跨骨干迁移性。

行业影响

落地场景

ReGain 主要应用于基于扩散模型的个性化图像生成产品,特别是当训练数据为合成图像时(如由其他生成模型产出)。典型场景包括:

  • 电商产品图生成:商家上传少量商品图,模型生成多场景展示图;若商品图本身是合成的(如 3D 渲染或 AI 生成),ReGain 可修复颜色过饱和与高频伪影。
  • 虚拟形象 / 头像定制:用户提供几张 AI 生成的自拍或风格化头像,平台用 DreamBooth 微调生成更多姿态;ReGain 能提升主体保真度。
  • 广告创意生成:品牌方用合成图训练专属模型,快速产出营销素材。

商业价值

  • 降低数据采集成本:无需收集大量真实照片,仅用合成图即可训练,同时保持接近真实图训练的效果。
  • 提升用户体验:减少生成图像中的过饱和和细节失真,使个性化结果更自然,降低用户反复生成和人工修图的成本。
  • 模型迭代加速:由于 ReGain 是训练免费 的采样时校正,可即插即用地部署到现有推理服务,无需重新训练或微调模型。

跟现有产品/工作流的接口

ReGain 可以作为推理后处理模块集成到扩散模型 serving 栈中:

  • 在采样过程中,动态计算每个频率带相对基础模型的 guidance inflation,并缩放相应频带。
  • 可封装为独立库或插件,兼容 Stable Diffusion v1.5 / SDXL / SD 3.5 等主流 backbone。
  • 与现有个性化 API(如 DreamBooth 微调服务)结合,在输出前自动应用校正。

例如:某内容平台提供用户自定义头像生成,用户上传的参考图往往是 AI 生成的(如用户用其他 App 生成的自拍)。平台在 DreamBooth 微调后推理时集成 ReGain,可显著减少头像的色偏和纹理过度,提升用户满意度,同时降低因生成质量差导致的投诉和返工。

局限

  • 论文明确承认 **ReGain** 仅针对 **CFG** 引导膨胀进行校正,其他导致合成图像个性化差异的因素(如训练数据分布偏移、模型对合成伪影的过拟合等)并未覆盖。此外,方法需要设定频率带划分方式和缩放阈值,这些超参数在不同骨干模型(SD v1.5/SDXL/SD 3.5)上可能需重新调整,论文未给出统一的自动化选取策略,实际部署时需额外调参。采样时计算各频率带相对基础模型的膨胀比例会增加推理开销,虽训练免费,但实时性受限。
  • 可推断的局限:ReGain 假设合成数据个性化导致的引导膨胀在不同提示词和主体上表现一致,从而使用固定的频率带缩放。然而,膨胀程度可能随提示词语义、主体纹理复杂度动态变化,静态缩放可能在某些场景下校正不足或过度。实验仅在有限主体类别(如人脸、宠物)上验证,对更多样化的物体类别和极端合成图像质量(如模糊、低分辨率)的鲁棒性未知。此外,方法依赖基础模型的 CFG 行为作为参考,若基础模型本身存在某些频率偏置,校正可能引入新伪影。
  • 与同类工作对比:相比使用真实图像微调的个性化方法,**ReGain** 不需要真实图像,但仅闭合 51–64% 的保真度差距,仍存在可感知差异。与图像后处理(如色彩校准、高频抑制)相比,ReGain 在采样过程中干预更直接,但可能会改变生成图像的风格多样性,尽管论文报告保持文本对齐,但未深入评估对图像多样性的影响。此外,ReGain 仅针对 DreamBooth 类方法(基于 CFG 的微调)设计,对基于 LoRA 等其他适配器的个性化方法是否同样有效仍需验证。
论文Shubhang Bhatnagar2026-09-30原文

相关内容