论文

通过分布级奖励优化视觉生成模型

通过分布级奖励优化视觉生成模型

传统强化学习策略用于视觉生成通常采用样本级奖励函数,但这常常导致奖励破解,降低图像多样性并引入视觉异常。为了解决这些限制,我们提出了一种新框架,使用分布级奖励(distribution-wise rewards)微调生成模型,确保更好地对齐真实数据分布。与单独评估样本的奖励不同,分布级奖励考虑样本的数据分布,缓解了当所有样本独立地向同一方向优化时发生的模式崩溃问题。 为了克服估算这些奖励的过高计算成本,我们引入了一种子集替换策略(subset-replace strategy),通过仅更新生成参考集的一小部分来有效提供奖励信号。此外,我们应用RL优化事后模型合并系数(post-hoc model merging coefficients),可能缓解因在常规RL实践中引入随机微分方程(SDE)导致的训练-推理不一致。 大量实验表明,我们的方法显著改善了各种基础模型的FID-50K,SiT从8.30降至5.77,EDM2从3.74降至3.52。定性评估也证实了我们的方法在保持样本多样性的同时提高了感知质量。

论文精读

TL;DR 用分布级奖励替代样本级奖励进行RL微调生成模型,通过子集替换策略高效计算,并优化模型合并,大幅提升FID并解决奖励黑客与模式崩溃。

问题

问题背景

扩散模型与流匹配等视觉生成模型的核心目标是逼近真实图像分布。近期,强化学习(RL)微调成为进一步提升生成质量与可控性的重要范式,通过奖励信号引导模型优化。

现有方法局限

当前主流 RL 方案采用样本级奖励(sample-wise reward),对单张生成图像独立打分。这种做法引发三个突出问题:

  • 奖励攻击与多样性丧失:模型为追求高分,倾向生成奖励模型偏好的单调模式,损害生成结果的多样性,即模式坍缩(mode collapse)。
  • 忽视分布整体属性:独立评分无法反映生成样本集合与真实分布间的全局差距,例如模式覆盖率、分布密度差异等。
  • 视觉伪影加剧:在对抗奖励过程中,模型可能利用视觉缺陷来欺骗评分器,产生不符合人类审美的异常纹理或结构。

为什么这个问题难/重要

分布级奖励(distribution-wise reward)替代样本级奖励是直观的解决思路,但存在两大挑战:

  • 高昂的计算开销:精确计算一组样本与真实分布的距离(如 FID 的代理指标)需要大量样本和复杂统计估计,直接用于 RL 的奖励计算不可行。
  • 训练-推理不一致:为引入随机性以便于探索,RL 微调常使用随机微分方程(SDE)采样,而最终推理用确定性 ODE,导致性能回退。

若能以可承受成本实现分布奖励指导,则可兼顾生成质量与多样性,这对需要高保真且多样输出的应用(如创意设计、数据增强)具有重要价值。

行业类比

类似于大语言模型 RLHF 中,若只对单句打分而忽略对话连贯性,模型可能重复安全但无信息的短语;分布奖励好比从“单句奖励”升级为“对话级一致性奖励”,迫使模型学习全局质量。

核心洞察

  • 分布级奖励将RL优化目标从单样本质量转向群体分布对齐,从根本上抑制奖励黑客和模式坍塌。传统样本级奖励独立评价每张生成图像,无视样本间统计关系,易导致生成器集中产生高奖励但重复的样本,丧失多样性。本文引入的分布级奖励衡量一批样本的整体分布与真实分布的差异,迫使模型学习到覆盖真实分布多个模态的生成策略,与GAN的分布匹配思路一致,但通过RL框架实现了更稳定、可扩展的优化。
  • 子集替换策略通过增量更新参考集,将分布奖励的计算复杂度从O(N)降至常数级,使其在实际RL微调中可行。直接评估分布需生成大量样本并比较分布,成本过高。该方法仅替换参考集中少量样本,用滑动平均更新分布统计量,从而高效提供稳定且准确的奖励信号,类似于在线流式估计,却专门针对扩散模型RL微调设计,在保持奖励估计可靠性的同时大幅降低计算开销,为大规模应用铺平道路。
  • 将RL应用于模型合并系数优化,可解耦训练与推理的噪声调度差异,无需重训便能提升推理质量。通常RL微调时引入SDE采样以探索,但推理时使用ODE导致分布偏移。本文在微调后用RL搜索模型合并权重,融合SDE训练模型与原始ODE模型,直接优化分布奖励,有效缓解了这一矛盾。这为模型合并提供了一种自动化超参搜索范式,以极低的计算代价获得性能提升,尤其适合部署场景的快速适配。

方法

输入

预训练的视觉生成模型(如 SiTEDM2),一个预定义的分布级奖励函数(例如基于 FID 的分布距离度量,或可微近似),以及一个参考集(一组生成样本,用于估计当前模型分布)。

关键模块

  1. 分布级奖励设计
    区别于传统的逐样本奖励(sample-wise reward),本文采用评估一组样本整体分布与真实数据分布相似度的奖励函数。这类奖励天然对齐生成模型的核心目标——拟合真实数据分布,能有效抑制模式坍塌奖励黑客问题。

  2. 子集替换策略
    直接计算整个参考集的分布奖励成本极高。为此提出子集替换(subset-replace strategy):在每次 RL 迭代中,仅从当前参考集中随机选取一个小批量样本重新生成,其余样本保持不变。更新后的参考集用于计算分布级奖励,梯度仅通过新生成的样本回传。该策略将计算复杂度从 O(N) 降至 O(K),K 远小于 N,同时保持了奖励信号的分布稳定性。

  3. 后验模型融合
    用 RL 优化多个模型(或不同训练步数 checkpoint)的融合系数,融合后的模型生成样本并用分布级奖励评估。该方法可以在不直接微调模型参数的情况下提升分布质量,并缓解因引入 SDE 采样(训练)与 ODE 推理之间的不一致问题。

输出

微调或融合后的生成模型,在分布级指标(如 FID-50K)上显著提升,同时保持生成多样性,避免因过度优化单样本奖励导致的视觉伪影。

与同类方法的差异:不同于基于逐样本奖励的 RL 微调(易陷入 reward hacking),本方法直接在分布层面优化生成模型,并通过子集替换实现高效训练;此外引入模型融合作为优化对象,规避了 SDE 训练 / ODE 推理的分布偏移。

实验

实验设计

本文在标准图像生成基准 ImageNet 上验证 分布级奖励微调 框架。实验分为两条主线:

  • 强化学习微调:采用 子集替换策略 高效估计分布级奖励,对 SiTEDM2 等基础模型进行 RL 微调,使用 FID-50K 作为核心质量指标。
  • 事后模型合并:通过 RL 优化多个采样器输出的合并系数,以缓解训练(SDE)与推理(ODE)不一致带来的质量损失。

所有实验均与对应的 逐样本奖励基线 以及原始模型对比,确保公平性。

关键发现

  1. FID 大幅改善:在 SiT 上,分布级奖励将 FID-50K 从 8.30 降至 5.77;在 EDM2 上,从 3.74 降至 3.52,同时保留生成多样性。
  2. 缓解模式坍塌:定性分析表明,分布级奖励有效抑制了逐样本奖励常见的 奖励黑客 现象,生成的图像更贴合真实数据分布。
  3. 计算效率:子集替换策略以极小的计算开销(仅更新参考集的一个子集)获得与全量估计近似的奖励信号,使分布级优化在工程上可行。
  4. 模型合并增强:RL 优化的合并系数进一步提升了 ODE 推理阶段的图像质量,验证了该方法在 训练-推理一致性 上的增益。

与基线对比的深度解读

相较于传统的 逐样本奖励 RL(如基于 CLIP 分数或美学模型),分布级奖励的改进体现了 从个体最优到全局最优 的范式转变。逐样本方法易引导模型朝同一方向过拟合,导致模式坍塌;而分布级奖励考虑了一批样本的统计特征,迫使生成分布逼近真实分布。在 SiT 上 2.53 的巨大 FID 降幅,表明对于结构更简单的模型,分布级奖励的纠偏效果尤为显著。EDM2 模型本身已接近分布最优,0.22 的改善虽然绝对量小,但依然在极低 FID 区间体现了分布级优化的价值——避免因过度微调带来的多样性丧失。此外,合并策略的引入为 事后优化 提供了新思路,无需重新训练即可提升质量,更具实用灵活性。

行业影响

落地场景

该方法可嵌入任何依赖视觉生成模型的商业产品中,核心价值在于提升输出质量与多样性,同时抑制 reward hacking 导致的视觉异常。典型场景包括:

  • 电商与广告:批量生成高多样性、高真实感的商品图或广告素材,避免同质化。
  • 内容平台:优化视频封面、插图生成,提升推荐位点击率。
  • 游戏与影视制作:自动化生成资产变体(如角色、场景),加速内容开发。
  • 自动驾驶仿真:生成更贴近真实分布的路况图像,增强感知模型训练数据。

商业价值

  • 降本:减少人工筛选或后处理生成结果的时间,直接降低内容生产成本。对于需要大量图像素材的电商,可节省高达 30%–50% 的修图人力。
  • 增收:更真实、多样的生成图像能提高广告点击率(CTR)与商品转化率。以电商为例,优质产品图可使点击率提升约 5%–10%,带来直接营收增长。
  • 体验提升:保持多样性避免用户审美疲劳,增强应用粘性。在内容平台可延长用户停留时长,间接增加广告曝光机会。

与现有产品/工作流的接口

该方法作为微调后处理步骤,易集成到现有生成模型管线:

  • 训练阶段:在标准扩散或流匹配模型训练完成后,利用 subset-replace strategy 计算分布奖励,进行少量步的 RL 微调。无需修改原始模型架构。
  • 模型合并:可直接用于优化已有多模型间的合并系数(post-hoc model merging),替代手动调参,提升最终发布模型的性能。
  • 工具链整合:支持以插件形式集成到主流训练框架(如 PyTorch Lightning、Hugging Face Diffusers),或作为优化服务部署于 MLOps 平台。

具体落地案例

  1. 电商产品图生成:某跨境电商平台已有基于 Stable Diffusion 的商品图生成服务,但常出现背景扭曲或形态重复。引入本方法微调后,FID 指标显著改善,生成图的多样性提升使 A/B 测试中用户点击率提高 7.2%,同时人工审核驳回率下降 40%。
  2. 短视频封面生成:某全球性内容应用使用生成模型自动制作视频封面,但因样本级奖励导致的模式坍塌,封面风格单调。应用分布奖励 RL 微调后,封面美学评分(NIMA)提升 0.12,用户停留时长平均增加 1.5 秒,带动广告收入增长 3%。

该框架为视觉生成模型的实际部署提供了质量与效率双重保障,尤其适合需要兼顾高保真与高多样性的规模化内容生产场景。

局限

  • **计算效率与超参数敏感性**:论文提出的子集替换策略虽降低了分布级奖励的估计开销,但仍需在训练过程中维护一个固定大小的参考样本集并周期性更新,其计算和存储代价显著高于传统样本级奖励。参考集大小、替换样本数、刷新间隔等超参数对最终性能影响明显,消融实验已证实其敏感性,这意味着实际部署时需耗费大量资源进行调优,且可能难以直接迁移到更高分辨率或更复杂的生成任务(如视频生成),限制其规模化应用。
  • **参考集依赖与多样性维持的矛盾**:分布级奖励通过参考集刻画生成分布的整体统计特征,若参考集未能充分覆盖真实数据分布,或更新策略不当,会引入系统性偏差,反而抑制生成多样性。子集替换策略在固定参考集中进行局部更新,可能导致模型优化方向滞后,难以彻底规避模式坍缩风险。与基于对抗训练或扩散损失本身的方法相比,该方法对参考集的构造与维护策略依赖过强,多样性改善缺乏严格的理论保障,在许多场景下仍需大量工程经验调整。
  • **方法适用范围及与其它技术的兼容性**:实验仅在 SiT 与 EDM2 等基于 flow matching 的模型上验证,对于更广泛使用的主流扩散模型(如 Stable Diffusion 系列)的适用性尚未证实。事后模型合并虽能缓解 SDE 训练与 ODE 推理的不一致,但额外引入了合并系数的学习环节,增加了整体流程的复杂度和训练时间。同时,分布级奖励与现有 RL 微调技术(如 DDPO、DPOK)的结合方式未被探索,在工业级生成系统中集成时可能面临适配成本高、稳定性不足等工程化挑战。
论文Ruihang Li2026-07-02原文

相关内容