奖励一直就在你的数据中:用判别器引导的RL纠正流匹配
分数匹配 和 流匹配模型 常依赖 基于偏好的强化学习 来实现两个目标:对齐主观偏好,以及(出人意料地)恢复视觉真实性和一致物体结构等属性——这些本应是匹配训练从数据中学习的内容。我们认为这反映了结构不匹配:匹配损失(如 ell2 回归误差)在训练时边际分布下衡量速度场或得分场,与推理时决定样本质量的视觉和语义属性关联甚微。而偏好RL通过让模型基于自身样本进行评估并直接遵循奖励景观,绕过这一不匹配。挑战在于如何获得这种奖励而不依赖昂贵且混淆了数据真实性与标注者偏好的人类偏好。 我们提出 判别器引导强化学习 (DRL)。DRL 在预训练表征空间中训练一个判别器来区分数据和基础模型样本,并使用其 logit 作为 KL 正则化 RL 的奖励。预训练空间将判别器限制在感知有意义的维度上;logit 估计数据与模型之间的对数似然比,这是针对数据分布的最优奖励。在 SiT、JiT、REPA 和 RAE 上,DRL 降低了无引导 FID(例如 SiT 上从 9.38 降至 2.62)和语义空间 FD(例如 SiT 在 DINOv3 上从 88.2 降至 19.3),所有骨干网络均有一致提升,且无需训练即可改善人类偏好奖励。在后续基于偏好的后训练中,DRL 还能在偏好奖励与图像保真度之间产生更好的帕累托前沿,在提升对齐的同时减少过饱和、过亮等低级伪影。
论文精读
TL;DR 指出流/分数匹配损失在推理时与样本质量背离,提出判别器引导RL (DRL) 以表征空间logit比率为最优奖励,无需人类偏好即大幅改善FID与语义连贯性。
问题
生成模型的后训练对齐困境
当前,基于流匹配(Flow Matching)与分数匹配(Score Matching)的生成模型(如 SiT、JiT)在图像合成中表现突出,但推理时样本质量与训练目标之间存在结构性错配。这类模型训练时最小化速度场或分数场的 L2 回归误差,该代理目标在训练边缘分布上测量逐点差异,却无法直接反映视觉真实感、物体结构连贯性等判断样本质量的核心属性。因此,业界普遍采用基于偏好的增强学习(RL)进行后训练,利用偏好奖励信号引导模型向符合人类评判的方向更新。
现有方法的局限
- 匹配损失的几何失配:L2 损失在功能空间上对待所有方向均等,而人类感知对低频轮廓、纹理一致性等语义方向更敏感,导致模型虽在训练指标上收敛,推理时仍易产生模糊、结构崩坏或伪影。
- 偏好数据的昂贵与偏差:当前 RL 后训练依赖人类标注的偏好对,收集成本高、难以规模化,且偏好信号混杂了标注者的主观审美倾向,无法纯净反映“数据真实性”(data realism)。
- 推理-训练分布偏移:流匹配的常微分方程采样器会累积误差,而标准训练缺乏对推理路径的直接控制,更增强了 RL 的必要性。
问题的难度与重要性
核心挑战在于无偏好的前提下如何获得一个最优的奖励信号,使其能够精确衡量模型分布与真实数据分布的差异,从而在没有昂贵人工参与的情况下完成生成质量的校正。这个问题的突破将直接影响大规模生成模型的部署效率与可控性,尤其是在视觉内容创建、数字生物模拟等需要高保真素材的工业场景中。业界对摆脱人类瓶颈的自动对齐方法高度关注,因为这代表从“模仿人类标注”向“直接逼近数据分布”的范式转变。
行业类比
类似语言模型中 RLHF 用奖励模型替代人工标注的对齐过程,但本文旨在彻底剔除人类偏好,仅通过特征空间判别器从数据本身提取监督信号,犹如给生成模型配备了一个只关注“真假”而非“好恶”的内置裁判。
核心洞察
- 流匹配模型的训练目标(velocity/score的ℓ₂回归)与推理时的样本视觉质量存在结构性错位,导致模型学习到的分布偏离真实数据流形,RL后训练之所以有效,是因为它直接在生成样本上评估奖励,从而绕过了这种错位。 与单纯改进匹配损失或依赖人类偏好的常见思路不同,本文从根源上揭示了匹配范式在度量意义上的缺陷:训练时边际概率下的误差最小化并不保证推断时联合分布的样本质量。这一洞察解释了为何即使大规模匹配训练也无法自动恢复物体结构等属性,并自然引出了基于奖励信号的纠正框架。
- DRL提出以预训练表征空间中的二分类判别器输出作为KL正则化RL的奖励,该奖励理论上等价于数据与模型分布的对数似然比,因此是引导模型-真实分布对准的最优奖励信号。 相较于使用人类偏好(昂贵且混合了标注者主观倾向)或启发式奖励,该方法利用预训练模型的特征空间限制判别器关注语义有意义的变异方向,既无监督地定义了保真度,又避免了对抗训练的不稳定。它在多个骨干模型上一致降低FID和语义FD,甚至在未专门训练偏好奖励的情况下自发提升了人类偏好指标,展示了数据驱动奖励定义的优势。
方法
核心思路
DRL 的核心动机在于:流匹配与分数匹配模型在训练时优化的是速度场或分数场的 ℓ₂ 回归误差,这种训练期间的边缘分布上的损失并不能可靠地对应于推理时的视觉真实感和语义结构。为此,DRL 将问题重新表述为直接在样本空间上最大化数据似然比,并通过 RL 过程实现。
输入与前置条件
- 一个预训练好的流匹配/分数匹配基模型(如 SiT、JiT、REPA、RAE)及其生成的样本。
- 真实数据样本,来自训练数据集。
- 一个预训练特征提取器(如 DINOv3),用于将图像映射到感知语义对齐的表示空间。
关键模块与流程
表示空间投影
将基模型生成的样本和真实数据样本同时送入固定参数的预训练特征网络,得到紧凑的语义表示向量。这样做可以将判别器限定在感知上有意义的变化方向上,避免像素空间中的高频噪声对奖励信号的干扰。判别器训练
在表示空间中训练一个轻量判别器,其目标是区分来自真实数据的特征与来自基模型的特征。训练收敛后,该判别器的 logit 输出近似表示对数似然比log(p_data / p_model),这正是恢复数据分布的理论最优奖励信号。RL 后训练
以判别器 logit 作为奖励,对基模型进行 KL 正则化强化学习。具体实现采用 adjoint matching(伴随匹配)——一种基于随机最优控制的方法,在模型轨迹上执行类似策略梯度的更新,同时引入 KL 惩罚防止模型偏离初始策略过远。训练中还使用了局部线性积分器(Local Linear Integrator)来提高采样效率并减少离散化误差。
输出
微调后的模型在无引导采样下,FID 和语义空间 FD(例如 DINOv3 距离)均大幅降低,同时视觉伪影(如过饱和、过曝)显著减少。DRL 提升后的模型还能为后续基于人类偏好的 RL 提供更好的初始点,在偏好奖励与图像保真度之间形成更优的帕累托前沿。
与同类方法的差异
与基于人类偏好的 RL(如 DPO/RLHF)不同,DRL 无需任何人类标注,奖励完全来自数据与模型自身的对比学习;与 GAN 类的对抗训练也不同,DRL 在语义特征空间而非原始像素空间进行判别,并通过 KL 正则化 RL 而非直接极小极大优化,训练更稳定,且目标明确为匹配数据分布而非单纯“欺骗”判别器。
实验
实验设计
在多个 flow matching 和 score matching 骨干网络(SiT、JiT、REPA、RAE)上验证 Discriminator-Guided RL (DRL) 。主要评估步骤:
- 用判别器在预训练表示空间(如 DINOv3)中区分真实样本与基础模型生成样本,输出 logit 作为奖励信号。
- 以 KL-regularized RL(具体为 adjoint matching)后训练模型,最大化判别器奖励。
- 与标准 flow/score matching、基于偏好的 RL 等方法比较,并考察后续偏好后训练的兼容性。
指标包括 FID、语义空间特征距离(DINOv3 FD)以及人类偏好奖励。
关键发现
- 大幅缩小分布差距:DRL 将 SiT 的 guidance-free FID 从 9.38 降至 2.62,DINOv3 FD 从 88.2 降至 19.3,在所有骨干网络上均获一致提升。
- 无需人类偏好即提升主观质量:DRL 训练的模型在人类偏好奖励上同样优于基模型,尽管从未接触偏好数据。
- 为偏好对齐提供更好起点:经 DRL 后,再应用偏好 RL 可获得更优的 Pareto 前沿,在提升对齐度的同时抑制过度饱和、过亮等低级伪影。
与基线对比解读
基础 flow matching 的 ℓ₂ 回归目标与采样时的视觉语义质量存在结构错位,而基于偏好的 RL 虽能纠正,却依赖昂贵且混合了标注者倾向的人类反馈。DRL 通过判别器在冻结表示中估计数据-模型对数似然比,替代了偏好信号,直接对准数据分布。相比偏好 RL,DRL 在无需人工标注的情况下实现了竞争力强的 FID 和语义改善;对比标准匹配训练,DRL 彻底绕开了“损失-质量”代理失配问题。然而,DRL 的判别器受限表示空间,可能无法捕捉全部细粒度属性,因此在极端偏好对齐任务上或许不如专门偏好训练。但作为质量预提升步骤,DRL 为后续偏好调优铺平了道路,降低了低级伪影,整体提升了生成模型的工程可用性。
行业影响
落地场景
DRL 提供了一种无需人类偏好数据的生成模型优化方案,可嵌入任何基于 flow-matching 或 score-matching 的图像/视频生成产品中。主要场景包括:
- 创意内容生成:广告素材、社交媒体视觉内容、电商产品展示图等需要高视觉真实感与语义合理性的业务。
- 合成数据生成:自动驾驶、医学影像分析等依赖精确物体结构(如车辆、器官)的场景,DRL 可提升生成样本的标注一致性与分布对齐。
- 生成模型后训练:作为基础质量提升步骤,与后续偏好 RL 结合,降低人类标注需求。
商业价值
- 降低对齐成本:用判别器在预训练表征空间估计 log 似然比作为奖励,完全绕过昂贵的人类偏好标注,直接提升
FID与语义FD。 - 改善用户体验:视觉伪影(过饱和、过度提亮、结构扭曲)是生成内容被用户拒绝的主因。DRL 在 SiT 上可将 FID 从 9.38 降至 2.62,DINOv3 FD 从 88.2 降至 19.3,显著减少此类问题,提升内容点击率与留存。
- 提高偏好对齐效率:DRL 提供更好的初始模型,使后续人类偏好 RL 达到更优的失真-质量 Pareto 前沿,避免过度优化导致的质量崩溃。
与现有工作流的接口
- 轻量奖励注入:利用现有的预训练特征提取器(如 DINOv3)训练小型判别器,其 logit 可直接作为 KL 正则化 RL 的奖励信号。训练过程与原有 flow/score matching 兼容,可采用 adjoint matching 实现高效梯度传播。
- 模块化集成:DRL 判别器可视为一个即插即用的奖励模型,无需改动生成模型架构。只需在原训练循环中加入判别器评估与奖励项,即可运行 RL 微调。
- 与偏好对齐串联:先进行 DRL 提升基础质量,再接入少量人类偏好 RL 做最终对齐,整个流程可复用现有 RLHF 基础设施(如 reward model serving、KL 控制)。
具体落地 use case
- 全球电商平台商品图像生成:模型自动生成带场景的鞋服展示图。原始 flow-matching 模型易产生错位纹理或不合理光影。DRL 使用商品实拍图训练判别器,奖励逼真的光照与细节,输出图像直接用于详情页,提升转化率,且无需额外人工标注。
- 短视频平台特效生成:视频滤镜/特效依赖生成模型保持人脸与肢体结构稳定。DRL 在 REPA 或 SiT 上优化后,避免生成畸变或不自然的动态模糊,提高用户创作采纳率,并减少内容审核中因低质量特效而导致的驳回。
局限
- **额外计算开销**: DRL 在标准流匹配训练之外新增了两阶段流程 —— 判别器训练和基于强化学习的微调,每一步采样均需通过判别器获取奖励,导致时间与 GPU 内存开销显著上升。论文在 Limitations 部分明确提到 “Additional compute”,但并未给出与纯流匹配或 CFG 方案的定量对比,对于追求低延迟部署的工程场景,这种成本可能难以接受。
- **预训练表示空间的敏感性**: 奖励信号高度依赖预训练特征空间(如 DINOv3),若该空间与目标数据分布的结构不匹配,判别器可能关注无关或虚假的统计特征,最终导致分布偏移而未被察觉。论文讨论了 “Role of the representation”,但未提供通用的表示选择策略或鲁棒性保障,实际应用中可能需要繁琐的表示工程。
- **理论假设的局限性**: 理论分析建立在流匹配的概率流 ODE / SDE 框架上,并假定使用反向 KL 正则化,但未覆盖无分类器引导(CFG)等常用采样策略(论文在 9 Limitations 中承认 Classifier-free guidance 的兼容性问题)。此外,对 `λ`(正则化系数)的选择缺乏自动化准则,不同数据集可能需大量调参,限制了开箱即用的能力。