论文

MEND:通过近端速度匹配为 Flow Models 做强化学习

MEND:通过近端速度匹配为 Flow Models 做强化学习

Flow models 的奖励后训练通常走两条路:要么在 KL 惩罚或冻结参考模型下对模型自身样本重新加权,往往需要数千次更新;要么直接反向传播奖励并移动每个样本,却不检查这次移动是否配得上它的位移幅度。 我们提出 MEND,一种基于近端速度匹配 的强化学习方法。MEND 在每个 prompt 组内对奖励设置上限,已经得分很高的样本不再移动;在上限之下,它沿奖励梯度提出移动,仅当截断后的奖励增益超过二次位移代价时才接受该移动。随后模型回归到由此得到的速度目标上,全程不需要 KL 项、冻结参考模型或优势权重。 实验方面: 1. 在 100 次更新内,MEND 在与基座模型图像距离相同的前提下,于六个评估器中的五个上超过 Flow-GRPO(约 4k 次更新)。 2. 在等预算协议下,它在四个训练奖励的每一次评估更新上都超越 ReFL 和 DiffusionNFT,PickScore 达到 24.03,而两者分别为 23.92 与 23.43。 3. 一次 300 次更新、三奖励的训练也超过五奖励的 DiffusionNFT 模型,在其训练的三个奖励上全部领先。 MEND 通用且易于采用:适用于任何具备可微奖励的 flow backbone。

论文精读

TL;DR MEND 用近端速度匹配做 flow 模型奖励后训练:只在奖励增益超过位移代价时接受移动,无 KL 项或参考模型,100 步更新即可超过 Flow-GRPO 数千步效果。

问题

问题背景

奖励模型使得对文本到图像流模型进行后训练以对齐人类偏好成为可能。当前研究聚焦于如何利用标量奖励高效更新生成模型,在提升奖励的同时保持基础模型的生成质量。

现有方法局限

现有方案主要有两类:一类是重加权方法,如 Flow-GRPO 等,在 KL 惩罚或冻结参考模型约束下对模型自身样本重新加权,通常需要数千步更新,收敛缓慢且计算开销大;另一类是直接反向传播奖励,如 ReFL 和 DiffusionNFT,对每个样本都施加移动,缺乏对移动代价的合理性检查,容易破坏基础模型分布,导致过度优化或质量退化。此外,这些方法往往没有利用样本级别的奖励分布信息,对已获得高奖励的样本仍然进行不必要的更新。

为什么这个问题难/重要

挑战在于将标量奖励转化为更新时,必须同时满足两个目标:快速提升奖励和保持生成质量。奖励信号通常高方差、不可靠,且过度优化会导致模式坍塌或失真。业界高度关注奖励后训练的效率与稳定性,因为这是生成模型对齐人类偏好的核心环节,任何改进都能直接提升产品体验。一种无需 KL 项、冻结参考模型或优势权重的通用方法,若能在极少量更新内超越现有基线,将显著降低计算成本并简化训练流程,对资源受限的工程场景尤为关键。

行业类比

类似在机器人控制中,我们希望每一步动作既能提高任务奖励,又不超过安全边界,需要对动作位移施加近端约束。

核心洞察

  • MEND 将奖励最大化转化为带约束的近端优化问题,核心是“速度目标”的筛选机制。它通过 prompt 组内截断奖励(cap)并设置二次位移代价,确保仅当截断奖励增益大于位移代价时才接受并生成速度目标。与 Flow-GRPO 等基于 KL 惩罚或优势权重的方法相比,MEND 不重新加权整个样本分布,也不依赖参考模型,而是直接对低奖励样本施加有界移动,因此在 100 步内达到约 4000 步的同等或更好奖励提升。
  • MEND 的“截断奖励”(cap within prompt group)是一种无参数的优势函数替代,让高分样本完全不移动,从而将更新预算集中于奖励低的样本。与常见 RLHF/DPO 系列方法中使用 KL 散度或 advantage 权重来抑制过度更新不同,MEND 的截断机制不引入任何需要调节的超参数(如 KL 系数、温度),同时通过二次位移代价自然限制了步长。这种设计使得 MEND 对超参数不敏感,并且无需维护参考模型,显著降低了工程复杂度和显存占用,对实际部署更友好。

方法

方法概述

MEND 是一种基于 proximal velocity matching 的奖励后训练方法,用于流模型。它通过显式的收益-代价检验决定每个样本是否移动,避免了传统 RL 中的 KL 惩罚、参考模型或优势权重。

输入 → 关键模块 → 输出

  • 输入:预训练流模型(如 SD3-M、Z-Image-Turbo)、可微奖励模型、提示集。
  • 关键模块:
    1. 奖励封顶:对每个提示组内的样本奖励进行封顶。已高于封顶的样本被视为“足够好”,其速度目标置零,防止破坏优质样本。
    2. 移动提议:对低于封顶的样本,沿奖励梯度方向提出候选速度移动。
    3. 接受准则:计算该移动的封顶奖励增益,并与二次位移代价比较。仅当增益超过代价时接受移动,否则速度保持为零。
    4. 回归目标:模型回归拟合接受后的速度目标,损失函数不含 KL 项或参考模型。
  • 输出:微调后的流模型,在 100 步左右即可显著提升奖励,同时保持与基模型的图像距离。

与同类方法的差异

MEND 不使用重加权或优势权重,而是通过近端速度匹配和接受准则直接筛选有效更新,因此能够在极少的更新次数下超越需要数千步的 Flow-GRPO 等方法。

实验

实验设计

MEND 在文本到图像 flow 模型上做 reward post-training,奖励模型可微。对比基线包括 Flow-GRPO、ReFL、DiffusionNFT。采用等预算协议,评估多个奖励模型(如 PickScore),并测量到 base 模型图像的距离以控制 fidelity。关键更新量为 100 / 300 步。

关键发现

  • 100 次更新时,MEND 在 6 个评估器中的 5 个上超过 Flow-GRPO(约 4k 次更新),且与 base 图像距离相同。
  • 等预算协议下,MEND 在每次评估更新上超过 ReFL 与 DiffusionNFT,PickScore 达到 24.03,对比 23.92 / 23.43。
  • 300 次更新、训练 3 个 reward 的 MEND,在三个训练 reward 上全面超过训练 5 个 reward 的 DiffusionNFT。

深度解读

MEND 的 proximal velocity matching 通过 prompt 内 reward 截断与二次位移价格,只接受“reward 收益 > 位移成本”的移动,避免无效更新。相比 Flow-GRPO 需要上千步、且依赖 KL / frozen reference,MEND 无 KL 项、无参考模型、无 advantage weights,从而在极少更新下保持高样本效率与 base 模型 fidelity。这对工程实践意味着:可快速将任意可微奖励注入现有 flow backbone,无需复杂超参或长时间训练。

行业影响

落地场景

MEND 面向文本到图像流模型的高效奖励后训练,适合任何需要快速将生成质量与人类偏好对齐的产品线。

  • 电商商品图生成:用点击率、加购率等业务指标作为奖励信号,微调基础模型使生成的商品图更吸引人,提升转化。
  • 内容平台配图:根据用户互动(点赞、收藏、停留时长)构建奖励,快速优化素材生成美学与语境匹配度,降低人工审核与重生成成本。
  • 广告创意生成:针对不同受众的偏好反馈训练奖励模型,短周期内产出高点击率创意图像。

商业价值

降本是最直接收益:MEND 在 100 步更新即可达到 Flow-GRPO 约 4000 步的效果,GPU 时耗与算力成本大幅下降;无需冻结参考模型或 KL 惩罚项,训练管线更轻量,存储与显存占用更低。

体验提升带来增收空间:更准确对齐人类偏好能提高用户参与度与付费转化率,例如电商场景下生成图与用户偏好的匹配度提升可直接改善 CVR。同时方法通用,支持任意可微分奖励与 flow backbone,降低企业技术选型风险。

与现有工作流接口

MEND 可直接替换现有 RLHF/DPO 后训练阶段中的 GRPO 或 ReFL 等算法,嵌入 PyTorch / Hugging Face Diffusers 训练循环。

  1. 输入:基础 flow 模型 + 可微分奖励模型(如 PickScore、ImageReward)。
  2. 过程:每个 prompt 组内截断奖励,沿奖励梯度提议速度,根据收益-位移价格比接受或拒绝,回归到速度目标。
  3. 输出:微调后的模型,无需额外参考模型或优势权重计算。

开源代码 MEND-RL 提供实现参考,可快速集成到现有训练栈,与模型部署、监控流程无缝衔接。

局限

  • **依赖可微奖励模型**:MEND 要求 reward 可微,以便沿其梯度提出速度更新。这在 PickScore、ImageReward 等常用可微奖励模型上可行,但对于基于离散规则、人类二元反馈或不可微的评测指标(如某些 CLIP 变体或图像质量启发式)则无法直接使用。此外,方法中对每个提示组内奖励进行裁剪,其有效性依赖于奖励模型能正确区分高质量与低质量样本;若奖励模型存在系统性偏差或噪声,可能误将平庸样本评为“已达标”而不予更新,从而限制性能上限。
  • **实验覆盖范围有限**:主实验主要在四个训练奖励(PickScore、HPSv2 等)和六个评估器上进行,对比基线仅包括 Flow-GRPO、ReFL、DiffusionNFT 三类。缺少对更多主流奖励模型(如 CLIP score、Aesthetic Predictor)以及不同规模 flow backbone 的系统评估。同时,MEND 引入了若干关键超参数(如奖励上界百分位、二次位移价格系数),但在主文中未充分展示这些超参数的敏感性分析,可能影响不同任务下的调参成本与稳定性。
  • **长期训练行为未充分验证**:论文展示了 100 步更新即超越 Flow-GRPO 约 4k 步效果,且 300 步三奖励运行性能出色;但长期训练(例如 1000 步以上)是否会出现 over-optimization 或奖励黑客现象,缺乏深入讨论。与带 KL 约束的方法相比,MEND 完全去掉了 KL 正则和参考模型,虽在短预算内高效,但可能丧失对基模型多样性的保护,尤其在多轮迭代后可能偏向高奖励但低多样性的样本分布。
论文Shreshth Saini2026-10-05原文

相关内容