论文

MeanFlowNFT: 将前向过程强化学习引入平均速度生成器

MeanFlowNFT: 将前向过程强化学习引入平均速度生成器

MeanFlow 生成器通过预测时间区间内的平均速度实现快速少步采样,在高效生成方面具有吸引力。强化学习 (RL) 已成为将扩散和流模型与人类偏好及任务特定目标对齐的强大方法。特别是,DiffusionNFT 提供了一种高效的前向过程 RL 框架,无需反向过程轨迹或似然估计。然而,将此类 RL 方法应用于 MeanFlow 仍未得到充分探索。 DiffusionNFT 优化瞬时速度,而 MeanFlow 使用平均速度进行采样。为弥合这一差距,我们提出 MeanFlowNFT。受连接平均速度和瞬时速度的 MeanFlow 恒等式启发,我们构建了一个诱导的瞬时速度预测器,并将 DiffusionNFT 目标应用于该预测器,从而使奖励优化对 MeanFlow 定义良好。采样仍基于平均速度,保留了 MeanFlow 的快速少步生成特性。 我们进一步证明 MeanFlowNFT 继承了 DiffusionNFT 的严格策略改进保证。在图像和视频生成上的实验表明,MeanFlowNFT 持续改进基线。此外,它在大多数指标上优于先前最先进的 RL 调优少步生成器(在 SD3.5-M 上 8 项指标中占 6 项),甚至可以在仅使用少量采样步数的情况下超越多步 RL 调优扩散模型。例如,在 Wan 2.1 上,4 步 MeanFlowNFT 达到 VBench 得分 84.33,超过了 50 步 LongCat-Video RL(82.57)。

论文精读

TL;DR 将前向过程 RL 引入 MeanFlow 平均速度生成器,在保持少步采样的同时超越多步扩散的奖励对齐性能。

问题

问题背景

扩散模型与流模型已成为高保真图像、视频生成的主流范式,但它们通常需要多步积分采样,计算成本高昂。MeanFlow 通过预测时间间隔内的平均速度实现少步采样(如 4 步),极大提升了生成效率。与此同时,强化学习(RL)(如 DiffusionNFT)正成为对齐生成模型与人类偏好或任务指标的重要工具,它仅依赖前向过程即可优化,无需反向轨迹或似然估计。

现有方法局限

DiffusionNFT 的目标函数直接作用于模型的瞬时速度预测。但 MeanFlow 输出的是平均速度,两者在数学定义与采样机制上不兼容:直接将 RL 损失用于平均速度会导致梯度偏差,破坏已有的策略改进保证(即 RL 更新不一定提升生成质量)。其他尝试(如对采样过程反向传播)计算代价大,或需引入近似,难以在少步设定下保持稳定与效率。

为什么这个问题难/重要

平均速度与瞬时速度之间存在积分关系,要桥接二者需建立严谨的诱导瞬时速度预测器,使得 RL 优化目标可无缝应用于 MeanFlow,同时保留其少步采样的高速特性。此外,策略单调改进的理论保障对于工业级部署至关重要——确保每轮 RL 微调后生成质量不降反升。业界正积极寻求将 RL 对齐能力赋予更高效的少步生成器,以降低实际推理成本,满足交互式视频、实时 AIGC 应用的需求。

行业类比

如同 RLHF 让大语言模型在极少额外推理开销下更好地遵循人类意图,MeanFlowNFT 为少步生成模型提供了一种“后训练 RL 对齐”方案,将高质量生成与低采样延迟统一起来。

核心洞察

  • 该方法利用 MeanFlow 恒等式将平均速度生成器的输出映射为诱导的瞬时速度预测器,从而让原本只能优化瞬时速度的前向过程 RL 框架(DiffusionNFT)得以无缝应用于平均速度模型。这一桥接不仅形式简洁,而且避免了修改采样过程(仍保持平均速度的少步快速生成),从根本上解决了两个速度范式不兼容的问题,为后续其他平均速度生成器与 RL 的对齐提供了通用思路。
  • MeanFlowNFT 严格继承了 DiffusionNFT 的策略改进定理,即每次 RL 更新后生成策略的期望奖励单调不减,这为 RL 调优在平均速度生成模型上的可靠性提供了理论保障。实验进一步表明,这种少步 RL 对齐策略在效率与质量上具有显著优势:仅 4 步采样的 MeanFlowNFT 在 VBench 上超越 50 步的多步 RL 扩散模型,有力证明了通过 RL 直接优化生成轨迹的速度表示,能以极低的推理成本获得顶尖的生成质量。

方法

输入与问题设定

  • 预训练 MeanFlow 生成器:输入噪声和时间步,直接预测给定时间区间上的平均速度,可实现少步(如 4 步)采样。
  • 奖励模型:提供标量奖励信号,用于对齐人类偏好或任务目标。
  • 挑战:已有前向过程 RL 方法(如 DiffusionNFT)仅针对瞬时速度预测器设计,直接应用于平均速度预测器会导致优化目标不匹配,无法保证策略改进。

核心模块:从平均速度到瞬时速度的桥接

  1. MeanFlow 恒等式:MeanFlow 生成器预测的平均速度与真实流场瞬时速度之间存在解析关系。给定时间区间 [t, s] 的平均速度 v_mean(t, s),可通过恒等式反推区间内任意时刻的瞬时速度 v_inst(·)。该恒等式不依赖额外训练,仅基于流匹配的数学性质。

  2. 诱导瞬时速度预测器构造:对任意中间时间点 τ ∈ [t, s],利用 MeanFlow 模型输出当前区间的平均速度,再代入恒等式计算对应的瞬时速度估计 v̂_inst(τ)。这一过程将原本输出平均速度的模型“包装”成一个虚拟的瞬时速度预测器,其行为完全由原 MeanFlow 参数决定。

  3. DiffusionNFT 目标函数适配:将诱导瞬时速度预测器带入 DiffusionNFT 的前向过程 RL 损失。该损失基于单步前向采样(无反向轨迹),对预测的瞬时速度与给定噪声样本计算梯度,更新模型参数以最大化累积奖励。由于诱导速度由 MeanFlow 参数化,梯度可反向传播至原始平均速度预测器。

  4. 保留平均速度采样:训练后,采样流程仍使用 MeanFlow 原始的平均速度预测,采用少步 Euler/Heun 等离散化方式。因此推理效率不受 RL 微调影响,依然保持快速生成。

输出与理论性质

  • 输出为微调后的 MeanFlow 权重,在少步采样时能生成更高奖励的图像或视频。
  • 论文证明该方法严格继承 DiffusionNFT 的策略改进保证:每次策略更新后,期望奖励不会变差,且最优解对应奖励最大化。

与同类方法的差异

相较于直接对平均速度输出应用 RL(缺乏理论保证)或强制改用瞬时速度模型(牺牲采样速度),MeanFlowNFT 通过构造诱导速度将现有前向过程 RL 框架无缝迁移到平均速度生成器上,同时保持推理效率和理论严谨性。

实验

实验设计

MeanFlowNFT 在图像与视频两类生成任务上验证,基础模型分别采用 SD3.5-M(图像)与 Wan 2.1(视频)。通过将 DiffusionNFT 前向过程 RL 目标应用到由 MeanFlow 恒等式 导出的瞬时速度预测器上,实现了对平均速度生成器的奖励微调,采样仍保持原 MeanFlow 的少步快速特性。对比基线包括先前的 SOTA RL-tuned few‑step 生成器(图像)与 LongCat‑Video RL(视频)。

关键发现

  • 在 SD3.5‑M 上,MeanFlowNFT 在 8 个评估指标中的 6 个显著超过最优 RL-tuned few‑step 基线。
  • 在 Wan 2.1 上,仅需 4 步采样 即达到 VBench 84.33,超越 50 步 的 LongCat‑Video RL(82.57),证明平均速度生成经 RL 微调后可在极少步数下匹敌甚至赶超多步扩散模型。
  • 方法继承 DiffusionNFT 的严格策略改进保证,优化过程无需求逆过程轨迹或似然估计。

与基线的深度对比

直接对 MeanFlow 的输出平均速度施加 DiffusionNFT 目标面临语义失配(DiffusionNFT 设计对象为瞬时速度)。MeanFlowNFT 通过诱导瞬时预测器巧妙规避此问题,既保留平均速度采样高效性,又使前向 RL 优化合法化。与图像领域的 SOTA few‑step RL 方法相比,它不仅在多数指标上胜出,还首次展示了 RL-tuned 少步生成器超越多步 RL‑tuned 扩散模型的可能性。视频结果进一步凸显:极低步数下的高质量生成,为低延迟部署提供新范式。

行业影响

落地场景

MeanFlowNFT 使 MeanFlow 这类少步生成器能够通过 RL 微调 匹配人类偏好或任务目标,特别适合对生成延迟敏感的业务。典型应用:

  • 短视频平台:AI 生成创意短视频,要求秒级响应,4 步采样可极大降低等待时间。
  • 广告素材批量生产:快速产出高质量图像/视频,支撑实时 A/B 测试与动态创意优化。
  • 虚拟数字人:实时驱动高保真形象,需要低延迟推理。

商业价值

  • 降本:采样步骤从 50 步压缩至 4 步,推理计算量减少 10 倍以上,直接削减 GPU 资源与电力成本。
  • 增收:更快生成 → 更高内容产量 → 平台可提升广告库存或订阅收入;交互式创作工具可吸引更多付费用户。
  • 体验提升:近乎实时的反馈、支持交互式编辑,增强用户粘性与产品竞争力。

与现有工作流的集成

MeanFlowNFT 是一种轻量微调方案,可直接作用于预训练的 MeanFlow 权重。它使用前向过程 RL 目标(源自 DiffusionNFT),无需反向轨迹或似然估计,训练成本低。集成路径:

  1. 加载预训练 MeanFlow 模型与奖励模型;
  2. 用 MeanFlowNFT 损失进行微调;
  3. 部署时保持原有采样流程(仅替换权重),无需修改推理引擎。

兼容 Hugging Face DiffusersPyTorch 等生态,可无缝嵌入 MLOps 流水线

具体用例

  1. 电商虚拟试穿/商品展示:为数千商品快速生成场景图(如模特上身效果),用 4 步采样实时预览,单张生成成本降至原先的 1/10,支撑大规模素材更新。
  2. 在线教育动画生成:根据教学脚本自动生成讲解动画,步骤少、速度快,使非专业教师也能高效产出视频内容,显著缩短课程制作周期。

局限

  • **训练成本与奖励模型依赖**:MeanFlowNFT 需要额外构建并微调一个**诱导瞬时速度预测器**(induced instantaneous-velocity predictor),这增加了训练计算开销。同时,该方法沿用 DiffusionNFT 的前向过程 RL 框架,其优化效果强依赖于奖励模型的质量和泛化能力;若奖励模型在分布外数据上存在偏差,可能误导 RL 训练,造成生成质量不稳定或出现模式坍缩。
  • **模型与任务泛化性有限**:实验主要在 **Stable Diffusion 3.5-M**(文生图)和 **Wan 2.1**(文生视频)上验证,且均基于特定的 MeanFlow 生成器架构。论文未在更多元的基础模型(如不同规模的 DiT、基于 Transformer 的流模型)或其它生成任务(如文本到 3D、音频生成)上评估,方法泛化性尚不明确。此外,少步生成器通常对预训练质量敏感,RL 微调后是否仍保持原有多样性也未充分讨论。
  • **框架局限性与更广泛 RL 方法的比较不足**:MeanFlowNFT 本质上是将 DiffusionNFT 的目标函数适配到平均速度生成器,继承了前向过程 RL 的固有假设(如绕过反向轨迹和似然估计)。这使其相较于利用后验采样或在线策略优化的 RL 方法,可能在复杂奖励信号(如涉及全局结构或细粒度控制的偏好)面前灵活性不足。论文也未与一些最新的扩散模型 RL 对齐工作(如基于策略梯度的 DDPO、SPIN 等)进行直接对比,只侧重展示了与 DiffusionNFT 及少步生成器的比较。
论文Yushi Huang2026-07-16原文

相关内容