论文

Follow the Mean: 参考引导的流匹配

Follow the Mean: 参考引导的流匹配

已有的可控生成方法通常依赖微调、辅助网络或测试时搜索。我们证明 流匹配 支持另一种控制接口:通过示例进行自适应。对于确定性插值,速度场 仅由 条件端点均值 决定;改变该均值即改变流本身。这为可控生成提供了一个简单原理:通过改变预训练模型所遵循的参考集来引导生成。 我们以两种形式实现该思想。参考均值引导(Reference-Mean Guidance)无需训练:它从参考库中计算封闭形式的端点均值修正,并应用于冻结的 FLUX.2-klein (4B) 模型,在保持提示词、种子和权重不变的情况下控制颜色、身份、风格和结构。半参数引导(Semi-Parametric Guidance)通过显式均值锚点和学习残差精炼器来摊销相同思想,在 AFHQv2 上匹配无条件 DiT-B/4 质量,同时允许推理时切换参考集。 这些结果指向一个更广的方向:通过数据而非参数更新进行自适应的生成模型。

论文精读

TL;DR 流匹配中速度场由条件端点均值闭式决定,替换参考示例集即可直接控制生成(颜色、身份、风格等),无需训练或改动提示词与种子。

问题

问题背景

可控生成是生成式模型领域的核心挑战之一,尤其在扩散模型与流匹配 (Flow Matching) 框架快速发展的当下,业界愈发关注如何在不牺牲生成质量的前提下实现精细、即时的控制。流匹配通过构造确定性速度场进行生成,其插值形式的简洁性为新的控制范式打开了空间。

现有方法局限

当前主流控制手段存在明确短板:

  • 微调 (Fine-tuning) 类方法(如 LoRA、DreamBooth)需针对每个控制目标重新训练,计算开销大且难以泛化。
  • 辅助网络 方法(如 ControlNet、Adapter)虽然解耦控制与基座模型,但仍需额外训练并固定控制模式。
  • 测试时搜索 / 优化(如 classifier guidance、test-time optimization)往往导致推理成本剧增,且控制粒度受限。 这些方法普遍要求修改模型参数或引入外部模块,无法在推理时动态切换控制目标,缺乏灵活性。

问题难点与重要性

可控生成的根本矛盾在于:生成质量、多样性、控制精度计算效率之间的平衡。业界对实时风格迁移、身份保持、结构引导等场景需求强烈,但现有方案难以兼顾“零训练”与“按需控制”。

本文揭示了一个关键洞察:在流匹配的确定性插值下,速度场由条件端点均值唯一决定,改变该均值即可原封不动地引导生成流。这给出了一个全新的控制接口——通过示例集 (reference set) 调整端点均值,而非修改模型参数。其难点在于如何从 reference bank 中高效计算闭合形式的均值修正,并避免推理时的不稳定。该思路将生成模型的适应方式从“参数更新”转向“数据驱动”,有望大幅降低控制成本,推动即插即用的可控生成。

行业类比

将预训练大语言模型与检索增强生成 (RAG) 的关系类比:RAG 通过外部知识库实时影响输出,无需微调模型;本文的 Reference-Mean GuidanceSemi-Parametric Guidance 类似,让参考集成为可插拔的控制模块,使视觉生成模型能够即时适应不同风格或结构,而无需任何参数改动。

核心洞察

  • **数据即控制接口:通过改变参考集引导流的生成方向,无需微调模型参数。** 与依靠辅助网络、提示工程或测试时搜索的主流可控生成不同,本文揭示流匹配模型中确定性插值对应的速度场仅由条件端点均值决定,因此只需移位该均值即可改变生成结果。该原理将控制机制完全解耦为对示例数据的操作,使得预训练权重的保留成为可能,实现了参数冻结下的风格、身份与结构操控,为构建以数据驱动、易于组合的控制接口提供了一种全新范式。
  • **训练自由与半参数双路径验证了同一思想的伸缩性:零开销的闭式校正与轻量残差精炼器。** **Reference-Mean Guidance** (RMG) 直接从参考集中计算闭式均值修正并施加到冻结的 FLUX.2-klein (4B) 模型上,无训练即可实现颜色、身份等多维度控制。**Semi-Parametric Guidance** (SPG) 则通过显式均值锚点与可学习残差精炼器在 AFHQv2 上达到与无条件 DiT-B/4 匹配的质量,且推理时可动态更换参考集。两者分别满足零额外计算与高质量保真场景,展示了从简单几何混合到检索增强生成的连续谱,为未来兼顾效率与灵活性的生成系统提供了务实路线图。

方法

方法概述

本文提出一种基于示例驱动的生成控制范式:通过修改条件端点均值(conditional endpoint mean)来引导预训练流匹配模型,无需参数更新。该方法的理论基础是:对于确定性插值(deterministic interpolants),速度场仅由端点均值唯一确定,移动端点均值即等效于移动整个生成轨迹。

输入与框架

  • 输入:噪声潜码、条件(如文本提示)、可选的参考集(一组示例样本)。
  • 基座模型:冻结的流匹配模型(如 FLUX.2-klein 4B 或 DiT-B/4),其速度场由条件端点均值参数化。

关键模块

1. 参考均值引导(Reference-Mean Guidance, RMG)

在无训练条件下,该方法通过参考集计算后验端点均值的闭式修正量。具体实现为几何混合:将原始条件均值与参考集诱导的经验均值在端点层级进行加权组合,权重由引导强度控制。修正后的均值直接输入冻结模型的速度场网络,生成过程无需额外优化。

工程启示:RMG 提供了一种零样本控制接口,用户可通过在推理时动态替换参考集,实现颜色、身份、风格和结构等属性的解耦操控,而提示词、随机种子和模型权重均保持不变。

2. 半参数引导(Semi-Parametric Guidance, SPG)

SPG 将参考集信息摊销进一个可训练的残差细化网络。该网络以噪声、时间和参考集为输入,学习预测速度场修正量。其设计包含:

  • 均值锚点:显式编码参考集的端点均值,作为条件偏置;
  • 残差细化器:学习锚点之外的补充结构,保持生成质量的同时允许参考集在推理时自由替换。

训练后的 SPG 在 AFHQv2 上达到与无条件 DiT-B/4 相当的生成质量,验证了半参数方法的有效性。

输出

生成符合目标属性的样本,且属性由参考集定义,而非硬编码在提示词或模型参数中。

与同类方法的差异

与微调(LoRA/全参)、辅助网络(如 ControlNet)或测试时搜索(如 classifier guidance)不同,本方法通过数据层面的均值偏移实现控制,无需任何参数更新(RMG)或仅需一组轻量残差模块(SPG),并将控制逻辑与模型本体解耦,使生成行为可随参考集动态切换。

实验

实验设计

本文围绕两种 参考引导的流匹配 方法设计实验:

  • Reference-Mean Guidance 在冻结的 FLUX.2-klein (4B) 扩散模型中,通过预构建的参考图像集(GenEval Reference Banks)计算条件端点均值的闭式修正,无需任何训练或微调。验证使用了合成数据集(Two MoonsMNIST)并扩展到大规模真实图像控制任务。
  • Semi-Parametric GuidanceAFHQv2 数据集上训练一个半参数模型:主干网络输出显式均值锚点,附加可学习的残差精炼器。训练时使用固定参考集,推理时可自由替换参考集,实现非参数适应。

关键发现

  1. 训练无关控制的有效性:RMG 通过 几何混合 参考端点分布,成功将 FLUX.2-klein 的生成过程引导至目标颜色、身份、风格乃至结构特征,且保持提示、随机种子不变。
  2. 结构控制与组合能力:RMG 支持利用结构参考图像(如边缘图)约束生成布局,并可通过算术混合或集合操作组合多个参考集的效果。
  3. 半参数模型的摊销特性:SPG 在 AFHQv2 上达到了与 unconditional DiT-B/4 相当的生成质量(FID),同时保持了 推理时参考集可替换 的灵活性,模型不会坍塌为标准流匹配。
  4. 机制性验证:在 Two Moons 和 MNIST 上的实验证实,端点均值移位理论正确预测了流的偏移行为,即使在小规模数据集上也能观察到清晰的引导效应。

与基线对比

  • 对比 classifier-free guidance:RMG 无需训练辅助分类器或引入额外条件网络,完全依赖预计算参考集,是一种 零样本、零参数更新 的控制接口。
  • 对比 fine-tuning / LoRA 等适配方法:RMG 不改变模型权重,避免灾难性遗忘和过拟合风险;SPG 则通过 学习残差而非全量微调,在保留基础模型能力的同时注入参考集信息。
  • 对比典型可控制生成:RMG 利用流匹配的 确定性插值 特性,将控制问题归约到均值偏移,避免了测试时搜索或强化学习等昂贵过程。
  • 工程启示:这种 “通过数据而非参数更新来适应” 的思路为模型部署提供了新可能——同一基座模型可通过更换轻量级参考银行服务于不同下游任务,大幅降低维护成本。

行业影响

落地场景

Follow the Mean 提出的参考集引导生成(Reference-Guided Flow)为可控内容创作提供了无训练、可插拔的接口。典型应用包括:

  • 电商视觉:同一商品 prompt 下,通过替换参考图像集(如不同季节、色调、风格的样板间)批量生成风格统一的商品图,无需重新训练或调整 prompt。
  • 影视/游戏资产生成:固定角色身份或纹理风格,由参考集驱动生成一致性的角色原画、面部表情、环境纹理。
  • 内容平台个性化:用户上传少量图像作为参考集,即可让预训练模型生成与参考集风格对齐的图片,实现低成本的模板化风格迁移。

商业价值

  • 降本Reference-Mean Guidance (RMG) 是训练无关的,直接在冻结的 FLUX.2-klein (4B) 模型上操作,省去微调所需的大量算力与时间成本。
  • 效率提升:推理时通过闭式解修正速度场,无需辅助网络或测试时搜索,生成延迟与标准推理持平,适配实时交互场景。
  • 生态扩展Semi-Parametric Guidance (SPG) 仅需少量训练即可让模型支持任意参考集,可将一个基础生成模型复用至多种风格,降低维护多模型版本的成本。

与现有产品/工作流的集成

  • 插件式集成:RMG 可封装为推理引擎的预处理模块,接收参考集并输出修正后的速度场,不改动原有 pipeline。可直接嵌入 DiffusersComfyUI 等框架。
  • 评测衔接:与 CLIP Score、FID 等指标兼容,可无缝接入现有的生成质量与可控性评测流水线。
  • 数据驱动迭代:参考集可动态更新,产品端允许用户实时反馈,形成“用户提供参考→模型即时适配”的闭环,无需重新训练或部署。

具体用例

  1. 服装电商详情页生成:商家上传 5–10 张同系列服装的实拍图作为参考集,调用冻结的 FLUX.2-klein 模型,输入同一款衣服的 prompt,可批量生成不同模特姿势、背景且风格统一的详情页主图,避免传统方案中每换风格就要微调 LoRA 的成本。
  2. IP 形象延展设计:工作室持有固定角色的 20 张参考图(面部、服饰、道具),通过 RMG 让模型生成该角色在不同场景、动作下的插画,保持身份一致性,且无需每次调整 prompt 或重新训练模型,大幅提升素材产出速度。

局限

  • **对确定性插值流的依赖**:本文方法的核心是流匹配中确定性插值(如线性插值)下速度场仅由条件端点均值决定,因此通过改变参考集均值即可控制生成。对于随机插值或基于随机微分方程的扩散模型,端点均值与速度场的关系更复杂,该方法可能无法直接迁移。此外,参考集的质量和分布对控制效果影响显著:若参考样本与生成目标的分布不一致,或样本数量不足,估计的端点均值会出现偏差,导致生成结果偏离预期。这在训练自由模式下尤甚,因为 RMG 没有机制修正错误的均值偏移。
  • **推理效率与计算开销**:训练自由的 RMG 在推理时需要对参考集执行检索或前向传播来计算端点均值,计算量与参考集大小线性相关。尽管 CLIP 特征计算可提前缓存,但大规模参考库(如包含数万样本)下延迟仍不可忽略。半参数方法 SPG 将部分计算分摊到训练中,但需额外训练一个残差细化网络,且该网络与参考集锚点耦合,在推理时改变参考集虽可行,但泛化能力受限于训练时的锚点分布,可能导致生成质量波动。
  • **控制维度与模型适用范围有限**:实验主要在 FLUX.2-klein(4B 参数)和 DiT-B/4 上进行,展示了颜色、身份、风格和简单结构控制,但未涉及更复杂的语义控制(如多物体布局、场景关系)或文本条件分割。该方法假设参考集能充分表征所需属性,当属性定义模糊或需要组合控制时,简单的均值混合可能无法精确解耦。此外,尚未在自回归模型或基于 VAE 的生成框架上验证,泛化性有待进一步确认。
论文Pedro M. P. Curvo2026-05-12原文

相关内容