论文

Multi-Resolution Flow Matching: 通过分阶段采样实现无训练扩散加速

Multi-Resolution Flow Matching: 通过分阶段采样实现无训练扩散加速

无训练加速文生图扩散的策略(如时间步蒸馏和特征缓存)可减少推理时间,但多分辨率生成方法在潜空间上采样和局部区域选择性修改时,易产生模糊或伪影。针对此问题,本文提出 MrFlow,一种基于低到高分辨率分阶段流水线的无训练多分辨率加速策略,适用于预训练流匹配模型。 MrFlow 首先在低分辨率下快速生成主体结构,随后在像素空间使用轻量预训练GAN 模型进行超分辨率,接着注入低强度噪声以重新采样高频细节,最后在高分辨率下精修。在 FLUX.1-dev 和 Qwen-Image 上的定量与定性结果表明,MrFlow 利用低分辨率采样的二次令牌缩减和减少步数需求,实现 10 倍端到端加速,且 OneIG 指标与加速前差距在 1% 以内,显著优于其他无训练加速策略,无需训练或运行时动态识别。 MrFlow 还可直接与预训练时间步蒸馏策略正交结合,进一步实现高达 25 倍的生成加速。

论文精读

TL;DR MrFlow 利用低分辨率生成与像素域超分组合,无需训练即可将流匹配文生图模型加速 10~25 倍,且质量损失极小。

问题

问题背景

随着 流匹配模型(如 FLUX.1Qwen-Image)在文生图任务中取得高质量生成效果,模型参数持续增大、推理耗时显著增加,硬件无关的无训练加速策略成为业界关注的重点。多分辨率生成通过低分辨率采样减少计算量实现大幅提速,但现有方案始终面临质量与速度的折中。

现有方法局限

当前多分辨率方法(如 ToMeToken Merging 等)的核心设计是在潜在空间中进行上采样,并选择性修改部分区域以实现加速。这一范式存在三个具体局限:

  • 潜在空间上采样缺乏精确的高频细节恢复能力,导致重建图像出现肉眼可见的模糊。
  • 局部选择性修改依赖动态区域识别(如注意力图或梯度),运行时开销大且容易引入块状伪影。
  • 加速与保真度的冲突:为追求 > 5× 的加速比,必须在低分辨率下完成大部分结构生成,但低分辨率潜在表示中的信息损失在后续步骤中难以弥补。

为什么这个问题难且重要

挑战在于 计算压缩率与重建质量间的根本矛盾

  • 低分辨率采样中 token 数量呈二次方减少(token_count ∝ (H·W)),加速效果显著,但下采样丢失的高频分量无法通过简单的潜在层上采样恢复。
  • 流匹配模型的常微分方程(ODE)采样路径对初始噪声和中间步的扰动敏感,强行插入像素空间超分或噪声注入容易破坏生成结构。

业界关注度高,因为 FLUX.1-dev 等大模型单张推理需数十秒,无法满足交互式应用;无训练加速直接复用已有模型生态,无需复杂系统优化或定制内核,对部署最友好。

行业类比

类似在实时视频通话的美颜降噪中,先在低分辨率下快速控制噪点与肤色,再用超分网络补齐纹理,既保证低延迟又不牺牲画质——这正是多分辨率加速可迁移的应用逻辑。

核心洞察

  • 通过将上采样从潜在空间转移到像素空间,避免了传统多分辨率方法的模糊和伪影。MrFlow 使用轻量级预训练 GAN 模型在像素空间进行超分辨率,然后注入低强度噪声并高分辨率微调,这种解耦设计充分利用了低分辨率生成的结构保真度和像素空间超分的清晰度,相比基于潜在空间插值的方法,图像质量显著提升。
  • 通过分阶段解耦结构生成与细节细化,并与步数蒸馏正交组合,实现高达25倍端到端加速。低分辨率阶段利用token数量二次减少和少步抽样快速生成主要结构;然后借助预训练GAN超分和噪声注入恢复高频,最后高分辨率一步细化细节。这一模块化设计无需任何训练,且可无缝叠加LCM等蒸馏策略,进一步提升加速比,为实际部署提供了极大的灵活性。

方法

MrFlow 采用分阶段低→高分辨率流水线,将生成任务解耦为结构构建与细节细化两个阶段,所有模块均为预训练、无需额外训练。

主要流程

  1. 低分辨率结构生成
    首先在降低的分辨率(如 1/4)下使用原始流匹配模型采样。低分辨率带来两方面加速:Token 数量呈二次方减少(Transformer 计算量大幅降低),且仅需更少的去噪步数即可稳定生成全局结构。本阶段输出粗略但有语义一致性的低分辨率潜变量。

  2. 像素空间超分辨率
    将低分辨率潜变量解码到像素域,用一个轻量预训练GAN 模型(如 ESRGAN 类)进行上采样。这与现有方法(大多在潜空间上采样)形成关键区别——像素域超分能更准确地恢复高频细节,避免潜空间上采样常见的模糊或块状伪影。

  3. 低强度噪声注入与高频重采样
    对上采样后的图像施加低强度噪声,破坏超分可能引入的过度平滑或 GAN 伪影。噪声仅作用在高频细节层,使得后续去噪时模型能重采样高频成分而不改变已生成的整体结构。这一步是连接超分与细节精修的关键桥梁。

  4. 高分辨率细节精修
    最后,以原分辨率用较少步数(甚至一步)运行流匹配模型,专注于修复噪声注入后的画质损失并补充精细纹理。由于主结构已固定,该阶段可在极短步数内完成,实现端到端约 10× 加速(可与蒸馏结合达 25×)。

与同类方法的差异

不同于在潜空间上采样并选择性修改区域的策略(易产生模糊/伪影),MrFlow 在像素空间引入 GAN 超分与噪声重采样,从而无训练地实现了结构-细节解耦,既保持画面清晰度又显著加速。

实验

实验设计

MrFlow 在 FLUX.1-devQwen-Image 两个基于 flow-matching 的预训练模型上验证,无需任何训练或微调。流程分四步:

  1. 低分辨率结构生成:以目标分辨率的 1/4(如 256×256 替代 1024×1024)快速采样,生成主体布局与语义结构。
  2. 像素空间超分:用轻量 预训练 GAN(如 ESRGAN)将低分辨率 latent 上采样至目标分辨率,避免 latent 空间的模糊 / 伪影。
  3. 弱噪声注入:对上采样结果添加低强度噪声,为高频细节的“再采样”创造起点。
  4. 高分辨率细节精修:在高分辨率下运行少量步骤(甚至单步),补全纹理与细节。

关键发现

  • 显著加速比:低分辨率采样因二次 token 缩减(即注意力图的 token 数降至 1/16)与更少采样步数,端到端加速达 10×,若结合预训练的时间步蒸馏,可进一步推至 25×
  • 质量保持:生成质量指标 OneIG(度量图像-文本对齐及真实性)与未加速模型相比,差距控制在 1% 以内,大幅优于其他 training-free 加速策略,解决了以往多分辨率方法因 latent 空间上采样导致的模糊和伪影问题。
  • 结构-细节解耦:低分辨率阶段锁定全局结构,高分辨率阶段仅补足高频细节,避免了全分辨率生成中结构重建的计算冗余。

与基线对比深度解读

现有 training-free 加速方案(如时间步蒸馏、特征缓存、多分辨率 latent 采样)通常以牺牲质量换取速度,或需动态识别(runtime identification)引入额外开销。MrFlow 通过将超分移至 像素空间 并引入 噪声注入后重采样,规避了 latent 空间上采样的固有缺陷,同时完全静态执行,无需运行时决策,因此加速效果稳定且不损失结构保真度。相比基于多分辨率 latent 采样的方法(>5× 加速但模糊 / 伪影明显),MrFlow 在相近甚至更高加速比下保持了原模型的视觉质量。另外,它与时间步蒸馏正交,简单串联即可叠加收益,为工程部署提供了一种即插即用的加速方案:无需修改模型权重,无自定义内核需求,硬件无关,适合快速集成。

行业影响

落地场景

  • 内容平台与社交媒体:快速生成图文、广告素材,实现实时预览和多变体创作,支撑 UGC 生态下的即时内容生产。
  • 电商与产品可视化:商品图片背景替换、风格化与场景合成,提升运营效率。
  • 游戏与影视概念设计:快速原型生成,缩短创意迭代周期,降低美术预研成本。
  • 设计工具与 AIGC SaaS:作为底层加速插件,提供低延迟用户交互体验,赋能在线协作设计。

商业价值

  • 降本:通过训练无关的多分辨率流水线 (token 量二次减少) 大幅降低单次推理计算量,节省 GPU 时租与云服务成本。
  • 增收:更高吞吐量支撑更大规模的 AIGC 服务,有助于平台扩大用户基数与内容产出,从而增加订阅或按量付费收入。
  • 体验提升:端到端 10–25 倍加速使文生图达到准实时级别,支持交互式应用,降低等待焦虑,提高转化与留存。

与现有产品/工作流的接口

  • 无需训练,可直接应用于主流 Flow Matching 模型 (FLUX、Stable Diffusion 3 等),作为预置加速选项集成到推理引擎 (如 diffusers、ComfyUI)。
  • 可与已有步骤蒸馏策略 (如 LCM、SDXL-Turbo) 正交结合,实现乘性提速,不改动模型权重或 pipeline。
  • 低分辨率生成 + 像素空间超分 + 噪声注入的流程可封装为独立模块,通过 API 或插件形式嵌入现有 AIGC 平台,兼容标准部署框架。

具体落地用例

  1. 电商商品图生成:商家上传白底产品图,要求生成不同场景 (客厅、户外)。MrFlow 将单张生成时间从约 2 秒降至 0.2 秒,支持批量并行处理数千 SKU,大幅缩短上新周期,同时保持高品质细节。
  2. 在线设计协作工具:类似 Canva 或 Figma 的设计平台集成文生图能力,用户输入提示词后几乎即时获得结果,便于快速尝试不同风格,提升创意开发效率,促进付费订阅。

局限

  • - 超分模型依赖与通用性:MrFlow 使用轻量预训练 GAN 模型进行像素空间超分辨率,但该超分模型可能并非针对所有底模联合优化,因此在更换底模或面对极端域偏移时,超分结果可能引入 GAN 特有的伪影(如振铃或纹理失真)。同时,该超分模型虽然轻量,但其推理时间仍增加流水线开销,且需要额外内存。
  • - 结构-细节解耦的假设:方法假设低分辨率阶段能生成正确的主体结构,高分辨率阶段仅负责细节细化。但若低分辨率阶段因分辨率过低而丢失关键布局或对象完整性,后续噪声注入和细化可能无法恢复这些缺失,导致最终结果布局错误。
  • - 实验覆盖范围:论文仅在 FLUX.1-dev 和 Qwen-Image 两个基于流的模型上验证,未对比其他扩散模型(如 SD3)或更早版本;也未讨论超分模型在不同分辨率缩放因子下的敏感性,或对提示词长度、构图复杂度的鲁棒性。
论文Xingyu Zheng2026-07-02原文

相关内容