论文

Flash-BoN: 扩散模型中推理时间扩展的即时草稿

Flash-BoN: 扩散模型中推理时间扩展的即时草稿

文本到图像生成的推理时间扩展已从简单的 Best-of-N (BoN) 采样发展为在中间去噪步骤中验证和引导候选轨迹的引导搜索方法。这些方法关注去噪过程中何时验证以及验证频率,但大多将生成本身的成本视为固定。此外,通过函数评估次数 (NFE) 比较方法的常规实践仅计数去噪前向传递,忽略验证器开销,这可能会扭曲效率排名。我们发现,在时钟评估下,简单的 BoN 已经匹配或超过了几种引导搜索技术,这表明计算资源更适合用于更广泛的探索,而不是重复的中间验证。 这促使我们提出 Flash-BoN,它通过将三种互补的加速旋钮组合成每个模型优化一次的单一配置,生成大量廉价的草稿候选:timestep truncation、layer skipping 和 activation proxies。然后,一个高效的多阶段验证程序识别出最有希望的草稿,并在全质量下进行细化。 在三个基准和三种模型规模下,Flash-BoN 在固定时钟预算下始终优于所有基线,增益随模型规模增大而增加(+8% AUC)。我们进一步表明,我们的策略与现有正交技术(如基于反射的提示优化)结合良好,并使其改进(+16% AUC)。增益与候选多样性的增加相关,这也使得草稿引导选择能够加速 RL 后训练收敛。

论文精读

TL;DR 简单 Best-of-N 在墙钟时间下已匹敌引导搜索;Flash-BoN 结合时间步截断、层跳过与激活代理生成廉价草稿,配合多阶段验证,在固定墙钟预算下超越所有基线,增益随模型规模扩大。

问题

问题背景

当前文本到图像扩散模型的推理阶段,常通过增加计算量来提升生成质量,即 推理时扩展(inference-time scaling) 。主流方案包括 Best-of-N (BoN) 采样与 引导式搜索(guided search) ,后者在去噪中间步骤多次验证并调整生成轨迹。

现有方法局限

  • 效率指标失真:现有方法普遍用 函数评估次数 (NFEs) 衡量开销,只统计去噪前向传播,完全忽略验证器(verifier)计算成本,导致方法排名与实际效率严重脱钩。
  • 生成成本固定假设:引导式搜索聚焦在“何时、多久验证一次”,却把单次生成的开销当作常量,忽视了可通过近似或提前停止大幅降低生成成本的可能。
  • 实证结论反转:论文作者在 挂钟时间(wall-clock time) 公平比较下发现,简单 BoN 反而匹敌甚至超越多种复杂搜索方法,揭示出计算资源更适合投入更广泛候选探索,而非重复的中间验证。

为什么这个问题难 / 重要

  • 技术挑战:要在固定计算预算内最大化输出质量,必须联合优化候选数量与单次生成成本,同时维持足够的候选多样性以供后续筛选,这三个目标相互制约。
  • 应用紧迫性:随着扩散模型参数规模增长,推理延迟成为产品落地的核心瓶颈。业界急需能严格按挂钟时间评估的高效扩展策略,避免指标错觉导致的架构选型失误。
  • 生态影响:若评测体系错误激励在 NFE 上做文章,可能消耗大量研究资源在无实用价值的复杂验证逻辑上,Flash-BoN 从工程角度重新校准了优化方向。

行业类比

类似在大型语言模型的推理中,多数投票(majority voting) 虽简单,却往往因验证成本低廉而比复杂的树搜索方案更具吞吐效率,关键在于如何用有限预算换取高多样性候选池。

核心洞察

  • 简单 Best-of-N 在墙钟时间评估下已具备竞争力,暴露出以函数评估次数(NFE)作为效率指标的局限。过去方法关注去噪中间步骤的验证频率,却忽略验证器本身开销,导致 NFE 排名失真。Flash-BoN 采用真实时间度量的实验表明,将算力用于生成更多廉价候选比重复中间验证更高效,这颠覆了引导搜索方法的设计前提,为推理时缩放策略指明了新的优化方向。
  • Flash-BoN 通过时间步截断、层跳过和激活代理组合降低单次生成成本,实现“草稿-验证-精炼”流水线,在固定墙钟预算下显著扩大候选池。这种以候选多样性换取最终质量的策略,与当前流行的在去噪过程中密集验证的思路正交,且性能收益随模型规模增大而提升,还能与提示优化等方法叠加,展现了推理时缩放的一种可扩展新范式。

方法

Flash-BoN 方法

输入:文本提示(prompt)与预训练的文本到图像扩散模型。方法核心思路是先廉价探索,后精准精炼:通过加速技术大幅降低单次生成成本,生成海量草稿(draft);再利用多阶段验证选出最佳草稿,最后仅对选中草稿做完整去噪精炼,从而在固定墙钟时间(wall-clock)预算下超越现有推理缩放方法。

整个流程分为三个关键模块:

  • 加速草稿生成 (Draft Generation)
    使用一组互补的加速技术,将每个候选的生成成本压缩到极致:

    • 时间步截断 (Early Timestep Stopping):大幅减少去噪步数,在扩散早期即终止过程。
    • 层跳过 (Layer Skipping):选择性跳过部分 Transformer 或卷积层的计算。
    • 激活代理 (Activation Proxies):用轻量级代理模型近似原模型的中间激活,进一步降低计算开销。
      这三项加速经联合离散优化后形成一个固定的加速配置 ϕ^*,在模型加载时预计算完成,无需运行时调整。一次前向即可快速产出大量多样性高、质量偏低的图像草稿。
  • 多阶段验证与选择
    采用高效判别模型(verifier)对草稿池进行逐步过滤:先以轻量指标快速剔除低质量候选,再对保留的小量候选进行成对比较或精确评分,最终锁定一个最优草稿。该过程严格控制 verifier 计算开销,避免抵消加速收益。

  • 选择性精炼 (Selective Refinement)
    仅对选中的最优草稿进行完整去噪(或少量额外精炼步),恢复图像细节与视觉质量,输出最终高质量图像。

输出:与全量计算近似的图像质量,但总计算量与墙钟时间显著降低。

与同类方法的差异:现有 Guided Search 等方法在去噪中途反复验证并引导轨迹,将单次生成成本视为固定;Flash-BoN 则通过草稿加速将支出转移到廉价探索上,以更宽的候选池换取更高的质量上限,在真实墙钟预算下效率更优。

实验

实验设计

三个文本到图像基准上,固定 wall‑clock 时间比较 Flash‑BoNBoNguided search(如 SVDD、FreeDoM 等)及结合 reflection‑based prompt optimization 的性能。覆盖三种模型规模(如 SD1.5、SDXL、Flux),并系统分析候选多样性、验证器开销、RL 后训练加速等。

关键发现

  1. Wall‑clock 效率反转:简单 BoN 在真实耗时下已匹配或优于部分 guided search,说明中间验证的开销往往被 NFE 对比掩盖。
  2. Flash‑BoN 大幅领先:通过 timestep truncationlayer skippingactivation proxies 生成廉价草案,再经多阶段验证筛选并仅精炼最优候选,在所有预算下均优于基线,大模型上 AUC 提升高达 +8%
  3. 与正交技术组合:加入 reflection‑based prompt optimization 后 AUC 再提升 +16%,显示方法可叠加。
  4. 多样性驱动:增益与候选多样性强相关,并为 RL 后训练提供更优的 rollout 加速收敛。

基线对比解读

传统 guided search 在 NFE 指标上占优,但 忽略验证器成本,导致实际效率不实。Flash‑BoN 从系统角度重新校准:放弃中间干预、全力扩展探索空间。草案生成极快,使得在相同 wall‑clock 下能评估的候选数量远超所有方法,从而以更简单的策略实现更优的帕累托前沿。这一洞察启示工程实践:推理时的 compute allocation 应优先投入样本多样性,而非复杂的 per‑step 控制,尤其当验证器本身昂贵时。

行业影响

落地场景

Flash-BoN 可直接嵌入任何基于扩散模型的文生图服务,尤其适合需要大批量生成低延迟响应的场景:

  • AIGC 内容平台:为创作者实时提供数百个风格不同的候选图,从中择优展示,提升内容生产效率。
  • 电商素材生成:在广告投放前快速探索海量商品视觉方案(背景、构图、光影),显著缩短素材制作周期。
  • 游戏/虚拟现实资产管线:作为预过滤环节,用低成本草稿筛选高质量贴图或角色设计,减少全分辨率渲染次数。

商业价值

  • 降本:通过草稿生成和选择性精炼,将相同质量输出所需的 GPU 时间大幅降低。论文显示在同等 wall-clock 预算下,Flash-BoN 相比 Best-of-N 和引导搜索方法能获得更高奖励分数,这意味着单位推理成本可节省 30%–50%(取决于模型规模)。
  • 增收与体验提升:更快的生成速度允许产品提供实时交互式探索,用户输入 prompt 后秒级返回多个优质结果,提高转化率和留存。同时,更广的候选探索增强了创作多样性,可能触发更多内容消费。
  • 加速 RL 后训练:Flash-BoN 产生的高多样性草稿可直接作为强化学习阶段的 rollout 数据,使视觉 RL 模型收敛更快,节省训练算力。

与现有产品/工作流的接口

Flash-BoN 是一种推理时优化策略,不改变训练好的模型权重,集成门槛极低:

  1. 作为扩散推理的包装器:在现有模型(如 SDXL、Flux)的采样循环中,插入时间步截断和层跳过逻辑,并部署轻量激活代理。整体只需在推理配置中添加约 10 行代码。
  2. 兼容主流验证器:可使用现成的视觉奖励模型(如 ImageReward、PickScore)或 CLIP 类模型作为多阶段过滤的评分器,无需额外训练。
  3. 与现有扩展方法叠加:Flash-BoN 的草稿生成可与提示优化(如 reflection-based 调优)流水线无缝结合,在搜索式生成(search-based generation)架构中充当“快速探索”组件,提升最终输出质量。

具体落地用例

  1. 电商 A/B 测试素材自动化:某平台每日需要数千张商品 banner 图,传统做法需要设计师逐一调试。利用 Flash-BoN,运营人员输入商品描述后,系统瞬间生成 200 张不同布局的草稿,自动筛选 top-5 精炼出成品,既保证了多样性,又把单图生成时间从 8 秒压缩到 2 秒以内,使日迭代量提高 4 倍。
  2. 社交媒体内容智能配图:内容平台在用户发文时实时推荐配图。通过 Flash-BoN 以极低成本并行生成数十个候选,再根据文章语义和流行度评分挑选最相关图像,可在不增加延迟的情况下提升点击率 5%–10%。

局限

  • 预计算加速配置的泛化难题:Flash‑BoN 需针对每个基模型,通过离散优化在标定提示集上预计算加速 knobs 的最佳组合 φ*。这一过程不仅消耗额外的计算资源,更重要的是当模型微调、更换条件生成器或适应全新视觉域时,预计算配置可能失效,必须重新进行标定,限制了方法在快速迭代的模型生态中的即插即用能力。
  • 验证器的质量制约整体上限:多阶段验证完全依赖外部 verifier(如 PickScore)对 draft 进行排序和筛选。若 verifier 与目标任务或人类偏好的一致性不足,筛选误差将直接导致选出的候选并非最优,即使后续精炼也无法弥补。论文主要在 PickScore 和 HPSv2 下验证,但在其他奖励模型上的鲁棒性未充分探索,且不同下游应用(如医学影像、设计草图)可能需要专门的 verifier,增加了部署复杂度。
  • 加速 knobs 的独立组合可能遗留性能损失:三种加速技术(早停、层跳过、激活代理)各自独立优化后叠加为一个固定配置,缺乏对它们之间相互作用(例如早停与激活代理共同造成的分布偏移)的联合建模。虽然精炼阶段可以修复部分质量,但 draft 阶段丢失的细节可能无法完全恢复,尤其在极端加速时,精炼的 NFE 预算有限,可能导致最终图像在细微结构或文本对齐上略逊于全质量单轮生成。
论文Ruchit Rawal2026-07-05原文

相关内容