论文

彩色噪声扩散采样

彩色噪声扩散采样

问题:扩散模型在图像生成中存在频谱偏差——早期解决低频全局结构,后期解决高频细节。传统SDE求解器(如白噪声注入)未考虑此动态,导致能量预算低效使用。 方法:本文提出 Colored Noise Sampling (CNS),一种无训练的随机求解器。CNS 利用时步和频率依赖的调度,动态地将注入能量分配到结构上未解析的频率带,从而主动利用模型的固有频谱偏差,引导生成分布朝真实数据流形偏移。 实验:在 ImageNet-256 上,作为即插即用的推理采样器,CNS 在多架构(SiT-XL/2、JiT-B/16、JiT-H/16、FLUX)上显著提升 FID。例如,SiT-XL/2 的无引导 FID 从 8.26 降至 6.27,JiT-H/16 从 11.88 降至 8.31。在无分类器引导(Classifier-Free Guidance)下同样取得一致改进。

论文精读

TL;DR Colored Noise Sampling (CNS) 利用扩散模型生成过程的频谱偏差,以频率依赖的有色噪声动态分配能量,实现即插即用的推理时采样改进,大幅降低FID。

问题

扩散模型在图像生成中表现出频谱偏置(spectral bias),即采样早期低频全局结构快速成型,后期才逐步解析高频细节。然而,当前主流的 SDE 求解器在整个推理过程中均匀注入白噪声,完全忽略了这一动态特性。这种“一刀切”的方式导致能量注入效率低下——大量噪声被浪费在已收敛的低频分量上,而真正需要强噪声驱动以逃离局部模糊区域的高频分量却得不到足够的随机探索。其结果是生成图像在纹理、边缘等高频细节上容易模糊或失真,最终拉低整体质量指标(如 FID)。

这一问题之所以棘手,是因为需要在推理时对噪声进行频率感知的动态分配,但又不能引入额外训练或修改模型架构。理论上,这要求建立一个严谨的数学框架,将 SDE 推理重新诠释为一种有目标的、耦合频率的能量传输过程,并确保注入噪声的总能量守恒。工程上,则需设计一种即插即用的随机求解器,它能够自适应采样时间步和频率成分,将有限的计算预算精准投向尚未解构的频带,从而系统性地引导生成分布向真实数据流形逼近。随着文本到图像、高分辨率生成等应用对细节逼真度要求日益严苛,这一方向已成为业界提升扩散模型实用性的关键突破口。

这类似于自适应比特率分配在视频编码中的应用:不是给所有宏块分配相同码率,而是根据复杂度和感知重要性动态倾斜资源。同样,颜色噪声采样Colored Noise Sampling)可以看作对生成轨迹的各频率分量进行“能量分配优化”,让每个扩散步骤的随机性都物尽其用。

核心洞察

  • 将扩散模型推理过程重新定义为频率解耦的能量转移:传统SDE求解器在每一步均匀注入白噪声,忽视了模型在不同时间步对不同频率结构的偏好。CNS从能量预算的角度出发,根据模型内在的频谱偏差动态分配注入能量,优先强化尚未解析的高频细节,从而更高效地利用有限噪声能量,将生成分布引导至真实数据流形。这种视角与以往单纯从动力学或分数匹配角度优化采样的方法截然不同,为理解扩散模型的推理行为提供了新的理论工具。
  • 一种训练无关、即插即用的随机采样器替代方案:CNS无需重新训练或微调模型,仅通过替换推理时的噪声调度,即可在SiT、JiT、FLUX等多种架构上一致获得显著的FID提升,例如在ImageNet-256上无引导FID从8.26降至6.27(SiT-XL/2)。与依赖昂贵重训练或精心设计ODE路径的方法相比,CNS的通用性和低侵入性使其成为实际部署中提升样本质量的便捷手段,对工程落地具有直接价值。

方法

Colored Noise Sampling (CNS) 是一种训练无关的推理时随机采样器,用于扩散模型。其核心思路是将标准 SDE 中均匀注入的白噪声替换为时间步与频率相关的有色噪声,从而更高效地利用有限的能量预算,引导生成分布逼近真实数据流形。

输入与预处理

  • 输入为预训练的扩散模型(得分网络)以及从纯噪声开始的初始潜变量。
  • 无需额外训练或模型结构修改,即插即用地替换现有 SDE 求解器。

关键模块

  1. 频带分解:在每一个去噪时间步,通过二维离散傅里叶变换将当前潜变量转换到频域,并按各向同性径向频率划分为若干离散频带(如低频、中频、高频)。
  2. 能量分配调度:设计一个与时间步 $t$ 和频率 $f$ 相关的注入谱 $\beta(t,f)$ 满足全局方差守恒约束(总注入能量与标准白噪声 SDE 保持一致),将更多能量动态分配给模型当前尚未解析的频带:采样早期高频获得更多能量以探索细节,后期逐渐将能量转向中低频以稳固全局结构。
  3. 有色噪声生成:依据 $\beta(t,f)$ 将随机采样的白噪声在各频带重新加权,再通过逆傅里叶变换得到有色噪声,作为 SDE 的随机扰动项。
  4. 嵌入 SDE 求解器:该有色噪声直接替代原求解器(如 Euler-Maruyama、Heun 等方法)中的白噪声项,其余更新规则不变。

输出

  • 输出为最终生成的图像,相比标准采样器在分布匹配、多样性、视觉质量等维度均有可测量的提升,且无需 classifier-free guidance 即可降低 FID 等分布指标。

与本领域同类方法的差异:CNS 首次从频率解耦角度重构了 SDE 的能量转移过程,主动利用扩散模型的光谱偏置,以有色噪声替代白噪声,在保持总能量守恒的前提下实现频带定向能量注入,这是与已有高阶 ODE 求解器或重新设计噪声调度的根本不同。

实验

实验设计

作者在 ImageNet-256 类别条件生成任务上系统评估 CNS,覆盖 SiT-XL/2JiT-B/16JiT-H/16 等主流扩散架构,并扩展到文本到图像生成(使用 FLUX 等模型)。实验对比 CNS 与标准确定性 ODE 求解器及注入均匀白噪声的 SDE 求解器,在 无分类器引导(unguided)有分类器引导(CFG) 两种设置下报告 FID。消融研究验证了噪声能量分配策略与频谱动态的有效性。

关键发现

CNS 在所有架构上均带来显著 FID 下降:SiT-XL/2 的 unguided FID 从 8.26 降至 6.27,JiT-B/16 从 32.39 降至 26.69,JiT-H/16 从 11.88 降至 8.31。在 CFG 条件下,CNS 同样贡献一致的相对提升。这一表现源于 CNS 将有限的注入能量动态导向当前尚未解析的频率带,而非像传统求解器那样向所有频率均匀注入白噪声,从而更早引导生成轨迹匹配数据流形。

与基线的深度对比

标准 SDE 采样器默认白噪声注入假设所有频率分量需要同等水平的随机扰动,忽略了扩散模型天然的 频谱偏置(spectral bias)—— 低频全局结构先收敛,高频细节后出现。这导致能量预算浪费在已稳定的低频带上,同时高频细节不足。CNS 通过构造时间步与频率相关的 有色噪声方差调度,将能量集中注入高不确定性频带,相当于将 SDE 推理重新视为 目标驱动的、频率解耦的能量转移。这种零训练成本、即插即用的策略能适配任意预训练扩散模型,因为无需修改模型权重,仅改变采样过程的噪声注入方式,因此对工程部署极友好。与近期其他提升采样质量的方法(如调整噪声调度或改用高阶求解器)相比,CNS 的优势在于显式利用模型的频谱特性,从能量分配角度提高样本逼真度,而不增加额外计算开销。

行业影响

落地场景

CNS 是一种无需训练的即插即用采样器,可直接替换现有扩散模型推理流程中的 ODE/SDE 求解器,适用于所有依赖生成图像的场景:

  • 电商与广告:商品图生成、虚拟试穿、营销海报制作,提升细节真实感与结构连贯性。
  • 内容平台与影视:短视频特效、游戏资产生成、概念设计,减少后处理修图环节。
  • 医疗与仿真:医学影像合成、自动驾驶模拟数据增强,改善分布外生成质量。

商业价值

  • 降本:免训练升级,节省重训模型的计算与时间成本;减少人工筛选和修图,提高出图直通率。
  • 增收:更高质感的生成内容可提升广告点击率和电商转化率,直接拉动营收。
  • 体验提升:解决标准白噪声注入导致的细节断裂、全局结构变差问题,输出更符合人类审美的图像,尤其在无分类器引导(CFG)下仍能保持较高画质,降低推理延迟。

与现有工作流的接口

CNS 可集成到主流扩散模型推理框架(如 Diffusers)中,作为新的 Scheduler 类,只需接收模型预测的 score,并执行频率域动态噪声注入:

  • 即插即用:不改变模型权重、架构或训练流程,通过配置文件切换采样算法。
  • 最小码改动:在已有 ODE/SDE 求解器基础上添加频域算子(FFT/IFFT),可复用于 SiT、JiT、FLUX 等架构。
  • 性能开销:额外频域转换引入小量计算成本,但无需重复调用模型,总体延迟可控。

示例集成场景

  1. 电商商品图生成:基于 FLUX 的定制模型,使用 CNS 替换默认 Euler SDE 采样器,批量生成中显著降低纹理扭曲和边界伪影,提高模特“上身”效果的真实度。
  2. 短视频特效工具:基于 JiT 的文本到图像/视频模型,采用 CNS 作为默认采样器,在用户生成内容中提升随机种子下的质量稳定性,减少“废片”比例,提升创作效率。

局限

  • - **额外计算开销**:CNS 在每个采样步都需要进行频带分解和能量调度,引入傅里叶变换和径向频率投影操作,虽然论文声称总体开销可控,但对于追求极低延迟的实时应用仍可能成为瓶颈。 - **超参数敏感性**:方法依赖于预定义的频带划分、全局能量缩放系数和调度函数,这些参数可能对不同模型和任务敏感,需要额外调试才能达到最优效果。然而,论文通过消融实验证明了其鲁棒性,但迁移到新任务时仍需谨慎校准。 - **频谱偏差假设的普适性**:CNS 的有效性建立在扩散模型具有稳定频谱偏差的基础上,当使用特殊训练策略(如 latent diffusion、级联生成)或处理非图像模态时,该偏差可能减弱,导致性能提升有限甚至退化,目前仅主要在像素级图像生成和一类模型上验证。
论文Hadar Davidson2026-05-28原文

相关内容