论文

展示信号,隐藏噪声:面向像素空间扩散的 Spectral Forcing

展示信号,隐藏噪声:面向像素空间扩散的 Spectral Forcing

像素空间扩散模型在全带宽噪声图像上进行训练,但去噪器可用的信号存在强烈的频率依赖。在整流流扩散和自然图像幂律谱下,每个时刻 t 的每频带数据-噪声等高线 k^{}(t) = (1-t)^{-2/α} 将信号主导的低频区域与噪声主导的高频区域分开。这种隐式的粗细结构不仅具有描述性,更引发了容量分配问题:标准像素空间去噪器必须内部发现移动的带宽边界,并可能在最优预测退化为确定性基线(而非数据分布建模)的频率-时间区域浪费计算资源。 为使该边界显式化,本文提出 Spectral Forcing——一个无参数、时间条件的 2D-DCT 低通算子,应用于补丁嵌入器之前的噪声输入。其截止频率随扩散时间单调增加,在数据端点变为恒等映射。通过受控合成实验,确定了该算子有益的场景:粗粒度补丁分词化,且数据的高频内容主要为噪声而非关键信号。 在 ImageNet-256 与 JiT-700M/32 上,Spectral Forcing 在不同训练周期持续提升 FID 和 Inception Score,展示了稳定的增益;在更细粒度分词化下仍具竞争力。进一步将该算子原封不动插入统一文生图模型 SenseNova-U1,提升了 DPG-Bench 和 GenEval 指标,表明输入侧谱先验可迁移至类条件生成之外。 这些结果通过展示信号、隐藏噪声,为构建容量高效的像素空间扩散模型指明了路径。

论文精读

TL;DR 在像素空间扩散模型中,用时间条件的2D-DCT低通滤波显式指定每步应保留的频率成分,避免模型浪费容量在纯噪声上,从而稳定提升ImageNet生成质量和训练效率。

问题

问题背景

像素空间扩散模型已成为图像生成的核心范式,其训练过程将图像与高斯噪声混合后,要求降噪器从全频带噪声中恢复数据。然而,自然图像的能量集中于低频,高频多为噪声,这一频率依赖特性在标准训练中未被显式建模。

现有方法局限

现有扩散模型将降噪任务均匀施加于所有频率,降噪器必须隐式学习移动的频带边界,以区分信号主导的低频和噪声主导的高频。这带来两个具体问题:

  • 容量浪费:在噪声占优的高频区域,最优预测趋近确定性基线(如直接输出噪声),而非数据分布建模,网络却仍需分配大量参数去拟合这些简单映射,挤占了建模信号的关键容量。
  • 学习负担:网络需在内部推断隐式带宽边界 k*(t) = (1-t)^{-2/α},这一额外任务增加了优化难度,尤其在有限训练资源下,可能导致收敛变慢或生成质量受损。

为什么难/重要

频率依赖性源自图像本身的幂律谱分布,并非训练技巧可简单回避。显式分离信号与噪声本质上是容量分配问题:如何在给定模型规模下,让计算资源精准聚焦于信号建模。该问题在大规模生成模型(如 JiT-700M)上尤为突出,因为参数冗余虽多,但若不能有效引导,仍会产生次优解。业界对高效训练与采样高度关注,在相同算力下提升 FID、Inception Score 等核心指标,可直接转化为产品竞争力。此外,该思路若泛化至文本到图像任务,能提升统一模型的指令遵循能力,具有跨任务迁移价值。

行业类比

这类似高效视频编码中的率失真优化:编码器对不同频率系数分配差异化的量化步长,舍弃人眼不敏感的高频噪声,将比特集中用于关键低频信息。

核心洞察

  • **显式频率分离解决扩散模型容量分配痛点**:像素空间扩散模型的去噪网络被迫隐式学习频率边界,将计算能力浪费在高频噪声区域。Spectral Forcing 提出无参数、时间条件的 2D-DCT 低通滤波,在 patch embedder 前强制截止高频,使模型专注信号丰富区域。与注入频域先验或潜空间建模不同,该方法不改架构、零额外参数,且截止频率与自然图像功率谱特性对齐,即插即用,显著提升 FID 和 IS。
  • **粗粒度 patch tokenization 场景下收益最大,揭示计算分配新原则**:当 patch 较大(如 32×32),模型自身难以分辨频率边界,Spectral Forcing 显式低频保护效果明显;在细粒度 patch 下,模型容量足够处理全频带,增益减弱但仍具竞争力。这为高分辨率生成或计算受限场景提供指导:粗粒化 token 配合 Spectral Forcing 可高效分配计算,避免容量浪费,是一种面向实际部署的优化策略。

方法

核心思路与输入

像素空间扩散模型在训练时,直接对含噪图像进行全带宽处理。然而,研究发现,在 Rectified Flow 框架下,根据自然图像的功率谱衰减指数 α,存在一个时变的分界线 k*(t) = (1-t)^{-2/α}:低频区域信号占优,高频区域噪声主导。这一隐式的粗到细结构导致模型必须内部分配容量来“学习”该边界,而部分计算被浪费在噪声主导的频段上。Spectral Forcing 的输入为一步加噪图像及其扩散时间步 t,目标是将这一边界显式化。

关键模块:无参数的 2D-DCT 低通算子

Spectral Forcing 核心是一个无参数、时间条件的 2D-DCT 低通滤波器,置于 patch embedder(即图像分块嵌入层)之前。

  • 频率截断:对输入的含噪图像进行 2D-DCT 变换,在频域中根据 t 计算截止频率,保留低频分量,直接截断高于截止的高频。
  • 时变调度:截止频率随 t 单调递增。在扩散早期(t 接近 0,噪声大),仅保留极低频;随着 t 增大(去噪过程后期),逐步放宽高频,最终在 t=1 时等于恒等映射,完全保留原始输入。该调度由功率谱的 α 指数和闭式解理论推导得出,无需额外超参数调优(但论文固定了 c_min 等参数)。
  • 计算开销:仅在输入端做一次 DCT 和逆 DCT,额外 GPU 时间极低(≈1%)。

输出与工程效果

滤波后的图像被送入标准的 denoising backbone(如 JiT-700M/32)。模型只需根据当前 t 关注信号有效的低频带,避免了在高频噪声区域强行建模。

  • ImageNet-256 上,使用粗粒度 patch tokenization(/32)时,FIDInception Score 一致提升,且训练全程保持增益。
  • 该算子可直接迁移至 SenseNova-U1 文本到图像模型,改进 DPG-BenchGenEval,显示输入的频谱先验具有跨任务通用性。

与同类方法的差异

传统像素空间扩散模型需隐式发现并适应随时间移动的信号/噪声边界,这本质上是一个容量分配问题。Spectral Forcing 通过零参数的时变 DCT 滤波,在输入端显式给出该先验,不改变模型架构或损失函数,仅通过“给去噪器展示信号、隐藏噪声”来引导容量更高效地利用,是一种轻量的训练加速与质量提升策略。

实验

实验设计

主体实验基于 ImageNet-256 类条件生成, 主干网络为 JiT-700M/32 像素空间扩散模型。在不同训练 epoch 下评估 FIDInception Score, 同时与不使用 Spectral Forcing 的基线对比。此外, 还考察了 粗/细 patch tokenization 两种配置下方法的鲁棒性。为验证跨任务迁移能力, 将相同 参数无关 的 Spectral Forcing 算子嵌入统一文本到图像模型 SenseNova-U1, 并在 DPG-BenchGenEval 两个权威文本到图像 benchmark 上评估。受控合成实验进一步定位了方法的生效条件: 粗粒度 patch 划分与高频区域以噪声为主的数据分布。本次实验未公布具体数值, 但论文指出指标的一致改善。

关键发现

  1. ImageNet-256 上的持续增益: 在 JiT-700M/32 模型上, Spectral Forcing 在多个训练 epoch 下均稳定提升 FID 和 IS, 证明其不仅加速收敛, 更能提高最终模型质量。
  2. tokenization 粒度鲁棒性: 即便采用更精细的 patch 划分, 算子仍保持竞争力, 说明频谱先验不会因输入粒度提升而失效。
  3. 跨任务迁移成功: 在 SenseNova-U1 文本到图像模型中, 未经任何改动直接插入算子, DPG-Bench 与 GenEval 得分均有提升, 表明该输入侧频谱约束可超越类条件生成场景, 泛化至更复杂的多模态任务。

与基线对比的深度解读

基线为标准像素空间扩散模型, 其 denoiser 需隐式学习频率边界, 浪费容量在处理噪声主导的高频区域。Spectral Forcing 通过显式的 2D-DCT 低通滤波 随扩散时间动态扩展截止频率, 让模型专注于有用信号。对比结果反映: 算子将学习负担从 “发现” 转移为 “利用”, 实现容量再分配。尤其当数据的高频成分主要为噪声而非纹理信号时, 该策略收益最大。这也解释了为何在粗 tokenization 下表现更突出——此时模型本身就易丢失高频细节, 频谱强置正好防止无意义的噪声建模, 从而提升保真度与多样性。

行业影响

落地场景

像素空间扩散模型在文本到图像生成、图像超分、图像编辑等应用中广泛应用,但面临着训练效率低、高频噪声干扰等问题。Spectral Forcing 通过显式的频域低通滤波,让模型仅关注当前时间步有意义的信号,直接适用于:

  • 电商平台的产品图自动生成:快速生成大量不同背景/风格的商品展示图,减少实拍成本。
  • 内容创作与广告行业的创意素材生成:在保持品牌风格的同时,高效生成高分辨率视觉资产。
  • 游戏与影视的资产原型设计:加速概念图、贴图等资产的迭代生产。

商业价值

该方法作为无参数、即插即用的前处理算子,能显著改善训练和推理效率:

  • 降本:在相同计算预算下,模型可更快收敛或获得更高生成质量(FID、Inception Score 提升),直接降低训练所需的 GPU 时费用;推理时也能减少对高频区域的无效计算。
  • 体验提升:对于需要批量生成图片的场景(如电商上新),更低的延迟和更稳定的输出质量可提升用户满意度,间接促进转化率。
  • 模型小型化潜力:在粗粒度 patch tokenization 下效果增益更大,有助于设计轻量级模型,降低端侧部署门槛。

与现有产品/工作流的接口

Spectral Forcing 是一个模块化的输入侧预处理算子,可以无缝集成到现有像素扩散模型训练流程中:

  • 在扩散模型的 patch embedder 之前插入 2D-DCT 低通滤波,无需修改 backbone 网络,对 DiT、U-Net 等架构均兼容。
  • 可直接作为 数据增强或预处理层 添加到训练脚本中,超参数如 c_min 可固定或自动调节,工程侵入性低。
  • 对于已上线的模型,可用其微调(如已在 SenseNova-U1 文本生成图像模型上验证),无需推倒重来。

具体落地用例

  1. 电商产品图生成平台:商家上传单张白底商品图,系统基于文本提示批量生成场景化展示图。Spectral Forcing 能在相同训练时长下产出更清晰的纹理和细节,减少高频伪影,使生成的图片更自然,降低人工修图率。
  2. 在线设计工具的 AI 生图模块:面向全球设计师的工具可集成该方法,在后台模型更新时加入 Spectral Forcing,提升生成速度与多样性,同时保持与其他扩散 pipeline 的兼容性,使模型迭代更敏捷。

局限

  • **计算开销与超参数固定**: 尽管 `Spectral Forcing` 算子本身无参数且采用快速 DCT,但每次训练 / 推理步骤仍需额外的频域变换,在极大规模训练或实时应用中可能成为瓶颈。论文在 ImageNet 所有实验中固定了低通截止参数 `c_min` 和调度形状,未针对不同模型规模或数据特性进行调优,实际部署时可能需要额外超参数搜索,限制了即插即用的便利性。
  • **适用范围受限**: 方法严格依赖于自然图像的 **幂律频谱假设** 和 **rectified-flow 扩散框架**。当图像域偏离该统计特性(如医学、科学或高纹理密度图像)或使用其他扩散范式(如 DDPM、EDM)时,预定义的滤波边界可能不再适用,甚至滤除有用高频成分。论文指出在高频信息富含信号或使用细粒度 patch tokenization 时收益衰减,但未给出自适应调整策略,通用性有限。
  • **实验对比与覆盖面不足**: 仅在 **ImageNet-256** 上使用单一架构(JiT-700M/32)验证类条件生成,并在 **SenseNova-U1** 上测试文生图,缺乏与同类频率域方法(如 FreeU、WaveDiff)的直接横向对比。同时,不同模型大小、更高分辨率下的增益是否持续尚不明确,对实际工程选型提供的证据不够充分。
论文Weichen Fan2026-06-16原文

相关内容