论文

Persistence Forcing:在像素空间扩散中利用特征特化

Persistence Forcing:在像素空间扩散中利用特征特化

像素空间扩散 Transformer(DiT)直接在高维视觉数据上运作,但其隐藏表示在深度方向上通常经历统一的精化过程。然而自然图像本身具有不同层次的粒度组织:全局结构往往可以紧凑表示,而局部纹理与精细细节则需要更丰富的表示。 受此启发,本文在像素空间 DiT 中引入异构精化,为不同特征组分配不同的跨深度精化预算。由此浮现出有序的特征特化:persistent 特征主要编码全局视觉结构,而 active 特征则越来越特化于局部高频细节。 基于这一特化现象,作者提出 Persistence Forcing(PerF),显式利用 persistent–active 特征组织进行像素空间图像生成:让 persistent 特征持续地条件化被主动精化的特征,使稳定的全局信息引导精细视觉细节的持续精化。在生成采样阶段,这种交互还诱导出有意义的引导方向,促进连贯的全局结构,并自然地与 classifier-free guidance 互补。 在 ImageNet 256×256 上,PerF-L 取得 FID 1.91,以仅一半参数逼近 JiT-H 的 1.86;PerF-H 更进一步,在 ImageNet 256×256 与 512×512 上分别达到 FID 1.63 和 1.76。

论文精读

TL;DR 论文提出 Persistence Forcing (PerF),在像素级扩散 Transformer 中利用异构细化诱导特征专业化,让持久特征持续引导活跃特征细化细节,以一半参数取得接近 JiT-H 的 FID。

问题

像素空间扩散 Transformer(DiTs)在高分辨率图像生成中表现突出,但计算成本与特征表示效率成为核心挑战。

现有方法局限:主流 DiTs 采用 uniform refinement,即每个深度层对所有 token 施加相同的变换。自然图像具有多粒度结构:全局布局可用紧凑特征表示,局部纹理与高频细节需要更丰富表达。均匀细化导致两个问题:对全局信息过度计算,浪费算力;局部细节受限于统一预算,可能表达不足。现有非均匀计算方案(如提前退出、宽度调整)虽节省计算,但未诱导出明确的功能专业化,也未显式利用这种专业化进行条件生成,限制了性能提升。

为什么难/重要:自动诱导特征专业化需在训练中让不同特征组分化角色,同时保持生成质量,技术挑战较大。采样阶段还需从专业化中提取有意义的引导信号,并与 classifier-free guidance 协同。该方向直接影响生成模型在资源受限场景下的部署效率与可控性,业界持续关注高效且可解释的生成架构。

行业类比:类似视频编码中关键帧与残差帧的分工,将全局结构与局部细节解耦并分别优化,可显著提升系统效率与质量。

核心洞察

  • 异构细化预算可诱导像素空间 DiT 的特征专门化,自发分离全局结构与局部细节。传统 DiT 对所有隐藏特征在每层均匀计算,忽略了自然图像的多粒度结构;本文通过给不同通道组分配不同的细化频率,观察到稀疏细化通道编码全局低频信息,频繁细化通道编码局部高频信息。这种分工是训练中涌现的,而非手工强制,为模型设计提供了新的归纳偏置。工程上,该发现支持按特征重要性分配计算资源,例如降低持久特征的更新频率,在减少 FLOPs 的同时保持质量,类似 MoD 但作用于特征维度。
  • Persistence Forcing 将持久特征作为活跃特征的稳定条件,并在采样中产生与 CFG 互补的引导方向。与以往通过 attention 或外部条件注入不同,PerF 直接让低频全局特征持续引导高频细节细化,避免全局信息在深层被淹没。生成的 Persistence Guidance 无需额外分类器或教师模型,仅通过特征交互得到,可作为轻量级即插即用组件。在 ImageNet 上,PerF-L 以一半参数达到接近更大模型的 FID,表明该机制可增强生成一致性并降低对模型容量的依赖。

方法

输入与整体流程

像素空间 DiT 接收噪声图像或中间状态,经 patch embedding 与位置编码后得到 token 序列。

关键模块:异构细化与特征分工

  • 异构细化:将 token 的通道维度分为两组——persistent 与 active。通过在不同深度对两组采用不同细化预算(variable width),persistent 特征更新频率低、宽度可压缩,逐步编码全局结构;active 特征每层都经过完整 block,逐渐聚焦高频局部细节。
  • 持久化-激活条件注入(P-to-A):用低秩 bottleneck 将 persistent 特征投影为条件信号,注入 active 特征的注意力或归一化层,使全局信息持续引导局部细节生成。
  • 持久化引导(PG):在采样阶段,利用上述条件交互构造额外引导方向,与 CFG 自然叠加,增强全局一致性。

输出

最终输出像素空间去噪图像,可直接生成 256×256 或 512×512 分辨率。

与同类方法差异:现有像素空间 DiT 通常对全部特征均匀细化且仅依赖 CFG;PerF 显式分离全局与局部特征并建立条件交互,以约一半参数量达到与更大模型相当或更优的 FID。

实验

实验设计

论文在 ImageNet 256×256 与 ImageNet 512×512 上评估两个模型变体:PerF-L(较小参数)与 PerF-H(较大参数),核心指标为 FID。对比基线为 JiT-H(pixel-space DiT 的 strong baseline)。训练与推理细节未在摘要中披露,完整配置见 项目主页 或论文。

关键发现

  • PerF-L 仅用 JiT-H 一半参数 即达到 FID 1.91,接近 JiT-H 的 1.86。
  • PerF-H 进一步将 FID 降至 1.63(256×256)与 1.76(512×512),明显超越 JiT-H。
  • 由异构 refinement 诱导的特征专业化使得 persistent features 主导全局结构,active features 专注局部高频细节;Persistence Forcing 让前者持续条件后者,稳定全局信息引导细节生成。
  • Persistence Guidance(PG)与 classifier-free guidance(CFG)互补,可额外提升生成质量。

对比解读与工程启示

PerF-L 以一半参数量逼近 JiT-H,说明该方法在 计算效率 上优势显著,适合资源受限的生成任务。PerF-H 超越 JiT-H 表明异构 refinement 与 persistence 机制并非单纯压缩,而是带来生成质量的实质提升。工程上,可将全局/局部特征解耦设计引入现有 DiT 架构,在不显著增加参数的前提下改善高分辨率生成;同时 PG 作为 CFG 的补充,可低成本集成到采样流程。

行业影响

落地场景:pixel-space diffusion 在电商商品图生成、广告创意素材、游戏资产生成、自动驾驶数据增强等业务中应用广泛。以电商为例,批量生成不同背景与角度的商品图时,需保持产品外形和材质纹理一致;PerF 的 persistent 特征稳定全局形状,active 特征细化局部细节,可显著减少人工修图。自动驾驶数据增强类似,合成不同天气/光照下的街景时,要求道路布局与车辆细节同时真实。

商业价值:核心是降本与增效。PerF-L 仅用 JiT-H 一半参数达到 FID 1.91,推理显存与算力需求降低约 50%,可支撑更高并发或边缘设备部署。全局结构稳定降低废图率,提升内容产出吞吐。对批量生成或实时服务,综合单位成本下降明显。

接口与集成:PerF 可作为现有 DiT 架构的轻量增强模块,修改 feature refinement schedule 并插入 Persistent-to-Active Conditioning 即可,无需重构数据管线。与 classifier-free guidance 兼容,可叠加 persistence guidance 增强控制。开源实现(GitHub)便于复现。

局限

  • **泛化性验证有限**:论文仅在 ImageNet 类条件生成任务上验证,未覆盖更复杂的文本到图像生成、多域数据集或更高分辨率(如 1024×1024)。Pixel-space diffusion 本身计算成本较高,虽然 heterogeneous refinement 通过减少部分 token 的更新频率来节省计算,但引入 persistence forcing 模块和 persistent features 的持续 conditioning 可能带来额外开销,实际推理成本相较于 latent diffusion 方法仍可能处于劣势,限制了其在大规模部署中的竞争力。
  • **超参数敏感且缺乏调参指导**:PerF 引入了多个关键设计选择,如 refinement schedule、persistent/active 特征比例、P-to-A bottleneck rank 以及 persistence guidance 的权重系数。论文的 ablation 实验表明这些组件对性能有显著影响,但未提供在不同模型规模或数据集下的稳定性分析,也未给出自动选择这些超参数的策略,实际应用时可能需要大量的经验性调参,增加了落地难度。
  • **与同类方法的对比范围较窄**:论文主要与 uniform refinement 的 DiT 基线(如 JiT)比较,未充分纳入最近的非均匀计算或特征选择方法(如 Mixture-of-Depths、Token Merging、DynamicViT 等)进行对比。此外,方法在 pixel-space 框架下验证,未探索在 latent diffusion 中的适用性,因此其相对优势和普适性尚未得到充分证明。
论文Chong Wang2026-09-28原文

相关内容