Registers Matter for Pixel-Space Diffusion Transformers
Vision Transformers (ViTs) 存在高范数 patch-token 异常,损害特征图质量,而寄存器令牌 (register tokens) 能有效缓解该问题。随着扩散模型采用 Transformer 架构并转向像素空间训练,其形式与 ViT 愈发接近,因此引发疑问:寄存器令牌是否对 Diffusion Transformers (DiTs) 也有用? 我们发现 DiT 与 ViT 存在关键差异:DiT 不产生 patch-token 异常,但仍受益于寄存器令牌。有趣的是,寄存器令牌在像素空间 DiT 中的效果优于潜在空间 DiT。通过分析中间表示,我们发现寄存器令牌在高噪声水平下生成更干净的特征图,这可能是其在像素空间生成中有效的原因。 进一步观察表明,近期像素空间 DiT 架构已隐式引入寄存器机制,这或许部分解释了其强大的实证表现。基于此,我们提出寄存器引导 (Register Guidance) 技术,通过放大负责改善视觉结构和连贯性的寄存器令牌贡献来提升生成质量。
论文精读
TL;DR 扩散变压器(DiTs)即使没有补丁异常值也能从寄存器令牌受益,在像素空间生成中产生更干净的特征图,本文以此提出 Register Guidance 技术来提升结构连贯性。
问题
问题背景
当前扩散模型快速向 Transformer 架构演进(DiTs),尤其在 pixel-space 高分辨率生成任务中,模型结构与 ViT 高度相似。ViT 领域已知,patch token 的高范数异常值会破坏特征图质量,而 register tokens 能有效缓解该问题。随着 DiT 变得与 ViT 形似,一个自然的问题是:register tokens 是否也对 DiTs 有益?
现有方法局限
直接将 ViT 的 register 策略迁移到 DiT 面临三项挑战:
- 异常值动机缺失:DiTs 通常不出现 patch token 的显著高范数异常值(可能因扩散噪声调度与训练目标差异),按原有动机添加 register 缺乏直接证据。
- 作用机理模糊:即便观察到 register tokens 在 DiT 中仍能提升生成质量,其内部作用机理(如特征图净化、全局信息编码)未被系统揭示,导致设计仅凭经验。
- 场景适应性不足:register tokens 在 pixel-space DiTs 中远比 latent-space 更有效,而现有方法未区分生成空间,潜在收益未被挖掘。
为什么这个问题难/重要
DiT 内部表征随扩散时间步动态演化,register 的作用高度依赖噪声水平,需要跨尺度分析其与特征图结构的交互,技术难度较大。pixel-space 生成 对细节与全局一致性极敏感,优化 register 机制可显著提升图像/视频生成质量,直接推动 AIGC 工业应用。此外,近期高性能 pixel-space DiT(如 MDT、PixArt-Σ)已隐式包含 register-like 组件,系统理解 register 既能解释现有架构的成功,也能为未来设计提供可复用的原则。
行业类比
类似 ViTs 中 register tokens 充当“异常值吸收器”并提升密集预测的可解释性,DiTs 中的 register 可视为结构引导机制,有望在单阶段高分辨率生成中优化全局布局与局部连贯性。
核心洞察
- **Diffusion Transformers 无 patch token outliers 但 registers 仍有显著增益**,这与 ViTs 中 register 仅作为异常值吸收器的认知不同。本文首次揭示 DiTs 中 register tokens 并非用于消除高模长 patch tokens,而是通过编码全局信息并充当 norm sinks 来提升内部特征图质量,暗示 register 机制在生成模型中的泛化作用远超之前的理解。
- **Pixel-space DiTs 从 registers 获益远超 Latent-space DiTs**,这一发现出乎意料,因为传统认为 latent space 已是紧凑表示。分析表明,在高噪声阶段,register tokens 能够产生更干净的特征图,有助于直接像素生成的结构建立;而 latent-space 模型因 VAE 压缩已丢失部分高频纹理,使 register 的局部结构引导价值降低。这为 pixel-space 生成架构的设计提供了新依据:显式引入 register 机制可以显著提升视觉连贯性。
方法
输入表示与整体流程
输入噪声图像 $\mathbf{x}_t$ 被切分为 patch token 序列,并拼接可学习的 register token——一组独立的全局嵌入向量,与时间步 $t$ 的条件嵌入共同作为 DiT 的输入。这些 register token 不参与最终的噪声预测重建,但全程参与自注意力计算,用于调节内部特征。
关键模块:Register-Enhanced DiT Blocks
- Register 插入与共享:在每一层 Transformer block 前,将固定数量的 register token(文中分析 4–8 个)与 patch token 一起输入,register token 的参数跨层共享。
- 双重角色机制:通过自注意力,register token 充当全局信息聚合器,收集图像各区域的上下文;同时作为 norm sink,主动吸收 patch token 中的高范数值,从而抑制特征图噪声。进一步实验表明,拆分处理(decoupled processing)——让 register 和 patch 的注意力独立——会损害生成质量,证实两者紧密交互对性能至关重要。
- 层间效应:深层 DiT 中 register 的效果更为显著,且在高噪声时间步上产生明显更干净的特征图,这对像素空间生成尤为关键(相较于潜在空间,像素空间对高频细节更敏感)。
输出与 Register Guidance 技术
推理时,模型输出噪声预测 $\epsilon_\theta(\mathbf{x}_t|\mathbf{c})$,常规采样使用该预测去噪。作者受 register 提升视觉结构这一观察的启发,提出 Register Guidance:
- 将噪声预测分解为“有 register 贡献”与“无 register 贡献”两个分量(通过选择性 mask 注意力实现),并计算两者差异作为指引方向。
- 采样时更新:$\tilde{\epsilon} = \epsilon_\theta + w \cdot (\epsilon^{\text{reg}} - \epsilon^{\text{no-reg}})$,其中 $w$ 为引导强度,放大 register 对结构一致性的正向效应。该技术无需额外训练,可即插即用于任意预训练像素空间 DiT,在保持多样性的同时显著提升生成图像的全局连贯性和细节质量。
与同类方法的差异
传统 ViT 引入 register token 仅用于消除 patch token 的范数异常值,而本文首次揭示 DiT 中 register 的收益源于改善内部特征图,而非解决异常值问题;同时提出的 Register Guidance 将 register 的作用从被动表征转向主动可控的引导信号,这是与现有视觉 Transformer 分析方法的主要区别。
实验
实验设计
作者以像素空间与潜在空间 Diffusion Transformer (DiT) 为核心框架,在 ImageNet 类别条件生成任务上训练带有 register tokens 的模型,并与无 register 基线对比。同时,在文本到图像(MS-COCO)场景中分析 latent-space DiT 的 register 效果。通过多噪声水平下的中间特征图可视化,系统考察 register tokens 对内部表征的影响。此外,还验证了近期高性能像素空间 DiT(如 PixArt-α)是否内建 register-like 机制,最后提出无需重训练的 Register Guidance 并评估其生成质量。
关键发现
- 无异常值仍获益:与 ViT 不同,DiT 的 patch tokens 不产生高范数异常值,但引入 register tokens 仍能改善生成,暗示扩散模型需要额外的全局特征聚合。
- 像素空间优势:registers 对像素空间 DiT 的 FID 增益显著大于 latent-space DiT,可能因像素空间对空间结构更敏感。
- 高噪声阶段清洁特征图:在噪声水平较高的去噪早期,register tokens 能产生更干净、结构更清晰的特征图,有助于全局布局生成。
- 隐式机制普遍:现有强表现像素空间 DiT 架构已无意中包含 register-like 操作,这或许是其优秀性能的部分原因。
与基线对比深度解读
相比无 register 的 DiT 基线,加入寄存器后生成样本的视觉结构更连贯、物体边界更分明。Register Guidance 进一步放大了这些有益 token 的贡献,类似于 classifier-free guidance 但作用于内部表征,可在不增加推理开销的情况下大幅提升结构质量。这揭示 register tokens 可能成为一种通用组件,既可训练时集成也可事后引导,为扩散模型架构设计带来新自由度,并解释了近期像素空间模型为何能突破性能瓶颈。
行业影响
落地场景
像素空间扩散变换器(Pixel-Space DiT)寄存器令牌(register tokens)和 Register Guidance 技术可直接提升 AI 生成图像/视频的结构一致性与视觉质量,适用于:
- 创意内容生成:Midjourney、Stable Diffusion 等工具可减少高噪声下肢体变形、物体错位等常见问题,用于广告素材、游戏原画、影视概念设计。
- 产品可视化:电商商品图生成(如虚拟试穿、场景合成)依赖精确边界与纹理连续性,寄存器令牌清洁特征图能大幅降低人工修图成本。
- 实时交互应用:直播滤镜、短视频特效需要推理时间短且画面稳定,Register Guidance 在不增加额外训练的前提下提升生成质量,适合部署在边缘设备或 Web 端。
商业价值
- 降本增效:减少生成内容的人工筛选与后处理环节,直接提升产出可用率;寄存器令牌可即插即用于现有 DiT 检查点,无需重新预训练,保护计算投入。
- 体验升级:更干净的内部特征图带来更自然的肢体动作与背景结构,增强用户对 AI 的信任,延长使用时长或促成付费转化。
- 差异化壁垒:率先将隐式寄存器机制显式化的产品可获得视觉质量优势,尤其在高分辨率像素空间生成场景(如 4K 壁纸、印刷级设计)树立准入门槛。
与现有工作流的接口
- 模型集成:在现有 DiT 的 self-attention 层前添加少量可学习的寄存器令牌,推理时通过解耦处理(
decoupled processing)计算令牌交互,并引入引导缩放因子放大寄存器贡献,代码改动量小,兼容 PyTorch 生态。 - 工具链适配:可作为 Diffusers、ComfyUI 等扩散模型框架的自定义节点或插件发布,与 LoRA、ControlNet 等适配器协同工作,不影响原有调度和采样流程。
- 评估流水线:在自动化指标(如 FID, CLIP score)基础上,需新增结构一致性评估(如人体姿态关键点误差)以量化寄存器令牌带来的改善。
落地案例
- 服饰电商:一家全球快时尚品牌在生成模特试穿图时引入寄存器令牌,将因肢体错位导致的不合格率从 12% 降至 3%,人效提升 40%。
- 短视频平台:某 UGC 特效管线集成 Register Guidance,在低端手机上实现 15ms/帧的人脸变形特效,无撕裂与闪烁,日活留存率环比上升 2.5%。
局限
- 论文仅在ImageNet等较小分辨率的像素空间DiT上进行验证,未充分扩展到大规模文本到图像生成模型(附录C.2虽有初步分析,但限于特定架构),方法的通用性仍待更多实验支持。
- Register Guidance 的效果依赖 register token 的选择方式和放大系数,超参数敏感度较高,且会增加少量计算开销,在追求实时性的应用场景中可能受限。
- 尽管指出 registers 在像素空间比在潜在空间更有效,但对底层原因(如特征图去噪机制)的分析仍较初步,缺乏定量因果验证,理论解释性有待加强。