论文

训练 Pixel-Space 文本到图像扩散模型的实证研究

训练 Pixel-Space 文本到图像扩散模型的实证研究

本文研究了生成建模中一个日益重要的主题:Pixel-Space 扩散模型。尽管已有大量研究探索该主题,但多数聚焦于小规模或类别条件设置,因此,能够媲美或超越成熟的 Latent-Space 模型 的像素空间模型训练实用方案仍未明朗。 通过全面的实证研究,我们首先观察到直接在大规模数据上预训练 Pixel-Space 模型比 Latent-Space 模型收敛慢得多。这一观察促使我们提出 latent-to-pixel 策略:先在潜在空间高效获取生成先验,再在后期训练阶段迁移到像素空间。我们系统考察了控制这一迁移的关键设计选择,包括:权重初始化、数据构成、预测目标、解码器架构和噪声调度。 我们确定了实用方案,使 Pixel-Space 模型能够匹配或超越 Latent-Space 对应模型,同时实现 3.18 到 4.75 倍 的端到端推理加速。希望我们的发现为未来像素空间生成研究提供经验洞见和实践指南。

论文精读

TL;DR 本文实证发现像素空间文生图扩散模型直接预训练收敛慢,提出潜在空间预训练再过渡到像素空间后训练的策略,系统优化关键设计后,性能匹配潜在空间模型且推理速度提升 3.18-4.75 倍。

问题

问题背景

文本到图像扩散模型已成为生成建模的核心方向,当前研究主要聚焦于潜在空间扩散模型(如 Stable Diffusion),通过自编码器压缩图像到低维潜在表示训练扩散过程,以平衡生成质量与计算开销。

现有方法局限

尽管像素空间扩散模型 可直接在 RGB 图像上建模,避免潜在空间的重建误差,但现有工作多局限于小规模数据集或类别条件生成,缺少大规模文本到图像训练的实用配方。直接进行大规模像素空间预训练时,高维像素空间的冗余性和噪声扰动导致训练收敛速度显著慢于潜在空间,这在论文中被实证为收敛速度差异的核心原因。另一方面,潜在空间模型受制于预训练自编码器的重建上限,细节可能被平滑或丢失,且推理时需要额外的解码器步骤,增加端到端延迟。

为什么这个问题难/重要

像素空间模型理论上能绕过重建瓶颈,实现端到端的高保真生成,但直接训练面临两大挑战:一是收敛慢,二是推理时在高分辨率像素上迭代去噪的计算成本极高。业界对推理速度敏感,因为实时生成或大规模部署要求低延迟;如果能训练出与潜在空间模型质量相当甚至更优的像素空间模型,同时提升端到端推理速度(论文中报告 3.18–4.75 倍加速),将显著降低实际应用成本。因此,需要系统研究从潜在空间到像素空间的过渡策略,包括权重初始化、数据组成、预测目标、解码器架构和噪声调度等,以找到高效训练配方。

行业类比

这类似于语音合成中直接从文本生成原始波形(如 WaveNet 早期做法)与使用声码器从声学特征生成波形的权衡:绕过中间表示可减少信息损失,但需解决高维序列的训练与推理效率问题。

核心洞察

  • 直接在大规模数据上训练像素空间扩散模型收敛速度显著慢于潜空间模型,而利用 latent-to-pixel 的迁移策略可有效复用生成先验并加速收敛。该工作通过实证对比明确了这一差距,并证明在 post-training 阶段切换到像素空间能在不牺牲质量的前提下获得与潜空间模型相当或更优的结果,这与以往小规模或类条件场景下的结论形成互补。
  • 迁移阶段的设计选择并非无关紧要:权重初始化、数据组成、预测目标、解码器架构和噪声调度五个维度需要协同调整。作者系统性消融这些因素后给出的实用配方,使最终像素空间模型在保持生成质量的同时实现 3.18–4.75 倍的端到端推理加速,为工程部署提供了清晰的优化路径,填补了从理论到实际系统的空白。

方法

本文提出一种 latent-to-pixel 训练策略,用于高效训练文本到图像像素空间扩散模型。核心流程如下:

输入与预训练

  • 输入为文本-图像配对数据,首先在 latent space 中进行大规模预训练,使用标准 latent diffusion model(如基于 VAE 的架构)学习生成先验。此阶段收敛速度远快于直接在像素空间预训练(实验观察到像素空间直接预训练收敛显著更慢)。

过渡到像素空间的关键模块

预训练完成后,模型从 latent space 过渡到 pixel space 进行 post-training。系统研究以下设计选择:

  • 权重初始化:将 latent 模型中的可复用权重(如 U-Net 骨干)迁移到像素空间模型,避免从随机初始化开始。
  • 数据组成:调整训练数据的分辨率、比例或增强策略,以适应像素空间的高分辨率输入。
  • 预测目标:从预测 latent 噪声改为直接预测像素空间中的目标(如噪声、v-prediction 或原始图像),需权衡生成质量与稳定性。
  • 解码器架构:重新设计或微调解码器,使其能将内部特征映射回 RGB 像素,可能复用预训练 VAE decoder 作为初始化。
  • 噪声调度:调整扩散过程的噪声 schedule,以匹配像素空间的数据分布特性。

输出与优化

最终模型直接在像素空间生成 RGB 图像,无需额外 VAE 解码。为提升效率,进一步采用 larger patch-size adaptation(增大 patch 尺寸减少计算量)和 step distillation(减少采样步数),实现端到端推理速度 3.18 至 4.75 倍加速,同时生成质量不弱于 latent-space counterpart。

与同类方法差异:不同于直接训练像素空间模型或完全依赖 latent space,本方法通过两阶段过渡与精细化的模块调整,在保持生成质量的同时显著降低推理延迟,为像素空间生成提供了实用训练范式。

实验

实验设计

论文首先验证了直接大规模像素空间预训练相比潜空间预训练收敛明显更慢,由此提出 latent-to-pixel 策略:先在潜空间高效获取生成先验,后训练阶段迁移到像素空间。随后系统消融了迁移中的五项关键设计:权重初始化、数据组成、预测目标、解码器架构、噪声调度。进一步采用更大 patch 适配与像素空间步数蒸馏优化推理效率。

关键发现

  • 直接像素空间预训练收敛速度显著慢于潜空间,难以作为大规模训练的首选路径。
  • 通过精心设计的潜到像素迁移,最终像素空间模型达到或超过潜空间基线,同时端到端推理速度提升 3.18–4.75 倍。
  • 五项设计选择对迁移质量影响显著,组合形成可复用的实用配方。

与基线对比解读

与主流潜空间扩散模型相比,该方法绕开了 VAE 重建上限,直接在像素空间生成,理论上可避免压缩损失。实验证明经过合适迁移,像素空间模型不再受限于训练效率,且在推理速度上具备明显优势。论文未给出与具体基线在 FID/CLIP 等指标上的数值对比,但明确表示“match or outperform”,暗示生成质量至少不劣于潜空间模型,同时推理更快。

行业影响

落地场景

像素空间扩散模型直接生成 RGB 图像,无需 VAE 解码环节,可显著降低延迟与内存占用。适用于对实时性要求高的生成场景:

  • 电商产品图批量生成:在商品上架流程中快速输出多角度、多背景的产品渲染图,缩短素材准备周期。
  • 内容平台个性化配图:根据用户输入实时生成文章、社交动态的配图,提升交互响应速度。
  • 设计工具与游戏素材:在低代码/无代码设计平台或游戏开发引擎中嵌入像素级生成,支持快速原型迭代。

商业价值

论文报告的 3.18–4.75 倍端到端推理加速 直接带来两方面收益:

  • 降本:相同硬件下吞吐量提升,降低单次生成成本;更小内存占用允许在同一 GPU 上并行处理更多请求,减少云端实例数量。
  • 体验提升:将生成延迟从秒级压缩至近实时,支撑交互式应用(如对话式图像编辑、实时风格迁移),提高用户留存与付费意愿。

与现有工作流的接口

当前主流文生图管线(如 Stable Diffusion 生态)基于 latent space 构建,包含 text encoder、UNet 与 VAE。像素空间模型可作为一个即插即用的生成模块替换 UNet 与 VAE 组合:

  • 权重复用:latent-to-pixel 策略允许从预训练 latent UNet 初始化像素 UNet,降低迁移训练成本,团队无需从零训练。
  • 管线适配:需调整噪声调度(pixel space 更敏感)与数据增强策略,但 text encoder 和采样器可保持不变。
  • 部署优化:论文中的 larger patch-size adaptation 与 step distillation 可作为部署前精调步骤,进一步压缩推理时间,适合边缘设备或 Serverless GPU 场景。

工程启示:对已有 latent diffusion 管线,团队可低成本切换到 pixel space 推理,在保持生成质量的同时获得显著延迟收益,尤其适合对延迟敏感的 SaaS 产品。

局限

  • - **训练流程复杂度**:所提出的 latent-to-pixel 策略需要先进行潜在空间预训练,再过渡到像素空间后训练,引入额外的阶段和超参数调优成本。过渡过程中的权重初始化、数据组成、预测目标等关键选择均需大量实验确定,工程负担较重。与端到端的像素空间训练或纯潜在空间训练相比,该策略的普适性可能受限,且论文未充分讨论从潜在空间到像素空间迁移时的知识损失或性能波动。
  • - **分辨率扩展与内存瓶颈**:尽管论文报告了 3.18–4.75 倍的推理加速,但像素空间模型直接处理 RGB 图像,其计算与内存需求随分辨率平方增长。论文提出的 larger patch-size adaptation 和 step distillation 虽能缓解,但可能仍不足以支撑超高分辨率(如 4K)或长视频生成。实验分辨率可能局限于中等规模,未验证更高分辨率下的可扩展性。
  • - **实验验证的泛化性有限**:研究主要基于特定模型架构(如 DiT 类 Transformer)和特定数据集开展,所得配方是否适用于 U-Net 架构、v-prediction 或 flow matching 等其他扩散变体有待验证。此外,论文未与 cascade 模型或直接高分辨率像素扩散方法进行系统对比,其作为通用指南的普适性仍需更多跨架构、跨数据集的实证支持。
论文Dengyang Jiang2026-08-17原文

相关内容