论文

GenFirst: 稳定端到端潜在生成模型中的先生成后重构

GenFirst: 稳定端到端潜在生成模型中的先生成后重构

潜在生成模型通常采用两阶段流程:先训练变分自编码器进行重构,再在冻结的潜在空间上训练生成模型。由于重构优化的潜在表示未必利于生成,联合训练两种模型成为有吸引力的替代方案。然而,直接端到端训练仍具挑战,容易导致潜在崩溃并面临生成-重构冲突。 本文通过分析不同目标如何塑造潜在空间,识别出两个关键见解。第一,Kullback-Leibler 散度目标中的熵项对防止崩溃至关重要:重构与先验拟合倾向于收缩后验,而熵则保留非退化潜在不确定性。第二,重构与生成表现出非对称学习动态:重构快速且强监督,而生成较慢且更难优化。基于这些见解,我们实现了首次无潜在崩溃的直接端到端训练,并提出 GenFirst 这一简单的先生成后重构策略:生成目标先在弱重构压力下塑造潜在空间,随后逐步增强重构以恢复视觉细节。 我们使用具有精确似然的连续自回归先验和具有隐式似然的 SiT 先验验证 GenFirst。在 ImageNet-256 上,采用我们的端到端目标与 GenFirst,SiT 在 CFG 下达到 gFID 0.97,无 CFG 时达 1.45;而 MMDiT 在文本生成图像上达到 GenEval 0.90 分。除图像生成外,我们还将框架扩展到用于生成与表征学习的共享视觉潜在表示,以及连续统一文本-图像生成。这些结果证明了稳定端到端潜在学习在多种生成先验和模态上的普适性。

论文精读

TL;DR GenFirst 通过“生成先于重建”的端到端训练策略,利用熵保持潜空间不塌缩,在 ImageNet-256 上 gFID 达 0.97(CFG),并支持统一多模态生成。

问题

问题背景

潜在生成模型(latent generative models)通常采用两阶段流程:先训练变分自编码器(VAE)进行重建,然后在冻结的潜在空间上训练生成模型。该流程在图像生成、文本到图像等任务中广泛应用,但存在潜在空间并非为生成而优化的问题。

现有方法局限

  • 两阶段分离优化:第一阶段 VAE 仅优化重建损失,忽略后续生成任务的需求,导致潜在空间可能包含对生成不利的结构,例如过度收缩的后验分布或不够平滑的流形。
  • 直接端到端训练的挑战:联合训练 VAE 和生成模型理论上可以解决上述问题,但实践中极易出现 latent collapse(潜在空间塌缩),即后验分布退化为点估计,生成多样性丧失。此外,重建目标与生成目标之间存在冲突:重建偏好确定性、信息丰富的潜在变量,而生成偏好随机性、可采样的先验。
  • 不对称学习动态:重建任务通常收敛快且监督强,生成任务较慢且优化困难,导致联合训练中生成目标容易被忽略或压制。

为什么这个问题难/重要

该问题的核心在于如何在潜在空间中同时保留重建所需的细节信息和生成所需的先验匹配性。直接端到端训练若能稳定实现,可以简化训练流程、减少计算开销,并可能提升生成质量。但现有方法要么牺牲重建质量换取生成稳定性,要么依赖复杂的平衡技巧。业界对更简洁、更稳定的端到端方案有强烈需求,尤其在大规模多模态生成中,联合优化潜在空间可避免各模态独立编码带来的不一致性。

行业类比

类似于在实时视频生成系统中,需要同时优化视频压缩编码和生成模型——若压缩编码只考虑重建质量而忽略生成模型的输入分布,最终生成效果会明显下降,而联合微调虽更优但易导致编码器退化。

核心洞察

  • 端到端潜变量生成模型崩溃的根源在于 KL 散度中熵项的缺失效应:重建与先验拟合都会压缩后验方差,只有熵项能维持非退化的不确定性,避免潜变量塌缩到点估计。这一分析将防止 latent collapse 从经验正则化或阶段分离策略,转变为对目标函数内在平衡的显式利用,从而首次实现直接端到端训练而不引入额外约束。
  • 重建与生成存在不对称学习动态:重建任务收敛快且监督信号强,生成任务则优化缓慢且更易受潜空间结构影响。GenFirst 反直觉地先让生成目标在弱重建压力下塑造潜空间,再逐步增强重建强度恢复细节,这种生成在先的顺序与常见两阶段流程相反,有效化解了生成-重建冲突,使同一潜空间同时服务两类任务。

方法

核心思想

GenFirst 提出直接端到端训练潜变量生成模型,避免两阶段流程中「重建优化潜变量未必适合生成」的错配。此前端到端训练易发生潜变量坍缩,且存在生成与重建冲突。

关键机制:熵保持与非对称动态

分析指出,重建损失与先验拟合都会收缩后验,而 KL 散度 中的熵项是防止潜变量非退化不确定性的关键。另一点是学习动态不对称:重建监督强、收敛快,生成目标慢且难优化。

训练策略:Generation-Before-Reconstruction

  1. 输入经 VAE 编码器映射到连续潜变量 z。
  2. 生成先验(continuous autoregressive priors 或 SiT)与解码器联合训练。
  3. 训练初期生成目标在弱重建压力下先塑造潜空间结构,保留熵;随后逐步增强重建权重以恢复视觉细节。

这一调度解决生成-重建冲突,实现无潜变量坍缩的端到端训练。

输出与验证

在 ImageNet-256 上,SiT 达到 gFID 0.97(带 CFG)与 1.45(不带 CFG);MMDiT 在 text-to-image 上取得 GenEval 0.90。方法扩展至共享视觉潜变量的表征学习,以及连续统一文本-图像生成。

与同类方法的差异点:相比两阶段分离训练,GenFirst 通过熵保持与生成优先的动态调度实现端到端联合训练,在不引入额外正则项的条件下稳定训练并达到 SOTA。

实验

实验设计

  • 在 ImageNet-256 上验证图像生成,采用连续自回归先验(exact likelihoods)与 SiT 先验(implicit likelihoods),比较端到端训练与两阶段基线。
  • 扩展到文本到图像生成,用 MMDiT 评估 GenEval 得分,并探索共享视觉潜在表征与连续统一文本图像生成。

关键发现

  • 熵项防坍缩:KL 散度中熵项对防止潜在空间坍缩至关重要,重建与先验拟合会收缩后验,熵保留不确定性。
  • 不对称学习动态:重建快且强监督,生成慢且难优化。据此提出 GenFirst:先用生成目标在弱重建压力下塑造潜在,再逐步加强重建恢复细节。
  • 结果:SiT 在 ImageNet-256 上 gFID 0.97(CFG)/ 1.45(no CFG),MMDiT GenEval 0.90。

与基线对比

  • 传统两阶段先重建后生成,重建优化潜在不一定生成友好。GenFirst 端到端直接优化,通过熵项分析与不对称动态设计训练策略,避免坍缩并解决冲突。
  • 相比以往依赖辅助损失或调度的方法,GenFirst 简单直接,且在连续自回归与 SiT 上均有效,展示跨先验与模态的泛化性。

行业影响

落地场景

GenFirst 通过 generation-before-reconstruction 稳定端到端潜在生成模型训练,直接适用于文本到图像生成、图像生成 API、多模态统一生成与理解等产品。内容平台可用它批量生成个性化配图、封面或短视频素材;设计工具可将草图或文本 prompt 高质量转为成品图;企业营销团队能快速产出定制化视觉物料。此外,共享视觉潜在表征能力可下沉到视觉理解任务,支撑同时需要生成与识别能力的 AI 应用。

商业价值

端到端训练减少传统两阶段管线(VAE 重建 + 生成模型)的独立训练和调优成本,缩短模型迭代周期。论文中 SiT 在 ImageNet-256 上 gFID 0.97(CFG)与 MMDiT GenEval 0.90 的表现,意味着同等算力下能产出更稳定、更多样的高质量图像,直接改善用户体验和转化率。统一多模态模型可替代多个独立模型,降低部署与维护开销。

与现有产品/工作流接口

GenFirst 是训练策略层面的改进,不改变推理架构,可无缝集成到现有 diffusion / autoregressive 训练栈。只需调整损失函数调度与训练顺序,兼容分布式训练、混合精度等基础设施。团队可先从两阶段基线快速切换到端到端训练,避免 latent collapse 带来的调试成本。项目主页 GenFirst 提供实现参考。

具体落地 use case

  • 电商商品图生成:端到端模型可直接根据商品文本描述生成多场景展示图,减少实拍与后期成本。例如输入“白色运动鞋,极简风,浅灰背景”产出可直接上架的商品图,并通过统一潜在表征同时支持商品分类或属性识别。
  • 内容平台创作者工具:为短视频或图文作者提供高质量、低延迟的配图生成服务。端到端训练降低坏图率,提升生成多样性,使创作者能快速试验不同视觉风格,提高内容生产效率。

局限

  • - **优化稳定性与超参敏感**: GenFirst 通过先弱后强重建的调度避免 latent collapse,但端到端训练中生成损失与重建损失的平衡、学习率与训练步数等仍需针对具体数据集和 prior 精细调整,不像冻结 latent 的两阶段流程那样开箱即用。训练成本也更高,因为需同时优化 VAE 与生成模型,且 generation-first 可能需要更长训练步数才能恢复细节重建。
  • - **验证范围与模态泛化**: 实验主要覆盖 ImageNet-256 图像生成与 text-to-image,虽扩展到 shared visual latents 和 unified text-image,但未验证视频、音频或高分辨率(>1024)场景;离散 VQ latent 也未测试,熵项分析是否能迁移到非连续 latent 尚不确定。
  • - **理论适用范围与 prior 依赖**: 防 collapse 的分析建立在 KL 散度目标中的熵项,若使用对抗性或 VQ 等正则化,该结论可能不成立。此外,AR prior 与 SiT prior 的学习动态不同,GenFirst 对 prior 类型的鲁棒性仍需更多 ablation,尤其在 implicit likelihood 场景下训练稳定性可能与非 exact likelihood 的训练技巧强相关。
论文Guangting Zheng2026-08-29原文

相关内容