论文

FuseReg: 正则化层融合缓解表示自编码器中的重建-生成差距

FuseReg: 正则化层融合缓解表示自编码器中的重建-生成差距

表示自编码器(RAEs)复用预训练视觉编码器的特征作为重建与扩散 latent,从而将强视觉表示引入图像生成。然而 RAE 仍需决定用哪些编码器层构成生成器与像素解码器共享的 latent 空间。这一选择存在权衡:浅层更利于保留细粒度像素细节,深层往往带来更好的生成指标。固定的启发式层融合因此把两个偏好不同信息阶段耦合在一起。 我们提出 FuseReg,用对编码器层随机子集的训练替代启发式特征选择。理论分析表明其机制在于:子集采样显式惩罚对跨层不一致的敏感性。 在 ImageNet-256 上使用 DINOv3-L 时,单个 FuseReg 解码器无需重训即可从全层、稀疏、单层融合中重建,PSNR 高于专为固定融合定制的解码器。该灵活性同样利于生成:在保持 RAEv2 DiT-XL 生成器不变的情况下,仅替换解码器即让无引导 gFID 下降 27%。 同一正则化原则可扩展至扩散训练:DiT-Base 上对两阶段联合正则化使无引导 gFID 下降 29%。结果表明,训练下游模型具备层融合鲁棒性,可在不修改预训练编码器的前提下缩小重建-生成差距。

论文精读

TL;DR FuseReg 用随机层融合正则化解码器和扩散模型,使其对跨层不一致鲁棒;单一解码器可跨任意层融合重建,无需重训,提升 PSNR 并降低 gFID 达 27%,弥合重建-生成差距。

问题

问题背景

表示自编码器(Representation Autoencoders, RAEs)正成为图像生成的新范式:直接复用预训练视觉编码器(如 DINOv3)的特征作为重建和扩散潜变量,将强视觉表示融入生成过程。

现有方法局限

当前 RAE 需要人工决定用哪些编码器层构成共享潜空间,通常采用固定的启发式层融合:

  • 浅层特征保留更多像素细节,利于重建;
  • 深层特征语义更强,利于生成指标(如 gFID)。

这种固定选择导致两阶段目标冲突:重建解码器需要细粒度信息,而扩散生成器需要高层语义,固定融合只能折中,无法同时最优。此外,现有方案针对不同融合分别训练专用解码器或生成器,一旦改变融合配置就需要重新训练,灵活性差。

为什么这个问题难/重要

层融合本质是一个多目标优化问题,不同下游任务对层特征的敏感度不同。固定融合会引入系统性偏差,扩大重建-生成差距(reconstruction-generation gap)。业界对高质量生成模型的需求持续增长,RAE 提供了一条高效利用预训练特征的技术路线,但层融合选择成为瓶颈。随机子集训练需要理论保证并控制额外计算开销,同时要确保单个模型能够泛化到任意层融合配置。

行业类比

这类似于多任务学习中共享表示的选择问题:不同任务偏好不同特征层,固定共享层会损害某一任务性能,而通过随机化正则化可以提升表示的鲁棒性。

核心洞察

  • 通过随机子集采样训练重建解码器,将固定的层融合选择转化为正则化目标,惩罚模型对跨层不一致的敏感性。与固定融合或启发式选择相比,FuseReg 让单一解码器兼容任意层子集,无需重训练即可在完整、稀疏和单层融合上均取得更高 PSNR,同时降低生成时的 gFID 27%。其核心差异在于将层融合从一次性架构决策变为持续训练信号,强制下游模型学会从不确定的融合中稳健预测,而不是记忆特定融合。
  • 两阶段采用不同正则化率(p_dec 与 p_dit)精准匹配解码器和 DiT 对层信息的需求差异。解码器需要保留像素细节,偏好较浅层;DiT 生成则依赖深层语义。固定融合无法同时满足两者,而独立调节正则化强度使重建与生成在各自最优区间内协同优化,联合训练进一步降低 gFID 29%,无需改动预训练编码器,为 RAEs 提供可插拔的 gap 缓解方案。

方法

输入与动机

  • 接受预训练视觉编码器(如 DINOv3-L)的多层特征。层间存在 trade-off:浅层保留像素细节,深层提升生成指标,固定层融合难以兼顾。

关键模块

  • 随机子集融合:训练时从所有 encoder 层中随机采样子集,计算归一化均值作为 latent,替代固定层选择。
  • 两阶段预测目标:
    • 解码器:从任意子集融合预测像素,正则化率 p_dec;
    • 生成器(DiT):从子集 latent 预测 full-layer fusion,正则化率 p_dit。
    • 两阶段使用不同正则化率,匹配各自对层间不一致性的敏感度。
  • 理论机制:子集采样显式惩罚对跨层 disagreement 的敏感性,迫使模型利用层间一致性,而非依赖特定层组合。

输出与效果

  • 训练后单一解码器可直接处理 full / sparse / single-layer 融合,无需重训练,PSNR 高于固定融合专用解码器。
  • 仅替换解码器,unguided gFID 降低 27%;联合正则化解码器与生成器,降至 29%。

与固定层融合的启发式方法不同,FuseReg 通过随机化层融合构建正则化分布,使下游模型对层选择具有内在鲁棒性。

实验

实验设计

在 ImageNet-256 上使用预训练 DINOv3-L 编码器,构建 RAEv2 框架。训练 FuseReg 解码器,用随机采样的编码器层子集归一化均值作为潜在表示,替代固定层选择。测试重建时,随机采样不同大小的层子集(full、sparse、single-layer),验证跨融合泛化能力。

关键发现

  • 重建: 单一 FuseReg 解码器能在任意层融合下重建,无需重训,PSNR 超过针对固定融合专门训练的解码器。
  • 生成: 保持 DiT-XL 生成器不变,仅替换解码器,unguided gFID 降低 27%;联合正则化解码器与扩散训练,在 DiT-Base 上 gFID 降低 29%。
  • 扩展性: 联合正则化从 DiT-Base 扩展到 DiT-XL 有效,但存在指标依赖性动态。

基线与对比

传统方法采用启发式固定层融合,需要在细节保留与生成质量之间权衡。FuseReg 通过正则化层间不一致性,使下游模型对层融合鲁棒,单一模型即可适配多种融合配置,且 不修改预训练编码器,直接缩小重建-生成差距。

行业影响

落地场景

FuseReg 可落地于依赖 Representation Autoencoder (RAE) 的生成式 AI 产品,例如:

  • 电商产品图生成:商家上传商品图,系统自动生成多角度、场景化营销图。FuseReg 的正则化使 decoder 对编码器不同层融合更鲁棒,可减少伪影、提升细节保真。
  • 内容平台 / 短视频特效:对用户上传图像进行重建、风格化或编辑,FuseReg 单一 decoder 可处理稀疏或全量层融合,节省多模型维护成本。

商业价值

主要来自降本与体验提升:

  • 推理成本:一个 decoder 替代多个专用 decoder,减少模型存储与切换开销。
  • 生成质量:论文显示 decoder 替换可使 gFID 降低 27%,联合正则化降低 29%,有助于提升生成图像真实度,减少人工修图成本。
  • 灵活性:无需修改预训练编码器(如 DINOv3-L),可直接复用企业内部已有的视觉 backbone,缩短产品迭代周期。

与现有工作流的集成

FuseReg 是训练策略,不改变推理架构,因此可嵌入现有 扩散模型训练流水线:

  1. 在训练 RAE decoder 时,将固定层融合替换为随机子集均值(p_dec 超参控制正则化强度);
  2. 在训练扩散生成器(如 DiT)时,同样引入随机子集 latent 预测,p_dit 单独调节;
  3. 保持编码器冻结,仅在 decoder / DiT 训练阶段加入该正则化。

该方式与现有 PyTorch / HuggingFace 生态兼容,可作为插件式 loss 或数据增广集成,无需大规模重构代码库。

局限

  • **实验范围较窄**:论文仅在 **ImageNet-256** 上使用 **DINOv3-L** 编码器验证 FuseReg,未在多种视觉编码器(如 CLIP、MAE)或更高分辨率/视频任务上测试。RAE 中不同编码器的特征分布和层间关系差异较大,随机子集正则化的效果可能对编码器特性敏感,该方法的通用性尚需进一步验证。作者也承认在内部引导等更复杂生成场景下的适用性需额外实验。
  • **正则化超参数调优成本较高**:FuseReg 引入两个独立的正则化率 `p_dec` 和 `p_dit`,需要分别平衡重建与生成任务。论文虽给出选择指南,但实际部署仍依赖额外超参数搜索。特别是在 **DiT-XL** 上观察到 metric-dependent dynamics,表明相同正则化强度对不同规模模型的影响并不一致,扩展到更大模型时可能需要重新调参,增加了工程开销。
  • **理论分析基于线性假设**:第 4 节的理论证明主要针对线性预测器,说明随机子集采样惩罚跨层不一致。但实际解码器和扩散模型均为深度非线性网络,理论结论能否严格迁移到非线性设置缺乏证明。虽然实验趋势与理论一致,但缺乏非线性情形下的理论保证,可能限制该方法在更复杂网络结构下的可解释性和进一步推广。
论文Hongyang Du2026-09-25原文

相关内容