论文

GRACE:生成感知的潜在压缩,用于高效视频生成

GRACE:生成感知的潜在压缩,用于高效视频生成

高度压缩的视频自编码器是加速视频扩散模型的有效手段,因为 Diffusion Transformer(DiT) 只在远少的 token 上运算。但这类自编码器训练困难:更高的压缩比会损害重建质量,而要恢复质量就需要更多通道,这已知会拖慢 DiT 的收敛。 此外,压缩后的 latent 与 DiT 训练时所用的 latent 并不一致,预训练 DiT 要么从头重训,要么付出可观成本做适配。压缩 DiT 原本训练所用的自编码器看似能保持兼容性,但仅针对重建做优化,仍会让 latent 偏离 DiT 已学到的分布。 为此,我们提出 GRACE(Generation-Aware Latent Compression for Efficient Video Generation),一个两阶段框架,在压缩预训练视频自编码器的同时保持其与预训练 DiT 的兼容:保留预训练编码器给出的冻结 base latent,并为更强压缩下丢失的信息学习一个 residual latent;同时在冻结 DiT 的特征空间中将压缩 latent 与预训练 latent 对齐,使自编码器面向生成任务优化。随后以轻量微调与非对称去噪适配 DiT,其中 base 先于 residual 被去噪。 在 480x832x81 设置下,GRACE 将 Wan2.1-I2V-14B 的 token 数减少 8 倍、延迟降低 11.1 倍,同时在 VBench 上匹配压缩前预训练流水线的生成质量。

论文精读

TL;DR GRACE 通过生成感知潜在压缩,保留基础潜在并学习残差、对齐冻结 DiT 特征,实现 8 倍 token 压缩与 11.1 倍加速,同时匹配原生成质量。

问题

当前视频扩散模型 推理成本极高,主要瓶颈在于 Diffusion Transformer (DiT) 在大量视频 token 上运行。为加速生成,业界普遍采用高压缩视频自编码器,将像素映射到低维 latent,从而减少 DiT 的输入 token 数。

然而,训练高压缩视频自编码器面临三重困境:

  1. 高压缩比损害重建质量:更激进的压缩会丢失细节,需增加 latent 通道数才能恢复,但更多通道会显著减慢 DiT 收敛速度。
  2. 兼容性问题:新压缩 latent 空间与预训练 DiT 所依赖的分布不一致,导致预训练模型无法直接复用,要么从头训练,要么高成本适配。
  3. 直接压缩原自编码器仍不理想:即使对原有自编码器做进一步压缩,仅优化重建损失会使 latent 偏离 DiT 学到的生成分布,造成生成质量下降。

这一矛盾在视频生成中尤为突出,因为视频比图像有更高时空间冗余,但压缩与生成的耦合更深。业界对实时视频生成、移动端部署的需求强烈,因此找到一种既能大幅降低 token 数、又保持生成质量与预训练模型兼容的方法,是加速视频扩散模型的核心挑战。

这与大语言模型推理中的 KV cache 压缩 类似:目标都是在近似无损前提下减少计算量,但必须保证压缩后的表示仍落在模型可接受的分布内,否则需付出昂贵的微调代价。

核心洞察

  • 核心思想:GRACE 提出“保留 base latent + 学习 residual latent”的策略,在冻结 DiT 特征空间对齐压缩 latent,使压缩自编码器直接兼容预训练 DiT,避免从头训练或高昂适应。与以往只优化重建质量或需重训高压缩自编码器不同,GRACE 将生成目标纳入自编码器训练,通过 DiT 特征对齐把 latent 分布拉回 DiT 已学习的流形,从而在 8x token 压缩下保持生成质量。这为高效视频生成提供了一条低成本路径,只需轻量微调 DiT 和不对称去噪。
  • 非对称去噪(asymmetric denoising) 是关键配套:在微调 DiT 时先对 base latent 去噪再对 residual latent 去噪,使模型能利用 base latent 中的低频结构并逐步补充高频细节。这一设计不同于通常对统一 latent 的整体去噪,它利用了 base latent 与预训练 latent 的相似性,降低微调难度,加速收敛。与简单微调整个 latent 相比,该策略在有限训练预算下更有效,是压缩 latent 快速适配预训练 DiT 的实用技巧。

方法

输入:原始视频帧,预训练视频自动编码器 E 与解码器 D,预训练 DiT G。

阶段一:压缩自动编码器与生成感知对齐

  • 保留冻结的预训练编码器,生成 base latent z_base(原始低分辨率潜在表示)。
  • 新增轻量 残差编码器 学习 z_res,补偿高压缩比下丢失的高频细节,最终压缩潜在由 z_base 与 z_res 拼接而成。
  • 在冻结 DiT 的特征空间中,将压缩潜在与原始潜在进行 特征对齐,使自动编码器优化目标从单纯重建转向生成质量,避免潜在分布偏移。

阶段二:DiT 轻量适应与非对称去噪

  • 对预训练 DiT 进行轻量微调,适配新的潜在结构。
  • 采用 asymmetric denoising:扩散去噪时先对 z_base 去噪,再处理 z_res,模拟更自然的生成过程。

输出:高效视频生成管道,token 数减少 8 倍,推理延迟降低 11.1 倍(480x832x81),在 VBench 上匹配原始质量。

差异点:与从头训练高压缩自动编码器或完全重训 DiT 不同,GRACE 通过保留 base latent 并学习残差,结合生成感知对齐,在不破坏预训练模型兼容性的前提下实现大幅压缩。

实验

实验设计:基于 Wan2.1-I2V-14B 与对应视频自编码器,GRACE 采用两阶段训练。第一阶段冻结预训练编码器提取 base latent,学习 residual latent 补偿压缩损失,并在冻结 DiT 的特征空间中进行对齐。第二阶段对 DiT 进行轻量微调,采用 asymmetric denoising(基础潜在先于残差去噪)。评估使用 VBench 基准,覆盖视频重建与生成质量。

关键发现:在 480x832x81 分辨率下,GRACE 将 token 数减少 8x,推理延迟降低 11.1x,同时生成质量与压缩前预训练流程相当。表明该框架在显著降低计算开销的同时保持了生成性能。

对比解读:与仅优化重建的自编码器压缩不同,GRACE 显式对齐生成分布,避免潜在空间偏移;相比从头训练 DiT 或全量微调,GRACE 的轻量适应成本更低,残差潜在设计提供了实用的加速路径。

行业影响

落地场景

GRACE 将视频生成 token 数减少 8 倍、延迟降低 11.1 倍,同时匹配原始生成质量,使实时或近实时的视频生成服务成为可能。主要落地场景包括:

  • 短视频内容创作:允许创作者快速迭代视频草稿,按文本或图像生成 480x832 分辨率、81 帧的短视频,用于社交平台、广告素材。
  • 电商商品视频:基于商品图片生成展示视频(如 rotating view、场景演示),可批量生成,降低人力成本。
  • 电影预可视化:导演快速生成分镜动画预览,加速前期制作。

商业价值

商业价值主要体现在推理成本下降和吞吐量提升。视频 DiT 的推理计算量随 token 数量增长,减少 8x token 直接降低 GPU 成本和功耗;延迟降低 11.1x 允许单个 GPU 服务更多并发请求,提高单位时间的收入。此外,质量不降保证了用户体验,可避免因生成质量下降导致的客户流失。对于云服务商或视频生成 API 提供商,GRACE 可将单次生成成本降低约一个数量级,同时保持竞争力。

跟现有产品/工作流的接口

GRACE 可作为一个即插即用的压缩模块集成到现有视频生成服务中:

  1. 保留预训练 DiT:不需要从头训练扩散模型,只需对已有的视频 autoencoder 进行压缩训练,并对 DiT 做轻量微调(论文中为 small adapter)。
  2. 兼容现有 API:压缩后的 autoencoder 输出可与原 DiT 输入接口对齐,因此可作为流量入口的预处理层替换。
  3. 低成本迁移:相比 re-training 整个 DiT,GRACE 的训练成本低几个数量级,适合快速上线。

例如,某视频生成 SaaS 平台已部署 Wan2.1-I2V-14B,可直接将现有 autoencoder 替换为 GRACE 压缩版本,并在其自有的 prompt 数据集上做几小时的轻量微调,即可将推理成本降低 8 倍以上,无需更改下游 API 结构。

局限

  • **方法只在一个特定 base model 上验证**:论文实验主要基于 **Wan2.1-I2V-14B**,虽然也适配了其他自编码器(附录 C.1),但整体结论的泛化性仍受限于这一具体 DiT 架构与预训练权重。当换用不同规模的 DiT(如更大参数、不同 attention 设计)或不同视频生成任务(如文生视频、长时视频)时,GRACE 的对齐损失与残差潜空间设计是否依然有效、是否需要大幅调整超参数,论文尚未充分探讨。此外,实验分辨率集中在 **480×832×81**,对更高分辨率或更长序列的生成质量缺乏评估。
  • **训练流程仍依赖冻结 DiT 的特征空间**:Stage 1 的生成对齐需要利用预训练 DiT 的中间特征,如果目标 DiT 的结构与训练时的特征维度或语义分布存在较大差异(例如社区自行微调过的 DiT),对齐效果可能下降。而且 Stage 2 仍需要对 DiT 进行轻量微调,虽然成本低于从头训练,但依然需要额外的训练时间和数据,这在一定程度上削弱了方法对下游使用者的吸引力。与完全无需微调 DiT 的压缩方案相比,GRACE 仍有一定工程负担。
  • **残差潜空间与非对称去噪带来额外复杂度**:GRACE 将潜变量分解为基础潜变量与残差潜变量,并在去噪时采用**非对称策略**(先对 base 去噪,再对 residual 去噪),这改变了原始 DiT 的单流去噪范式。虽然论文证明该设计能保持生成质量,但它引入了新的超参数(如残差通道数、去噪调度、对齐损失权重),这些参数对最终性能可能敏感。论文的消融实验覆盖了部分设计,但并未给出系统的超参数敏感性分析,实际部署时调参成本不可忽略。
论文Jiyoung Kim2026-10-07原文

相关内容