论文

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

视频生成模型通常依赖于3D变分自编码器(3D-VAE)学习的潜在空间。然而,传统的3D-VAE主要针对像素级重建优化,这限制了其潜在空间捕获的语义和时空结构。同时,视频基础模型(VFM) 如 V-JEPA 2 和 VideoMAEv2 展现出强大的视频理解能力,但它们的冻结表示能否转化为紧凑、可重建且利于生成的视频潜在表示,仍待探索。本文通过 VideoRAE 回答了这一问题,这是一种表示自编码器,利用冻结视频基础编码器的多尺度层次特征,并通过轻量级1D自注意力投影器进行压缩。 VideoRAE 支持用于扩散Transformer(DiT)的连续潜在表示和用于自回归模型(AR)的离散token,通过多码书高维量化实现。在解码阶段,与冻结VFM教师网络的局部和全局表示对齐目标提升了语义保留,并实现了无需KL正则化的训练。实验表明,VideoRAE在连续和离散模式下均实现了强重建性能。在 UCF-101 上,它使用AR和DiT生成器分别达到了40和93的类到视频gFVD,同时收敛速度比竞争的自动编码器基线快约5倍。在受控的2B规模文本到视频研究中,用 VideoRAE 替换 LTX-VAE 在相似设置下实现了更快的收敛。这些结果验证了冻结VFM表示可作为通用且利于生成的视频潜在表示。代码和模型将在 https://zhxie0117.github.io/VideoRAE 发布。

论文精读

TL;DR VideoRAE 利用冻结的视频基础模型多尺度特征,通过轻量投影器压缩为生成友好潜在空间,在视频生成中达到 SOTA 且收敛快 5 倍,验证了 VFM 表示可直接用于高效生成建模。

问题

问题背景

视频生成模型(如扩散 Transformer 和自回归模型)高度依赖从 3D-VAE 学到的潜在空间进行高效训练与推理。然而,当前主流的 3D-VAE 主要针对像素级重建进行优化,这导致其潜在空间更多保留低级纹理信息,却欠缺对语义和时空结构的建模能力。

现有方法局限

  • 像素级重建:传统 3D-VAE 以重建原始像素为目标,损失函数多为 L1/L2 或感知损失,这使潜在变量偏向于保留高频细节,而忽略高层语义(如物体运动模式、场景动态)。
  • 语义匮乏:此类潜在空间在生成时可能导致运动不连贯、物体变形或场景切换失真,尤其对长视频或复杂交互场景。
  • 训练成本3D-VAE 通常需要从零开始在大规模视频数据上训练,计算开销大,且学习到的表示与现有视频理解模型割裂,无法复用强大的视频基础模型能力。

为什么这个问题难且重要

视频天然包含高维时空信息,如何在紧凑的潜在表示中同时保留像素精度和语义一致性,是生成质量的关键瓶颈。视频基础模型(VFM)(如 V-JEPA 2、VideoMAEv2)虽已证明具备卓越的语义理解能力,但其表示是否适合生成任务仍属未知:

  1. 表示压缩挑战:VFM 的中间特征维度高且冗余,需要设计高效投影器将多尺度特征压缩成紧凑潜在码。
  2. 生成对齐难题:生成的潜在码必须能被解码回高质量视频,同时保持语义可控,这要求解码器与 VFM 的表示空间对齐。
  3. 业界关注度:随着文本到视频、视频预测等应用兴起,业界迫切需要一种能加速生成模型收敛、提升视觉和语义质量的通用视频潜在表示,直接使用现有 3D-VAE 往往导致生成模型收敛慢、质量上限低。

行业类比

这类似于在图像生成中,从早期直接使用像素级 VAE 转向利用 DINOv2 等自监督表示作为感知先验,从而显著提升生成图像的语义一致性和训练效率,但视频领域一直缺乏类似方案。

核心洞察

  • 冻结的视频基础模型(VFM)特征可以直接转化为紧凑、可重建且适合生成的潜在表示,打破了传统 3D VAE 仅依赖像素重建的局限。传统 3D VAE 学习到的潜在空间主要服务于像素保真度,往往丢失高层次时空语义,导致生成模型需要更多步数去弥补语义鸿沟。VideoRAE 通过直接压缩 VFM 的多尺度层次特征,使 latent 先天具备丰富的语义和时空结构,从而让扩散或自回归生成器更快收敛(约 5 倍),并在 UCF-101 上达到当时最佳的 class-to-video 生成指标。这一范式揭示出,纯理解任务的预训练模型可作为生成模型的强大先验,大幅降低从头训练视频 tokenizer 的成本与数据需求。
  • 多尺度 VFM 特征通过轻量 1D 自注意力投影器实现高效压缩,避免了常见的 3D 卷积或时空注意力带来的计算开销,同时保持了对高动态视频的强表示能力。VideoRAE 将不同层的 VFM token 序列拼合为统一序列,仅靠沿 token 维度的 1D 自注意力完成多尺度信息融合与下采样,这一设计不仅参数少、收敛快,还天然适配连续与离散两种生成范式。与传统基于 3D VAE 或 VQ-VAE 的 tokenizer 相比,该方法绕开了复杂的时序建模结构,证明了只要输入特征足够语义化,简单的序列投影器就足以产出高质量 latent。这为未来 scalable 视频生成架构提供了新的设计哲学:用冻结的理解模型提取特征,再用极简的投影器完成 latent 转换,实现生成效率与效果的双赢。

方法

输入:多尺度视频特征提取

VideoRAE 的输入是原始视频帧,首先通过一个冻结的 Video Foundation Model (VFM) 编码器(如 V-JEPA 2 或 VideoMAEv2)提取多尺度层次化特征。这些特征已经蕴含了丰富的语义和时空结构信息,替代了传统 VAE 中直接从像素学习潜在表示的做法。

关键模块:压缩与量化

  • 1D 自注意力投影器:接收来自 VFM 不同层的多尺度特征,利用轻量级 1D 自注意力机制在时间维度上压缩信息,将其映射到紧凑的潜在空间。该模块参数量很小,主要依赖冻结编码器的表示能力。
  • 多码本高维量化(针对离散潜在):若需要产生离散 token 供自回归模型使用,则通过多个码本在高维空间进行矢量量化,每个码本捕获不同特征子空间的信息,既增加了表达能力又避免了单一码本的坍缩问题。
  • 连续潜在支持:对于扩散模型,直接输出连续潜在向量,无需量化步骤,保持了梯度的连续性。

解码与表示对齐

解码器从潜在空间重建视频时,引入局部与全局表示对齐损失:将重建视频再次送入冻结的 VFM 编码器,计算其与原始视频在 VFM 特征空间的差异。该目标强制解码结果保持高层语义,从而无需 KL 正则化即可稳定训练,并提升重建的感知质量。

输出与训练策略

最终输出可以是重构的视频帧序列。训练目标由像素重建损失(如 L1/L2)和表示对齐损失共同构成,无传统 VAE 中的 KL 散度项,收敛速度显著加快。

与同类方法的差异:传统 3D-VAE 仅优化像素级重建,导致潜在空间缺乏语义结构;VideoRAE 借助冻结 VFM 的强语义先验,通过表示对齐直接约束生成过程,使潜在空间更适合生成模型,且离散/连续可变、训练更高效。

实验

实验设计

VideoRAE 的评估聚焦于 冻结视频基础模型 (VFM) 特征能否被压缩成适合生成的视频潜变量。实验分两条主线:

  1. 类别到视频生成 (class-to-video):在 UCF-101 数据集上,分别用 自回归 (AR)扩散变换器 (DiT) 生成器,测试连续与离散潜变量的生成质量,主要指标为 gFVD
  2. 文本到视频生成 (text-to-video):在 2B 规模 的受控实验中,将 LTX-VAE 替换为 VideoRAE,观察收敛速度和 VBench 性能。

同时,通过消融实验验证了多尺度层次特征、1D 自注意力投影、局部-全局表示对齐等设计的有效性,并比较了不同量化方式(如多码本高维量化)的影响。

关键发现

  • 生成质量全面领先:在 UCF-101 上,VideoRAE 的 AR 生成器取得 gFVD 40,DiT 生成器取得 gFVD 93,均为 SOTA。这表明冻结 VFM 表示可以压缩为高质量、可重建的潜变量。
  • 收敛速度大幅提升:相比其他自编码器基线,VideoRAE 收敛速度 快约 5 倍,这降低了训练成本,对实际工程部署极具吸引力。
  • 文本到视频场景有效:替换 LTX-VAE 后,模型收敛更快,且 VBench 综合得分更高,说明 VideoRAE 的潜空间对多模态生成任务具有良好泛化性。
  • 无需 KL 正则化:解码时引入的 局部-全局表示对齐 目标,使训练摆脱了对 KL 项的依赖,同时增强了语义保持能力。

与基线对比的深度解读

传统 3D-VAE 仅优化像素级重建,其潜空间常忽略高层语义和时空结构,导致下游生成模型需额外“弥补”这些缺失,训练慢且质量受限。VideoRAE 直接利用 V-JEPA 2 / VideoMAEv2 等 VFM 的多尺度层次特征,通过 轻量 1D 自注意力投影 压缩,使潜空间天然携带丰富的语义和运动信息。

LTX-VAE 等竞争自编码器相比,VideoRAE 的优势源于:

  • 冻结 VFM 教师 提供强表示,避免从零学习,加速收敛。
  • 表示对齐 迫使解码器恢复的潜变量与教师特征一致,而非仅像素相似,因此生成的视频运动更连贯、语义更准确。

这一范式验证了“冻结 VFM 特征作为生成潜变量”的可行性,为视频生成提供了一条高效、高质量的新路径,有望推动更大规模模型的训练和应用。

行业影响

落地场景

VideoRAE 的紧凑潜空间和强语义保持能力,适用于视频生成即服务 (VGaaS) 平台、交互式内容创作工具高保真视频压缩传输。在需要低延迟、高质量视频合成的情景下,其加速收敛和双范式支持(DiT / AR)能显著降低推理成本,支撑实时生成应用。

商业价值

  • 降本:训练收敛速度约 5 倍于同类自编码器,大幅减少 GPU 计算时间,直接降低模型迭代成本。
  • 增收 / 体验提升:在 text-to-video 等任务中更快收敛且 VBench 指标更优,意味着生成视频的视觉质量提升,增强用户粘性与付费意愿。
  • 灵活性:一套表示可同时供应扩散和自回归两类生成器,减少对不同下游模型的适配成本。

与现有工作流的接口

VideoRAE 可作为即插即用的潜空间模块,无缝替换现有视频生成 pipeline 中的 VAE(例如 LTX-VAE)。只需提供冻结视频基础模型的编码器特征,通过其 1D 投射器和量化模块输出连续或离散 tokens,直接对接主流 Diffusion TransformersAutoregressive Transformers。无需修改生成器的结构。

具体落地用例

  1. 短视频平台个性化内容生成:用户输入文字描述,模型快速生成多段短视频供挑选。VideoRAE 加速生成且语义连贯性更好,可提升用户创作的满意度和分享率,带动平台内容生态和广告变现。
  2. 电商自动商品展示视频:商家上传商品图片和文案,系统自动合成多镜头动态视频。更快的生成速度(加速 5 倍)意味着实时批量生成成为可能,降低单个视频成本,提高商品页面转化率。

局限

  • **依赖冻结视频基础模型 (VFM) 的通用性假设**:VideoRAE 的性能直接受限于所选 VFM 的预训练质量与领域覆盖度。如果基础模型对某些视频分布(如高动态场景、细粒度动作、专业领域影像)的表征不足,压缩后的潜在空间可能丢失关键的语义与时空结构,且无法在下游生成训练中自适应调整。这种冻结编码器设计牺牲了任务特异性适配能力,可能成为未来泛化到多样化视频生成任务的瓶颈。
  • **实验评估规模与基准覆盖有限**:主要的 SOTA 对比集中在 UCF-101 这类动作识别数据集上,其视频时长和内容多样性有限。虽然提供了 2B 规模文本到视频的受控实验,但仅比较了与 LTX-VAE 的替换效果,未在更大规模、更通用的视频生成基准(如 MSR-VTT、WebVid 或 Kinetics 生成的 FVD/IS)上进行充分验证。缺乏与更多主流视频 AE 的公平对比,难以全面衡量其在不同模态和较长视频下的实际增益。
  • **离散潜在空间的量化策略仍有优化空间**:采用多码书高维量化虽能支持自回归生成,但引入了额外的超参数(码书数量、码字维度)和训练复杂度,且离散化带来的信息损失可能影响重建精度。论文中离散场景的 gFVD 虽优秀,但与连续 DiT 相比仍有差距,未深入分析码书崩溃或利用率不足等常见量化问题,也未探索更先进的有限标量量化(FSQ)或 Lookup-free 量化方案以简化流程。
论文Zhihao Xie2026-07-15原文

相关内容