V-RAE:以视觉基础模型表征为视频生成潜空间
V-RAE 证明用预训练视觉表征作视频潜空间,比像素重建型 VAE 更易生成,且训练效率大幅提升。
传统视频 VAE 只学像素重建,难以生成新视频。V-RAE 改用预训练视觉模型的高层表征作为生成空间,用轻量时间池化压缩,在重建和生成上均超过传统 VAE,且训练效率显著提升。
正文摘录
.jpg)  近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《 V-RAE: Rethinking Video Latent Spaces for Generation 》中提出视频表征自编码器 V-RAE 。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。  当视频生成模型不断变大、数据和算力持续增长时,人们往往关注更强的生成骨干和更长的训练,却容易忽视一个更基础的问题:生成模型究竟在什么样的空间里学习? 主流视频生成系统通常先用 VAE 把原始视频压缩为潜在表示(latent),再由扩散或自回归模型学习这些表示的分布。这个 latent space 就像视频生成的“隐形地基”:它决定模型需要学习什么,也影响训练难度、收敛速度和最终质量。传统视频 VAE 大多以像素重建为核心,擅长保留纹理、色彩和局部细节;然而,“能够准确还原真实视频”,并不等于“容易生成全新视频”。 近期,Representation Autoencoder(RAE)在图像生成中的探索开始重新思考这一“地基”应该如何构建。