行业新闻

V-RAE:以视觉基础模型表征为视频生成潜空间

V-RAE 证明用预训练视觉表征作视频潜空间,比像素重建型 VAE 更易生成,且训练效率大幅提升。

传统视频 VAE 只学像素重建,难以生成新视频。V-RAE 改用预训练视觉模型的高层表征作为生成空间,用轻量时间池化压缩,在重建和生成上均超过传统 VAE,且训练效率显著提升。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/4fa8b31f-a4de-46d2-9a9b-2a4c52245b77/033(2).jpg) ![图片](/r/blog/3b1171a9ab1a71831b108a9c6abb610eb7a556fe22170b8ca9ef0ccda97f7834.png) 近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《 V-RAE: Rethinking Video Latent Spaces for Generation 》中提出视频表征自编码器 V-RAE 。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。 ![图片](/r/blog/4f1378a8d0ce7e8ad2ee87cd6705c70db5b47c71af2995e4e4a208f2c135635a.png) 当视频生成模型不断变大、数据和算力持续增长时,人们往往关注更强的生成骨干和更长的训练,却容易忽视一个更基础的问题:生成模型究竟在什么样的空间里学习? 主流视频生成系统通常先用 VAE 把原始视频压缩为潜在表示(latent),再由扩散或自回归模型学习这些表示的分布。这个 latent space 就像视频生成的“隐形地基”:它决定模型需要学习什么,也影响训练难度、收敛速度和最终质量。传统视频 VAE 大多以像素重建为核心,擅长保留纹理、色彩和局部细节;然而,“能够准确还原真实视频”,并不等于“容易生成全新视频”。 近期,Representation Autoencoder(RAE)在图像生成中的探索开始重新思考这一“地基”应该如何构建。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-25原文

相关内容