动态

GAE:在几何原生隐空间直接生成视频,输出 RGB、深度与 3D

GAE:在几何原生隐空间直接生成视频,输出 RGB、深度与 3D
Victor M
转发 @MhYin76491:介绍 GAE —— Geometry-Native Autoencoder(几何原生自编码器)。
关键选择在于生成发生在哪里。GAE 让视频模型直接在几何原生的隐空间中进行生成。
我们相信,对于未来的视频与世界模型而言,几何比纹理更本质。纹理描述场景看起来如何;几何描述场景如何被结构化,以及随着镜头移动什么会变得可见。
GAE 从几何特征中学习一个紧凑的隐空间,再在该空间中训练视频生成器。相机轨迹引导生成,生成的状态会解码为 RGB、深度和 3D。
在几何原生空间中进行生成,是核心所在。
🎬 观看下方 teaser 中场景徐徐展开。
论文:https://t.co/lMJ6aQua4S
代码:https://t.co/VEhxfTzBGa
项目:https://t.co/kCF8YeZuTH
动态Victor M2026-09-23原文

相关内容