Google等提出VGGRPO 用4D隐空间奖励实现世界一致视频生成
Google等提出VGGRPO,通过在隐空间引入4D几何奖励进行强化学习,高效提升视频生成的几何一致性,无需修改模型架构。
VGGRPO是Google等提出的视频后训练方法。它引入隐式几何模型,直接在隐空间(压缩特征空间)中预测4D几何,并用摄像机运动平滑度和几何重投影一致性两项奖励进行GRPO强化学习。无需修改预训练架构或解码到像素,就能显著提升视频几何一致性和镜头平滑度,适用于动态场景。
正文摘录
.jpg)  引言 大规模视频扩散模型在视觉质量上取得了令人瞩目的成就,但它们在保持几何一致性方面往往力不从心。具体表现为:生成的视频常常出现几何漂移、摄像机轨迹不稳定以及场景结构不连贯等问题。这对于具身智能、世界动作模型等要求稳定摄像机运动和连贯 3D 几何的下游应用来说,是一个致命的缺陷。 以往为了解决这些问题,研究者们主要采取两种思路:一种是修改生成器架构,加入额外的模块或几何感知对齐;另一种是采用基于强化学习的后训练对齐。然而,修改架构可能会破坏互联网规模预训练模型的泛化能力;而现有的对齐方法不仅局限于静态场景,还依赖于 RGB 空间的奖励,这需要反复进行 VAE 解码,导致计算开销巨大,而且无法泛化到高度动态的真实世界场景中。 最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。