行业新闻

Google等提出VGGRPO 用4D隐空间奖励实现世界一致视频生成

Google等提出VGGRPO,通过在隐空间引入4D几何奖励进行强化学习,高效提升视频生成的几何一致性,无需修改模型架构。

VGGRPO是Google等提出的视频后训练方法。它引入隐式几何模型,直接在隐空间(压缩特征空间)中预测4D几何,并用摄像机运动平滑度和几何重投影一致性两项奖励进行GRPO强化学习。无需修改预训练架构或解码到像素,就能显著提升视频几何一致性和镜头平滑度,适用于动态场景。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/f2d7ef59-2a6c-4cd2-9151-faf08930f34f/052(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 引言 大规模视频扩散模型在视觉质量上取得了令人瞩目的成就,但它们在保持几何一致性方面往往力不从心。具体表现为:生成的视频常常出现几何漂移、摄像机轨迹不稳定以及场景结构不连贯等问题。这对于具身智能、世界动作模型等要求稳定摄像机运动和连贯 3D 几何的下游应用来说,是一个致命的缺陷。 以往为了解决这些问题,研究者们主要采取两种思路:一种是修改生成器架构,加入额外的模块或几何感知对齐;另一种是采用基于强化学习的后训练对齐。然而,修改架构可能会破坏互联网规模预训练模型的泛化能力;而现有的对齐方法不仅局限于静态场景,还依赖于 RGB 空间的奖励,这需要反复进行 VAE 解码,导致计算开销巨大,而且无法泛化到高度动态的真实世界场景中。 最近,来自 Google、哥本哈根大学、牛津大学等机构的研究者提出了 VGGRPO(Visual Geometry GRPO,收录于 ECCV 2026)。这项工作聚焦于一个核心问题:如何在不牺牲预训练模型泛化能力的前提下,高效地提升视频生成的几何一致性,并使其适用于动态场景。其核心思路是,在隐空间(latent space)中利用 4D 几何奖励,进行几何感知的视频后训练。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-17原文

相关内容