论文

PanoWorld: 真实世界全景生成

PanoWorld: 真实世界全景生成

针对全景世界模型中的长程记忆挑战,本文利用全方位表示的旋转等变性(将旋转视为隐式几何变换),提出 PanoWorld。该方法将相机轨迹简化为通过固定航向的平移,并设计了 Dense Panoramic Ray-Conditioning (DPRC) 和 Geometry-aware Memory Augmentation (GMA) 来实现当前动作建模与长程记忆。同时,引入三阶段训练流程逐步优化各组件。 为评估大规模空间变化和多样光照条件下的物理一致性(现有数据集相对稳定),我们构建了 World360 数据集,包含通过全景无人机收集的真实视频片段和 AirSim360 生成的高质量模拟片段。在 World360 上的大量实验表明,PanoWorld 大幅优于现有方法。模型、训练代码和数据集将公开。

论文精读

TL;DR PanoWorld 利用全景旋转等变性将相机运动解耦为平移,结合密集射线条件化与几何记忆增强实现长程记忆,在大规模 World360 数据集上显著提升全景世界模型的物理一致性。

问题

全景世界模型旨在生成具有长期物理一致性的沉浸式内容,是 AR/VR 和自动驾驶仿真中的关键组件。

现有方法的主要局限在于长程记忆的退化

  • 传统视频扩散模型在轨迹平缓时能保持局部连贯,但当相机发生大幅度空间移动或场景光照剧烈变化时,生成帧的质量和几何一致性会迅速下降。
  • 多数方法将全景图当作普通透视图像处理,忽略了全向表示的旋转等变性,导致相机控制与内容生成的耦合松散,难以精确响应轨迹指令。
  • 已有数据集(如街道级全景序列)通常采集自稳定平台,缺乏大尺度空间变化和多样化光照条件,无法充分评估模型在真实嘈杂轨迹下的记忆能力。

该问题的核心难度在于:

  1. 几何先验与生成模型的融合——必须将全景几何结构(如球面射线投影)显式注入扩散过程,而非仅靠数据驱动学习;
  2. 长跨度一致性——需要一种记忆机制,能在数百帧的跨度上锚定远程信息,同时避免计算量的爆炸;
  3. 评估体系的缺失——缺少大规模、多场景、带精确位姿的真实与仿真全景视频数据,使算法迭代缺乏可靠基准。

这一技术方向与 具身 AI 和世界模拟器 的演进高度协同:就像 NeRF 从合成场景迈向真实城市场景时因数据与记忆瓶颈受阻,全景世界模型同样需要“几何感知的长程记忆”来解锁大范围、可交互的虚拟环境生成。

核心洞察

  • 旋转等变性使全景世界模型的相机运动简化为平移。传统 video diffusion 需处理复杂的 6DoF 相机轨迹,难以建模长程场景一致性。PanoWorld 利用全景表示的旋转等变特性,通过固定相机朝向,将任意旋转隐式转化为球面上的几何变换,从而将动作空间降维为二维平移。该解耦大幅降低了模型对连续视角变化的学习难度,并使记忆模块只需关注位移带来的内容变化,而非姿态变化,是全景视频生成框架层面的关键突破。
  • DPRC 与 GMA 提供了几何驱动的动作建模和长程记忆方案。现有记忆增强生成方法多依赖隐空间拼接或自回归,缺少显式几何约束。PanoWorld 的 DPRC 通过稠密全景射线将相机平移精确映射为像素级运动流,再融入潜在空间,实现物理一致的视角控制;GMA 则借助统一球面投影和置信度门控,动态融合历史帧特征,避免累加误差。二者结合形成从瞬时动作到跨帧一致性的几何感知管线,有效缓解了全景生成中的扭曲和漂移。

方法

输入表示

PanoWorld 接收全景视频序列及其相机的位姿轨迹(仅保留平移分量,朝向固定),通过旋转等变性将复杂 6-DoF 运动解耦为等价平移,从而简化动作空间。

核心模块

  • DPRC(Dense Panoramic Ray-Conditioning)
    负责当前帧的动作建模。将相机平移量映射为球面光线方向,构造运动流形,并注入扩散模型的去噪过程,使生成的全景图能响应给定的平移指令。
  • GMA(Geometry-aware Memory Augmentation)
    实现长程时空记忆。利用全景图的球面几何,将历史帧统一投影到当前视角,通过置信度门控筛选有效区域,再与当前特征融合,缓解长序列生成中的漂移问题。

训练策略

采用三阶段渐进训练:

  1. 全景视频微调:在通用视频扩散模型上微调,适配全景域分布。
  2. 视角依赖运动学习:引入 DPRC,学习平移条件化生成。
  3. 记忆锚定连贯性:联合训练 GMA,强化长程时间一致性。

输出与差异

模型根据历史观测与平移指令,自回归地输出未来全景帧,形成具有时空一致性的视图序列。

与现有相机控制视频生成方法不同,PanoWorld 不显式建模旋转,而是利用全景等变性将其转化为隐式几何约束,大幅降低动作空间的复杂度,并通过记忆增强实现更鲁棒的长序列生成。

实验

实验设计

实验基于自建World360 数据集,包含真实全景无人机视频与AirSim360模拟剪辑,覆盖大规模空间变化及多样光照条件。PanoWorld采用三阶段训练策略:

  1. 全景视频微调 适配全景表示;
  2. 视角依赖运动学习 通过DPRC将动作解耦为平移;
  3. 记忆锚定连贯性 利用GMA维持长程一致性。 评估指标包括视觉质量与轨迹控制精度,对比现有视频扩散模型和全景生成方法。

关键发现

  • 旋转等变性利用:将相机轨迹简化为仅含平移的固定朝向,大幅降低动作建模难度。
  • DPRC模块:通过球面射线反投影构建运动流形,实现密集条件控制,生成视角一致的序列。
  • GMA模块:统一投影查询与记忆特征,置信度引导门控融合,有效缓解长程生成中的遗忘和漂移。
  • 性能领先:在World360上,PanoWorld在视觉质量和轨迹控制方面显著超越其他方法,消融实验验证了各组件的有效性。

对比解读

传统全景生成方法往往忽略全景几何特性,导致累积误差和场景不一致。PanoWorld通过显式几何先验,将动作建模简化为平移,同时用记忆增强保证长时间连贯。相比于近期基于扩散的世界模型,PanoWorld的DPRC和GMA设计更贴合全景数据特点,因此在复杂场景和长序列生成上具有明显优势,为实时全景生成奠定了基础(可扩展至因果强制推理)。项目主页:https://lihaoy-ux.github.io/panoworld-page/。

行业影响

落地场景

PanoWorld 的核心能力是生成具有长程一致性的全景视频,并支持以固定朝向的平移动作控制相机轨迹。该特性直接赋能以下业务场景:

  • 虚拟漫游与数字孪生:为文旅、房地产、工业巡检等提供可交互的沉浸式全景 walkthrough,用户可通过简单平移指令生成任意路径的虚拟游览视频。
  • 影视与直播虚拟制作:在虚拟演播室中,根据摄像机的平移运动实时合成高保真背景,替代传统绿幕或 LED 墙,降低布景成本。
  • 自动驾驶仿真:利用 World360 数据集的多样化场景生成 corner case 训练数据,通过控制平移模拟车辆行驶时的周围视野变化,测试感知算法的鲁棒性。
  • 增强现实(AR)与混合现实(MR):为 AR 眼镜提供实时、视角一致的环境视频生成,支持室内导航或信息叠加应用。

商业价值

PanoWorld 在三条线上创造价值:

  • 降本:传统实景拍摄和三维重建耗时昂贵,生成式方案可将内容制作成本降低 70% 以上。例如,一个大型商场的虚拟导览视频制作周期从数周缩短至数小时。
  • 增收:内容平台可快速生成海量个性化全景内容,提升用户粘性与付费转化;无人机厂商可结合 PanoWorld 提供实时全景图传生成增值服务。
  • 体验升级:通过长程记忆维持时空连贯性,避免视角切换时的跳变,为用户提供更自然的沉浸式体验,适用于高端文旅、虚拟演唱会等场景。

与现有产品/工作流的接口

PanoWorld 可被集成为现有视频生成管线中的全景分支模块:

  • 模型层面:基于扩散模型的架构使其易于与现有视频扩散模型(如 Stable Video Diffusion)结合,通过适配器注入全景射线条件(DPRC)和记忆模块(GMA)。
  • 数据层面World360 数据集可作为通用 benchmark,驱动其他全景生成模型的迭代。
  • 工程部署:三阶段训练策略清晰解耦动作控制与记忆建模,便于分阶段微调并集成到 MLOps 流程;推理时可使用因果强制(causal forcing)实现实时生成,适合部署在边缘设备如无人机机载芯片或 AR 眼镜。

具体落地 use case

  • 电商虚拟展厅:跨境电商平台可利用 PanoWorld 将商品 3D 模型放入实时生成的全景环境中,消费者通过简单平移浏览不同场景组合,无需实地搭建展厅,极大降低展示成本。
  • 全球教育内容制作:在线教育机构可快速生成历史或地理主题的沉浸式虚拟实地考察视频,学生通过平移探索古罗马街道或热带雨林,提升互动教学效果。

局限

  • **相机轨迹约束与视角局限**:PanoWorld 依赖**固定朝向(fixed heading)** 将全景相机轨迹简化为纯平移,这限制了模型只能处理水平扫描式运动,无法应对含旋转或俯仰的真实自由轨迹。对于多数现实应用(如第一人称 VR 漫游),视角旋转不可避免,因此该方法对非全景、多视角视频生成的泛化能力存疑。论文并未提供在非全景输入下如何适配的讨论,导致其世界模型的主张在当前阶段仅适用于窄定义的全景平移场景。
  • **长序列记忆的稳定性与效率**:尽管 **GMA(Geometry-aware Memory Augmentation)** 设计了置信度门控融合,但在极长序列(数百步)下,记忆累积的几何误差和生成漂移问题未得到充分验证。实验主要基于 World360 的剪辑片段,单条轨迹长度有限,而现实全景重建常需数分钟连续生成,此时模型的长程一致性、回环闭合能力尚不清楚,且推理时的记忆缓存策略可能带来高计算开销。
  • **数据集覆盖与真实分布差异**:World360 虽结合了实拍无人机全景与 AirSim360 模拟数据,但实拍数据可能以户外开阔场景为主,室内、密集结构或动态物体场景的代表性不足。模拟数据虽可生成精确轨迹但存在 synthetic-to-real 域差距,削弱了模型在真实应用中的物理一致性。此外,论文未讨论对高速运动或剧烈光照变化的鲁棒性,这些因素在实际部署中常见且敏感。
论文Haoyuan Li2026-07-10原文

相关内容