论文

WorldRover: 用于世界探索的带丰富标注的可扩展合成视频数据引擎

WorldRover: 用于世界探索的带丰富标注的可扩展合成视频数据引擎

学习生成或重建可探索世界,需要视频不仅对应 RGB,还需相机运动、场景几何、时间对应乃至交互控制信号。真实采集难以同时提供密集几何与长程对应,而渲染可直接给出这些量,但现有合成数据很少在保持视角与外观可控改变的同时组合它们。 WorldRover 应运而生,是一个生成丰富标注、长时间探索数据的数据引擎。其核心 WorldRover-Engine 基于 Unreal Engine,可执行并离线渲染分钟级路线,完整保留轨迹与场景几何。同一探索可用第一人称、第三人称及 360 全景相机在不同环境状态下重放。基于该引擎构建的 WorldRover-10M 数据集,将 RGB 与度量深度、相机轨迹及动作信号配对;第三人称子集额外提供稠密光流、长程 2D/3D 点轨迹(含可见性)及区别于相机轨迹的角色轨迹。 该引擎还能以中性白色材质渲染穿越过程,保持路线与几何不变。WorldRover 将长视界世界探索转化为可扩展的数据生成问题,为构建、维护并回访可探索世界一致表示的模型提供监督信号。

论文精读

TL;DR WorldRover 基于 Unreal Engine 生成含度量深度、相机轨迹、动作信号、光流和长程点跟踪等标注的长时域探索序列,支持同一路径多视角重放与环境变化,将世界探索转化为可扩展的监督数据生成问题。

问题

问题背景:学习生成或重建可探索世界,要求视频数据不仅包含 RGB 外观,还需配对相机运动、场景几何、时间对应和交互控制信号。

现有方法局限:

  • 真实拍摄虽可提供部分信号,但密集深度和长程点跟踪通常依赖多视角重建或专用传感器(如 LiDAR),成本高且存在噪声与标定误差。
  • 现有合成渲染数据集往往只输出单一视点或有限标注,无法在同一帧上同时提供深度、光流、长程 2D/3D 跟踪,也缺乏对同一路线在不同视点(第一人称、第三人称、360° 全景)和环境状态(光照、材质)下的可重复渲染。
  • 数据长度通常受限于短视频片段或手工资产,不足以覆盖分钟级长距离探索。

为什么难/重要:

  • 难点在于需要构建一个支持离线渲染、动态光照、多相机配置和并行调度的引擎管线,并保证轨迹与几何在多次渲染中严格一致;同时需生成轨迹衍生的动作信号,并分离角色轨迹与相机轨迹。
  • 业界对交互式世界模型、动态 4D 重建和生成式渲染的关注日益增长,这些模型迫切需要大规模、多模态、长时程的视频监督来学习空间记忆、规划和重访能力。WorldRover 将长时程世界探索转化为可扩展的数据生成问题,填补了这一空白。

行业类比:如同自动驾驶仿真平台通过合成传感器数据训练感知与规划模型,WorldRover 为通用世界模型提供了可控、可扩展的探索视频数据。

核心洞察

  • WorldRover-Engine 通过离线渲染管线在同一帧上直接产出 metric depth、dense optical flow、long-range 2D/3D point tracks 等密集几何对应,避免真实数据中依赖深度传感器或运动恢复结构带来的估计误差和覆盖范围限制。与现有合成数据集通常只提供单一模态(如深度或分割)的做法不同,该引擎从场景几何和完整轨迹计算标注,确保了跨帧一致性和长程跟踪的完整性,为需要精确空间监督的世界模型提供了可靠训练目标。
  • 同一探索路径可在第一人称、第三人称、360 全景相机以及不同环境状态或中性白色材质下重放,保持路线和场景几何不变,生成成对的多视角多外观数据。这种受控重放能力是现有合成资源极少具备的:它允许模型显式学习跨视角一致性和外观不变性,同时为生成式渲染和动态 4D 重建提供可对比的监督信号,推动解耦表示与可控生成的研究。

方法

WorldRover 数据引擎基于 Unreal Engine 构建,将长距离世界探索转化为可扩展的合成数据生成问题。输入为艺术家创建的 3D 环境资产与探索轨迹定义;输出为多视角、多模态的注册视频序列。

编辑器端:资产准备与轨迹生成

  • 资产摄取:导入高质量 3D 场景,支持后续风格化。
  • 场景风格化:可切换不同环境状态(光照、天气等)或覆盖中性白色材质,用于外观不变性研究。
  • 轨迹生成:定义角色移动路径与相机运动,生成可重放的探索路线,保存完整轨迹。

服务器端:离线渲染与标注提取

  • 多视角渲染:同一探索轨迹由 第一人称、第三人称 和 360° 全景 三种相机离线渲染,支持不同环境状态重放。
  • 动态光照:保持渲染一致性,输出 EXR 格式帧,每帧包含多个配准栅格层。
  • 标注提取:从渲染管线直接提取 度量深度、相机轨迹、动作信号;第三人称子集额外提取 稠密光流、2D/3D 点轨迹(含可见性)和独立于相机的角色轨迹。
  • 并行调度与恢复:支持大规模分布式渲染,失败自动重试,确保长序列完整生成。

输出数据集:WorldRover-10M

每个序列包含配准的 RGB 视频、深度、相机/角色轨迹及动作流,第三人称子集提供光流和长距离点轨迹。

与同类方法差异:WorldRover 在同一渲染帧上整合了深度、光流、点轨迹、动作等多模态监督,并支持多视角、多环境状态的一致性重放,这是以往合成视频数据集很少同时满足的。

实验

实验设计

WorldRover-Engine 基于 Unreal Engine 构建,离线渲染分钟级探索路线,完整保存相机轨迹与场景几何。同一探索可在第一人称、第三人称和 360° 全景相机下重放,并支持不同环境状态(如光照)与中性白色材质。利用该引擎构建 WorldRover-10M 数据集,序列包含 RGB、metric depth、相机轨迹、动作信号;第三人称子集额外提供密集光流、2D/3D 长距离点轨迹及可见性,并区分角色轨迹与相机轨迹。

关键发现

  • 引擎能够从多视角渲染同一路线,保持 route 与 geometry 不变,从而提供一致的多模态监督。
  • 数据规模达 10M 级别,覆盖多样场景、外观与角色,为长程世界探索模型提供训练基础。
  • 直接渲染获得真值深度、对应关系与动作信号,避免真实采集中的估计误差或专用设备依赖。
  • 360° 全景视角支持更全面的环境理解,助力生成式渲染与 4D 重建任务。

与基线对比

现有合成资源通常只提供 RGB 与少量注解(如深度或光流),很少在同一帧上同时组合密集几何、长距离对应与受控视角/外观变化。WorldRover 将渲染管线系统化,统一输出多模态真值,并把“探索世界”转化为可扩展的数据生成问题,为需要构建、维护并重访一致世界表示的下游模型提供直接监督。

行业影响

落地场景

WorldRover 的多视角、富标注视频序列适合训练需要长期空间一致性的模型。典型场景包括:

  • 具身智能:机器人导航与操作模型可复用其第一人称轨迹和动作信号,无需真实遥操作数据。
  • 自动驾驶仿真:360 全景和深度数据为 BEV 感知、占用网络提供密集监督。
  • 视频生成与交互式媒体:可控制相机路径、环境状态的世界探索数据支持可交互视频生成和虚拟制作。

商业价值

  1. 降本:合成数据替代昂贵、受限的真实采集(如激光雷达、动捕),且支持反复渲染不同环境状态,大幅降低数据获取成本。
  2. 增收/体验提升:高质量标注(稠密光流、长程点轨迹)直接提升下游模型性能,帮助客户更快交付可靠的世界模型、数字孪生产品。
  3. 加速研发:离线渲染管线支持并行调度,可短时间生成 10M 级样本,缩短模型迭代周期。

与现有工作流接口

WorldRover 可通过以下方式集成:

  • 输出标准 EXR 帧与 JSON 元数据,兼容现有 ML 数据加载器(如 torch.utils.data.Dataset)。
  • 基于 Unreal Engine 的管线可对接企业已有的 3D 资产库、仿真环境(如 Isaac Sim、CARLA)。
  • 生成的多模态标注可直接用于监督训练或作为伪标签,与现有自监督预训练流程结合。

具体用例:一家自动驾驶公司可将 WorldRover 的 360 全景 + 深度数据加入其感知模型训练集,补充 corner case 场景;一个电商平台可利用可探索场景生成商品在不同环境的展示视频,减少实拍成本。

局限

  • - **合成域与真实域的差距**:WorldRover 依赖 Unreal Engine 渲染的 artist-built 环境,虽然支持外观变化和中性白模,但光照、材质、纹理和动态效果与真实世界视频仍有明显差异。模型直接迁移到真实场景时可能面临域偏移,尤其对于深度估计、光流等 low-level 任务,合成数据训练的模型在真实数据上往往性能下降。论文未提供在真实基准上的零样本上游验证,难以量化域差距的实际影响。
  • - **标注覆盖不均衡**:根据摘要,dense optical flow 和 long-range 2D/3D point tracks 仅在第三人称子集中提供;第一人称和 360 全景视角可能缺失这些关键对应标注。这限制了用户无法在这些视角上直接训练需要密集匹配或跟踪的模型,而第一人称视角正是许多 embodied AI 和 SLAM 任务最常见的输入。若需获得这些标注,可能需重新渲染或通过第三方推理,增加成本。
  • - **动态场景交互与物理真实性有限**:WorldRover-Engine 离线渲染固定轨迹,虽然可以改变环境状态和材质,但缺少动态物体(行人、车辆、流体等)和实时物理模拟,难以覆盖真实世界探索中常见的遮挡、碰撞和动态变化。与一些基于游戏引擎或仿真器(如 CARLA、Habitat)的数据集相比,其在动态交互和闭环控制信号方面的支持较弱,限制了其在交互式世界模型或强化学习任务中的直接应用。
论文Xiaojie Xu2026-08-16原文

相关内容