论文

Image2Sim: 通过生成式神经模拟器实现可扩展的具身导航

Image2Sim: 通过生成式神经模拟器实现可扩展的具身导航

具身导航旨在构建能够解释多模态目标、在3D空间中进行推理并在现实世界中可靠到达目的地的智能体。然而,其进展仍受限于缺乏可扩展、高保真且物理真实的可交互环境。真实世界扫描数据集虽具备视觉真实感,但规模有限;反之,合成模拟器更易扩展,却常存在较大的sim-to-real差距。 本文提出 Image2Sim,一种实时神经模拟框架,能够从带有姿态的 RGB-D 图像序列 构建高质量交互环境。其核心思想是解耦3D空间锚定与逼真观测合成。在场景构建中,Image2Sim 采用前馈特征高斯模型,一次性将带有姿态的 RGB-D 观测提升为3D特征-高斯表示。在渲染中,我们提出几何感知单步像素流模型,将稀疏且嘈杂的高斯投影转换为高质量的 全景 RGB-D 观测。 Image2Sim 同时可作为完全自动化的具身数据引擎,大规模生成高保真观测、可执行指令及多样化导航指令。它将大量视频与图像转换为近 20K 个交互场景,并合成超过 1000万 个导航训练样本。完全在这些神经环境中训练的导航模型在主要基准上取得显著提升,并能有效迁移到现实零样本场景。 这些结果表明,可扩展的神经模拟可作为具身导航规模化训练的实际基石。

论文精读

TL;DR Image2Sim 将 3D 场景构建与逼真渲染解耦,从 RGB-D 图像实时生成交互式神经模拟器,规模化产出千万级导航训练样本,模型可零样本迁移至真实世界,显著缩小 sim-to-real 差距。

问题

问题背景

具身导航(Embodied Navigation)旨在构建能理解多模态指令、在三维空间中推理并可靠到达目标的智能体。随着大模型驱动的视觉语言导航(VLN)快速发展,对大规模、多样化训练环境的需求日益迫切。

现有方法局限

目前两类主流模拟环境均存在瓶颈:

  • 真实扫描数据集(如 Matterport3DHabitat)提供逼真视觉外观,但采集成本极高,场景数量与多样性严重受限,无法覆盖长尾环境分布。
  • 合成模拟器(如 AI2-THORiGibson)易于程序化扩展,但其渲染质量与真实世界存在明显 sim-to-real gap,导致策略迁移时性能骤降。 这些方法无法同时满足高保真度可扩展性物理交互性三个核心需求,阻碍了泛化能力的提升。

技术挑战与重要性

问题的核心在于三维场景构建逼真观察生成的耦合:传统神经渲染(如 NeRF)虽能合成高质量新视角,但渲染速度慢且不易编辑交互;显式表示(如点云、网格)则缺乏真实感。解耦空间锚定与图像生成,在保证实时交互的同时维持视觉保真度,是当前的研究焦点。业界关注该问题,是因为解决它可以直接赋能机器人、增强现实等应用,用低成本生成的无限数据替代昂贵的真实采集。

行业类比

这类似于自动驾驶中利用生成式世界模型产出海量 corner-case 训练样本,从而减少对实车路测的依赖,加速算法迭代并提升长尾场景覆盖。

核心洞察

  • **3D 空间锚定与逼真渲染的解耦** 是 Image2Sim 实现实时交互式神经模拟的核心思路。与 NeRF 等隐式场景表征不同,Image2Sim 先用前馈 3D Gaussian 从单次 RGB-D 输入中构建稀疏几何锚点,再通过 **Geometry-Aware One-Step Pixel Flow** 模型一步生成高质量的 dense 观测,避免了传统逐点查询或多步扩散的高延迟。这种解耦让模拟器既能保持几何一致性,又能大幅提升渲染效率,解决了神经模拟难以兼顾保真度与实时交互的长期矛盾。
  • Image2Sim 提供了一个**全自动的具身数据引擎**,可从普通视频和图像中批量构建交互场景并合成导航轨迹与指令。现有真实扫描数据集规模有限且采集成本高,合成模拟器又存在 sim-to-real gap。该框架将海量非结构化的RGB-D数据直接转化为近2万个可交互场景与超过1000万条训练样本,使纯神经模拟数据训练的导航模型在真实世界零样本任务中取得显著提升,证明了利用神经模拟扩展具身智能训练数据的可行路径。

方法

输入与总体管线

Image2Sim 以稀疏的有姿态 RGB-D 图像序列为输入,通过解耦的空间锚定观察合成两阶段,实时生成可交互的 3D 环境与导航训练数据。整体管线分为:场景构建 → 渲染 → 模拟 → 指令生成,最终输出面向具身导航的高保真观测、可执行动作及自然语言指令。

场景构建:前馈特征高斯模型

该模块将多视角 RGB-D 帧一次性提升为 3D 特征高斯表示,核心包括:

  • 法线估计:从深度图提取表面几何,增强空间一致性。
  • 双流特征提取与融合:分别处理 RGB 和深度,融合后与姿态信息结合,生成携带语义特征的高斯点云。
  • 前馈设计:无需逐场景优化,单次前向传播即可构建场景,显著加速数据生成。

渲染:几何感知单步像素流模型

针对稀疏高斯投影的噪声和空洞,提出一步式像素流渲染器

  • 语义对齐器:将高斯特征投影到目标相机坐标系,并校正跨视角的语义偏移。
  • 像素流解码器:结合alpha-门控跳跃连接和深度瓶颈,从带噪声的投影中直接预测最终 RGB 和深度图像,避免昂贵的多步融合或体积渲染。
  • 损失函数:训练时采用 L1、感知损失及深度监督,确保纹理和几何的真实感。

运动模拟与自动标注

  • 可导航区域提取:对渲染的深度图进行去噪与拓扑分析,构建几何感知图
  • 运动学闭环模拟:在图中采样轨迹,生成连续动作序列,并利用碰撞避免实现物理合理性。
  • 多模态指令生成:通过全局物体挖掘与 3D 接地,为轨迹自动标注多样化导航指令,扩展训练信号。

差异点

与传统神经模拟器(如基于 NeRF 或在线优化的 3DGS)相比,Image2Sim 解耦了场景几何与外观生成,并采用单步像素流渲染取代体积渲染或多迭代优化,在保持渲染质量的同时实现实时性,且能全自动从 RGB-D 视频生成大规模交互式训练环境。

实验

实验设计

Image2Sim 的实验围绕神经模拟器的渲染质量导航模型的跨域泛化 展开。首先在新视角合成任务上评估渲染保真度(表1);随后在多个具身导航基准(R2R, REVERIE, SOON)上,对完全在 Image2Sim 环境中训练的导航模型进行零样本评估(表2-3)。还设置了数据缩放实验(10M+ 轨迹)验证性能随仿真数据量的提升,并消融渲染组件的贡献。最后在真实办公楼环境下部署,检验 sim-to-real 迁移。

关键发现

  • 实时高保真渲染:Geometry-Aware One-Step Pixel Flow 能从稀疏高斯投影一步生成全景 RGB-D,PSNR/SSIM/LPIPS 接近可微渲染,且满足实时性。
  • 强零样本泛化:在神经场景中训练的导航模型直接部署到 Habitat-Sim 或真实环境,成功率大幅提升,视觉逼真度有效缩小 sim-to-real 差距。
  • 数据规模收益持续:合成轨迹从 1M 增至 10M,导航性能持续提升,未饱和,展现可扩展潜力。
  • 解耦设计有效:前馈 3D 高斯与像素流渲染解耦优于一体化重建,几何感知对齐对消除渲染伪影至关重要。

与基线的深度对比

传统路径依赖有限的高保真扫描(如 Matterport3D)或程序化合成(如 Gibson),前者规模受限,后者视觉质量差导致 sim-to-real 失败。Image2Sim 从视频/图像生成神经场景,兼顾真实视觉与规模。与需重优化的 NeRF 类世界模型不同,其解耦结构实现一次性前馈推理,支撑实时交互。实验表明,纯神经环境训练的模型在真实世界指标上可超越有限扫描训练的模型,凸显 可扩展神经仿真作为具身训练基底的实用价值

行业影响

核心落地场景

Image2Sim 将真实世界的 RGB‑D 序列直接转化为高保真、可交互的 3D 环境,并自动生成导航指令与动作数据。这一技术可快速嵌入三类产品线:

  • 机器人导航训练:家用服务机器人、仓储 AGV、巡检无人机等需要大量场景进行避障与路径规划训练,Image2Sim 能以低成本构建高度逼真的仿真环境。
  • 自动驾驶仿真:从道路视频片段生成交互式 3D 场景,用于端到端导航策略预训练。
  • 内容平台与电商:将商品展示视频转为可自由漫游的沉浸式虚拟展厅,或为 AR/VR 应用快速生成环境。

商业价值评估

  • 降本增效:传统手动构建一个高保真 3D 仿真场景需要数天,Image2Sim 全自动流水线可将大批量视频转化为近 2 万个交互场景,极大降低内容制作与数据标注成本。
  • 加速迭代:生成的 1000 万+ 训练样本使导航模型在主流基准上显著提升,且具备零样本真实世界迁移能力,减少了真实场景调试的耗时与硬件损耗。
  • 体验升级:对于电商或内容平台,逼真的虚拟漫游体验可提升用户停留时长与转化率,形成新的增长点。

与现有工作流的接口

Image2Sim 作为一个数据生成引擎,可轻松接入现有仿真与训练栈:

  • 输入为常见的 posed RGB‑D 序列,可来自手机、机器狗、监控录像等。
  • 输出为标准化的可交互仿真场景(基于 Gaussian 表示)及配套的导航数据,能直接导入 Habitat、Isaac Sim 等仿真框架进行策略训练。
  • 自动生成的指令‑动作对与现有模仿/强化学习训练管线兼容,无需修改核心算法。

具体落地用例

  1. 仓储物流机器人:物流仓库内的监控摄像机或机器蛇采集的 RGB‑D 视频,经 Image2Sim 一键生成整个仓库的高逼真仿真环境,并批量生成拣货、运输等导航任务。叉车 AGV 先在仿真中训练 100 万步,再零样本部署至真实仓库,大幅缩短现场调试周期。
  2. 电商虚拟展厅:家居电商将沙发、灯具的 360° 展示视频输入 Image2Sim,实时构建可交互的 3D 展厅。用户在虚拟空间中自由行走、查看商品细节,后台同步收集用户移动路径数据,反哺推荐算法,提升转化率。

局限

  • **输入数据要求严格**:Image2Sim 依赖具有精确位姿的 RGB-D 序列来构建场景,这在实际部署中可能成为瓶颈。深度传感器的可用性和精度、相机位姿估计的鲁棒性都会直接影响最终环境质量。对于缺少深度通道或位姿噪声较大的消费级视频,方法可能失效,限制了从互联网海量非标定数据中构建场景的可能性。
  • **渲染保真度与域外泛化**:虽然 **Geometry-Aware One-Step Pixel Flow** 模型能在已知场景分布下高效生成高质量全景图,但当测试场景与训练数据分布差异较大(如极端光照、透明物体、反射表面)时,渲染质量可能下降,产生模糊或伪影。论文未充分评估这些边缘情况对下游导航策略训练稳定性的影响。
  • **缺乏动态交互建模**:当前框架主要构建静态场景的导航环境,不支持动态障碍物、移动行人、可操作物体等具身交互中常见的动态元素。这使得生成的训练数据与现实世界的复杂动态场景存在固有 gap,导航模型在动态环境中可能性能退化。将动态仿真集成到神经渲染管线中是未来重要挑战。
论文Zihan Wang2026-07-07原文

相关内容