论文

ABot-Earth 0.5: 生成式3D地球模型

ABot-Earth 0.5: 生成式3D地球模型

我们提出 ABot-Earth 0.5,一个生成式3D框架,旨在从广泛存在的地理参考卫星图像中合成大规模无缝的3D环境。为此,我们提出了一种直接基于 3D高斯泼溅(3DGS) 表示的新颖生成模型。该模型在真实世界城市重建的多样化语料库上训练,学习生成逼真的几何形状和纹理。 在推理时,模型仅凭卫星图像即可合成新颖的3D场景,可扩展速率达到每平方公里不到10分钟,同时展现卓越的真实感。框架设计注重可访问性,集成了分层的 细节层次(LOD) 结构,允许在网络地图引擎上进行实时交互可视化。 这个高保真模拟沙盒有效缓解了 仿真到现实(sim-to-real) 领域差距,支持关键的下游具身AI应用,如闭环无人机导航。通过提供超低成本和高效解决方案,ABot-Earth 0.5显著降低了大规模3D重建的技术和财务门槛,推动全球数字地球可视化的未来。

论文精读

TL;DR ABot-Earth 0.5 以 3D Gaussian Splatting 原生生成模型,仅需卫星图像即可在 10 分钟内合成平方公里的逼真 3D 场景,支持实时交互,大幅降低大规模重建成本并赋能具身 AI 与数字地球可视化。

问题

大规模 3D 场景生成

全球数字孪生与 Embodied AI(如 UAV 闭环导航)迫切需要可实时交互、高仿真的大范围 3D 环境。卫星影像 作为唯一全球连续覆盖的数据源,成为实现 planetary-scale 重建的关键输入。

现有方法局限

  • 传统摄影测量与显式建模:依赖密集多视角图像和深度恢复,成本高、耗时长(城市级重建需数周),无法泛化到数据稀疏区域,且缺乏生成能力。
  • NeRF 类隐式场:虽然可实现 photorealistic 重建,但训练和渲染开销大,难以集成 web 地图引擎,且不原生支持 LOD 结构,无法在消费级设备实时交互。
  • 2D 生成模型升维:基于卫星图用扩散模型生成单一视角图像,再拼接成 3D,缺乏空间一致性,易产生几何扭曲和接缝。
  • 上述方法均无法在10 分钟/平方公里量级实现从卫星影像到可直接交互的高质量 3D 场景,难以支撑大规模部署。

技术挑战与业界关注

  • 跨模态条件生成:卫星图(俯视、低分辨率)到高分辨率 3D 场景(含遮挡下的立面细节)映射存在严重信息缺失,需模型学会强先验。
  • 无缝大场景合成:滑动窗推理时,相邻图块必须保持几何与纹理连续,传统生成模型常产生边界伪影。
  • 实时交互:全球尺度场景要求原生 层次细节(LOD) 和高效空间索引,否则无法在 web 端流畅渲染。
  • 业界(如 Google Earth、Microsoft Flight Simulator)长期寻求低成本自动化方案,生成式+3DGS 的组合正成为新范式。

行业类比

类似 自动驾驶仿真 中通过生成模型自动构建大规模郊区/城市路网以弥补真实采集缺口,ABot-Earth 为空中具身智能(UAV 导航)提供了可泛化的“生成式沙盒”。

核心洞察

  • 将生成式建模直接构建在3D高斯泼溅(3DGS)显式表示之上,而非中间神经场,是兼顾生成效率与实时渲染的关键架构创新。与依赖NeRF或隐式场的生成方法相比,3DGS原生表示避免了渲染时的体积查询开销,使生成结果天然具备可交互性,且能无缝集成到现代图形管线。这一选择让模型不仅能生成逼真的几何与纹理,还能在推理后直接输出支持LOD与Web端实时可视化的场景,大幅压缩了从生成到应用的技术栈。
  • 以卫星图像作为唯一条件输入,通过滑动窗口生成无缝衔接的大范围三维场景,突破了传统多视图重建对图像重叠率和拍摄角度的强依赖。相比于需要密集航拍或街景数据的SfM/MVS流程,该方法仅利用广泛可得的卫星图,即可在10分钟内合成平方公里级城市模型,实现了极低的数据获取成本与极高的覆盖效率。其跨域适应模块进一步提升了面对不同卫星源时的生成鲁棒性,为全球尺度三维重建提供了可扩展的轻量方案。
  • 系统内建的多层次细节(LOD)结构与Web地图引擎的深度整合,从设计之初就将生成式三维内容与交互式应用闭环打通。不同于多数生成模型仅关注输出质量,ABot-Earth 0.5同时设计了空间索引、地理对齐和渲染调度机制,使得生成结果可直接服务于具身智能仿真,如无人机闭环导航。这种从原始数据到可操作虚拟环境的全链路设计,降低了AI模型在三维世界中测试和部署的工程门槛,为虚实迁移提供了高保真沙箱。

方法

ABot-Earth 0.5 的方法核心是以原生 3D Gaussian Splatting (3DGS) 生成模型直接合成三维场景,绕开传统多视图重建。流程为:输入 → 条件生成 → 3DGS 解码 → 多 LOD 输出。

输入与条件生成

  • 输入为地理参考卫星影像(多立体像对),通过编码器提取空间对齐的特征图。
  • 生成模型采用类似 latent diffusion 的架构,但作用在 3DGS 参数空间:从特征图采样噪声,逐步去噪,直接预测每个 3D 高斯体的属性(位置、协方差、颜色、不透明度)。
  • 训练时,使用大规模真实城市 3DGS 重建数据作为监督,损失函数结合渲染图像与真值图像的 L1/LPIPS 损失,以及几何一致性正则项。

关键模块设计

  1. 滑动窗口无缝推理:大范围场景被划分为重叠瓦片,每片独立生成后,通过高斯体融合与边界一致性约束消除接缝,保证空间连续。
  2. 内建多 LOD 解码:模型输出时直接附带层次化 3DGS 参数,低 LOD 对应稀疏高斯,高 LOD 逐步增加细节,无需后处理即可适配 web 地图引擎实时渲染。
  3. 跨域适应:通过微调编码器的域对齐模块,使模型对不同卫星传感器和光照条件鲁棒,仅需少量目标域样本。

输出

生成具有几何、纹理的 3DGS 场景,支持实时交互。整体推理速度低于 10 分钟/平方公里,远快于传统显式重建。

与主流三维重建(如 NeRF、传统 MVS)不同,ABot-Earth 0.5 将重建转化为条件生成任务,直接从卫星影像预测 3D 表示,无需多视图匹配、点云融合等阶段性处理,极大降低了大规模场景生产的计算与人工成本。

实验

实验设计

本文未采用公开三维数据集,而是自建多源城市重建语料库:从多立体卫星图、航空摄影、城市三维重建中收集真实场景,再通过 ABot-3DGS 管线获取高质量 3D Gaussian Splatting 表示作为训练样本。生成模型以该 3DGS 表示直接建模,条件仅需地理配准的卫星图像。评估围绕生成忠实度(几何、纹理质量)、系统适用性(空间覆盖、效率、视觉美观、开放性)以及地标增强混合策略展开。定量指标着重推理吞吐(千米级耗时)与 web 端实时交互的 LOD 支持。

关键发现

  1. 极低条件生成:仅凭卫星图即可合成完整 3D 场景,推理速度 <10 min/km²,相比传统重建方案成本骤降。
  2. 实时可交互:内建层次化 LOD 结构无缝接入 WebGL 地图引擎,用户可在浏览器中自由漫游、缩放,且保持高帧率。
  3. 跨域鲁棒性:通过域适应模块,模型对未见地理区域仍能输出合理几何与纹理,有效缩小 sim-to-real 差距,直接支撑 UAV 闭环导航等具身 AI 任务。
  4. 开放体系:提供 API 与渲染管线 EarthScape,降低大规模数字地球可视化门槛。

基线对比

与主流 3D 重建流程(如传统多视角立体匹配或单独场景的 NeRF/3DGS)相比,ABot-Earth 的生成范式不再依赖目标区域的大量航拍数据采集,显著提升泛化效率;推理速度比典型城市级重建快数个量级。然而,当前版本未与其它 3D 生成模型(如 DreamFusion、CityDreamer)进行数值化指标(PSNR、FID 等)对比,生成质量评估以定性展示为主。在极端细节(如小物体边缘)上可能弱于专有重建方法,但其在规模化、实时性与降本上的综合优势为地球级三维重建开辟了新范式。

行业影响

落地场景

ABot-Earth 0.5 以卫星影像为唯一条件,快速生成大面积、无缝的3D高斯泼溅场景,可直击以下业务领域:

  • 自动驾驶仿真:替代传统手工建模,按需生成城市级三维环境,加速感知与规控算法迭代。
  • 无人机物流:为低空航线规划与视觉导航提供厘米级真实感三维底图,降低实地采集成本。
  • 游戏与XR:快速产出开放世界地图,结合LOD层级实现实时渲染,缩短关卡制作周期。
  • 智慧城市:基于过境卫星图像快速更新城市三维数字底座,支撑规划、应急等决策。

商业价值

核心价值在于大幅降低大规模三维重建的时间与资金成本

  • 降本:传统倾斜摄影或激光扫描每平方公里成本可达数万至数十万美元,且工期以月计;ABot-Earth 每平方公里<10分钟推理,硬件依赖低,成本下降两个量级。
  • 增效:生成式模型可覆盖无数据区域,省去外业采集,加速项目交付。
  • 体验提升Web端实时渲染无缝多LOD结构,让非专业用户也能流畅交互,拓展数字孪生应用受众。

与现有产品/工作流的接口

ABot-Earth 输出标准化3DGS数据,易于集成进现有管线:

  1. 地理配准:生成结果直接对齐全球坐标系统(已内置Georeferencing),可无缝叠加到CesiumMapbox等WebGIS引擎,或导入Unreal EngineUnity作为仿真素材。
  2. 管道集成:通过滑动窗口推理多源域适应,可订阅卫星影像瓦片服务,自动化生成/更新三维图层,嵌入现有地图生产流水线。
  3. 下游扩展:提供3DGS原生生成架构,方便团队在生成结果上微调,加入动态物体、语义标签,对接具身智能训练框架(如NVIDIA Isaac Sim)。

具体落地用例

  • 自动驾驶端到端仿真:某自动驾驶公司需验证感知模型在雨夜城市路口的性能。直接输入目标区域最新卫星图,10分钟内生成全要素三维场景,注入动态交通流天气,快速构建Corner Case测试集,单场景建图成本从数万美元降至近乎为零。
  • 无人机配送网络规划:物流商计划在郊区新建起降点。利用ABot-Earth从历史卫星存档中生成高精度三维地形,模拟信号遮挡与降落路径,结合强化学习优化航路,无需现场勘测,单点评估耗时由3天压缩至2小时。

局限

  • **训练数据覆盖场景有限**:模型在**城市重建数据**上进行训练,因此对于非城市地貌(如森林、沙漠、海洋)的生成能力未经系统评估。这限制了其作为全球数字地球模型的完整性,在应用到非城市区域时可能产生失真或几何退化。
  • **条件模态单一导致细节缺失**:推理仅依赖**卫星图像**作为条件,缺少多视几何或高程等显式信息。这可能导致对建筑物立面、植被内部结构等遮挡区域的几何生成不准确,难以还原精细纹理,尤其在倾斜或近地视角下易暴露生成缺陷。
  • **实时渲染的 LOD 连贯性未充分验证**:模型集成了**层级细节(LOD)结构**以支持实时交互,但不同细节层次切换时的视觉连贯性、几何拓扑一致性尚未通过严格实验量化。极端缩放操作可能暴露生成基元的粗糙边界或不连续纹理,影响仿真的真实感。
论文Ming Qian2026-06-08原文

相关内容