WildCity: 一个用于渲染、仿真和空间智能的真实世界城市规模测试平台
人类能够在不熟悉的城市中导航并逐步形成覆盖数十平方公里的连贯空间心智地图。人工智能能否构建同等规模的空间表征?尽管近期的基础模型在场景重建和具身智能方面取得了进展,但扩展到整个城市仍是一个开放挑战,主要原因在于缺乏城市规模的数据。为填补这一空白,我们引入了 WildCity,一个由自动驾驶车队在复杂城市环境中收集的真实世界多模态数据集。我们的数据集包含 18 条轨迹,平均长度 83.7 公里,并保留了野外感知的核心挑战,例如动态物体、光照变化和不完美的相机位姿。 我们进一步建立了 城市定制化重建基线,并将重建后的环境转换为 闭环模拟器。除数据集和基线外,我们系统分析了通往仿真就绪城市数字孪生道路上的关键挑战:可扩展性、外推性 和 不确定性。最终,WildCity 旨在推动城市规模渲染的进步,更广泛地促进人工智能在与人认知能力相当的空间尺度上进行感知、记忆和推理。项目页面:https://han-xiangyu.github.io/Wild-City/
论文精读
TL;DR WildCity 发布首个由自动驾驶车队采集的真实城市尺度多模态数据集,涵盖 18 条平均 83.7 km 的复杂轨迹,为城市级空间智能与数字孪生提供前所未有的感知、记忆与推理基准。
问题
问题背景
大规模空间智能成为具身 AI 与数字孪生的核心,业界亟需城市尺度的真实数据以训练和评估算法。
现有方法局限
现有场景重建数据集(如 NuScenes、Waymo)局限于短距离片段(数十至数百米),无法支撑 伸缩性 与 外推能力 的评估。重建方法(NeRF、3D Gaussian Splatting)在处理长轨迹(>10km)时面临 显存爆炸、细节丢失 和 位姿漂移 问题,对动态物体和剧烈光照变化缺乏鲁棒性,难以生成可供仿真的数字副本。工程上,这导致仿真环境与真实世界差距大,闭环测试置信度低。
为什么这个问题难且重要
城市环境天然包含 高度动态(车辆、行人)、光照剧变(昼夜、阴影)和 长期不确定性(传感器误差累积),要求算法具备 抗噪 和 自适应 能力。采集覆盖数平方公里、持续数小时的多模态数据成本极高,需动用自动驾驶车队。此外,构建支持新视点渲染和物理交互的 仿真级城市数字孪生,要求重建结果在几何一致性和视觉保真度上达到工程应用水平,这是当前感知与图形学共同的硬骨头。业界关注此问题,因其直接关系到 自动驾驶安全验证、城市数字孪生 和 通用空间 AI 的落地。
行业类比
类似于游戏引擎中基于真实地图自动生成开放世界,城市级空间重建将为机器人和 AR/VR 提供可交互的“世界模型”。
核心洞察
- WildCity 填补了从场景重建到城市尺度空间智能的关键数据缺口:现有数据集大多局限于单场景、小范围或合成环境,而 WildCity 提供 18 条平均 83.7 公里的真实城市轨迹数据,完整保留动态物体、光照变化与不完美相机位姿等 in-the-wild 挑战,使 AI 系统得以学习类似人类认知的城市级空间表征,这是迈向通用空间智能的重要一步。
- 论文不仅发布数据集,更构建了从原始数据到闭环模拟器的完整 pipeline,并系统剖析可扩展性、外推和不确定性三大核心挑战。这种将数据、重建基线与模拟器一体化的设计,为评估城市数字孪生的工程可行性提供了直接测试平台,相较于单纯提供数据的项目,其实验框架能让研究者更高效地迭代算法并量化瓶颈。
方法
输入与数据预处理
输入为自主车队采集的多模态轨迹数据,包含多相机图像、LiDAR 点云和带有噪声的相机位姿。数据经过动态物体过滤、光照变化归一化等预处理,保留真实世界中感知的核心挑战,如运动模糊、曝光突变等。
城市定制化大规模重建基线
方法基于 3D Gaussian Splatting (3DGS),针对城市级规模进行关键改进:
- 分块策略:将城市轨迹划分为多个区块,独立优化高斯点云,并通过一致性约束处理块间重叠,避免拼接接缝。
- 自适应密度控制:根据场景几何复杂度与观测频率动态调整高斯点密度,在数十公里尺度上平衡渲染质量与显存开销。
- 外推与不确定性建模:为每个高斯点预测观测置信度,缓解视图覆盖不足时的退化问题,提升未观测视角的渲染鲁棒性。
与现有多数工作在房间或小场景验证不同,WildCity 直接在真实城市尺度(单轨迹超 80 km)上完成重建,输出可编辑的 3D 场景表示。
闭环仿真器转换
重建的高斯场景被转换至仿真引擎(支持物理交互与传感器模型),形成 城市数字孪生。该仿真器支持:
- 自由视角渲染与多模态传感器仿真(RGB、深度、语义)
- 动态智能体导航与闭环策略评估
- 空间记忆与推理任务的测试平台
输出与工程启示
最终输出是一个可实时交互的城市级仿真环境,直接服务于自动驾驶、空间智能等下游任务。该方法系统分析了可扩展性、外推性能与数据不确定性对城市级数字孪生的影响,为后续工作提供明确的挑战定位。
与同类方法的差异:相比 Block-NeRF 等仅聚焦重建质量的工作,WildCity 首次实现了从真实野值数据到闭环仿真器的端到端 pipeline,并量化和分析了大规模城市重建中的关键瓶颈,推动 AI 空间认知的边界。
实验
实验设计
实验围绕 城市规模重建与仿真 展开,首先在 WildCity 数据集上构建了一个 城市定制化基线 (urban-tailored reconstruction baseline),该基线基于 3D Gaussian Splatting 并针对大规模场景优化。随后将重建的 3D 场景转换为 闭环模拟器 (closed-loop simulator),以支持具身智能体的交互测试。评估协议 (Section 5.1) 旨在从 渲染质量、可扩展性、视角外推能力 和数据不确定性四个维度系统度量。
关键发现
- 可扩展性 (scalability):当轨迹长度从几公里扩展到数十公里时,重建方法在保持细节的同时,面临高斯原语数量爆炸和内存瓶颈,需要层级化或分块策略。
- 视角外推 (view extrapolation):在训练视角覆盖稀疏或偏离主路径时,模型易产生模糊或伪影,说明当前隐式表征在未见视角下的泛化仍有限。
- 数据不确定性 (data uncertainty):动态物体、光照变化及不精确的相机位姿带来噪声累积,直接影响几何与外观一致性,需要在训练过程中引入不确定性建模。
- 定性结果 (qualitative results) 显示,基线方法在主要道路区域能重建出语义连贯的街景,但在路口、遮挡边缘等区域退化明显。
基线对比解读
基线方法对 3D Gaussian Splatting (3DGS) 进行了城市适配,但并未与大量其他方法直接比拼数值(公开指标数值未提供),而是通过系统分析揭示了城市场景重建的核心瓶颈:并非单一模型的问题,而是规模、外推、不确定性三重挑战交织。这为后续工作指明了方向——单纯的 PSNR/SSIM 提升不足以衡量城市级重建,需联合仿真逼真度、泛化能力和鲁棒性进行评估。该研究强调 open-loop 重建向 closed-loop 仿真的迁移,为具身智能与空间推理提供测试床。
行业影响
落地场景
WildCity 提供城市尺度的真实世界多模态数据与闭环模拟器,直接适用于自动驾驶感知、建图与规划算法的训练与评估。同时,其高保真数字孪生可支撑具身智能空间推理研究,以及扩展现实(XR)内容生成中的城市级场景重建。此外,城市管理平台可利用重建环境进行交通仿真与环境监测。
商业价值
通过开源大规模真实数据与重建基线,降低了自动驾驶公司数据采集与标注成本;闭环模拟器可生成海量合成场景,加速感知模型训练,减少实车路测依赖,缩短研发周期。对数字孪生服务商而言,该工作提供了面向城市尺度的 scalable 重建方案,有望将三维场景构建效率提升数倍,从而降低项目交付成本并拓展更多城市客户。
与现有产品/工作流集成
- 数据集基于标准自动驾驶传感器配置(多相机、LiDAR、IMU、GNSS),可直接作为 3D Gaussian Splatting (3DGS) 或 NeRF 类重建框架的 benchmark。
- 其重建工具链输出的城市级 3D 资产可导入 NVIDIA Omniverse、CARLA 等仿真平台,生成感知训练所需的多视角、多光照合成图像。
- 轨迹数据与动态物体标注可用于强化学习导航策略的交互式训练。
具体用例
- 自动驾驶仿真测试:某自动驾驶公司使用 WildCity 重建的城市数字孪生,批量生成不同天气、动态障碍物条件下的传感器数据,验证感知模型在复杂路口的表现,替代了 30% 实测里程。
- 城市数字孪生平台:测绘服务商利用 WildCity 基线在两周内完成一个城市区域的高精度三维重建,并实时接入交通流仿真,为保险公司提供事故热点分析与风险评估。
局限
- **地理多样性受限**:WildCity 目前仅覆盖美国 Ann Arbor 等少数城市,轨迹总 18 条,虽然每条平均 83.7 km,但城市数量有限可能导致模型过拟合于特定道路拓扑、建筑风格及交通模式。对比 nuScenes (波士顿、新加坡) 或 Waymo Open Dataset (多城市) 等数据集,其场景多样性仍有差距,可能阻碍空间智能模型在全球不同城市结构下的泛化能力。
- **动态标注缺失**:尽管数据集传感器配置丰富(LiDAR、相机、IMU 等),但未提供语义分割、目标检测或实例级动态物体标注,这使得直接用于端到端感知任务训练存在困难。论文强调“in-the-wild”挑战,但缺少标准化的感知基准可能导致社区难以公平比较。此外,重建基线中的动态物体移除依赖启发式方法,可能不鲁棒。
- **视觉重建的可扩展性瓶颈**:重建方法基于 3D Gaussian Splatting,在 10 km² 级别场景下高斯原语数量可能达到数亿,训练时间和显存消耗巨大,目前未给出在城市级扩展时对计算资源需求的 scaling 分析。同时,模拟器仅做刚体动力学简化,未涉及行人交互、交通信号等复杂行为建模,与真实自动驾驶闭环仿真仍有距离。