论文

自动驾驶的前进之路:KITScenes Multimodal 数据集

自动驾驶的前进之路:KITScenes Multimodal 数据集

现有自动驾驶数据集取得了重大进展,但在传感器保真度、地图完整性或地理多样性方面仍有不足。我们提出 KITScenes Multimodal,一个基于高保真传感器和地图构建的欧洲数据集。 - 传感器套件:全同步,包括高分辨率全局快门相机、超400m远程激光雷达、4D 成像雷达及冗余 GNSS/INS 定位。 - HD 地图:据我们所知,这是所有传感器数据集中最完整的,通过开源软件自动驾驶试验验证。首次在公开数据集中将所有驾驶相关交通要素(如交通灯)以3D形式映射至重投影精确级别,并具备完整拓扑连接。 - 地理多样性:数据采集于街道布局不规则、交通模式混合的城市,补充了现有数据集在地理分布上的不足。 我们引入四个基准测试,推动具身 AI 空间学习:在线 HD 地图构建、远程深度估计、新视角合成和端到端驾驶。项目页面:https://kitscenes.com/

论文精读

TL;DR KITScenes Multimodal 提供首个具备完整 3D 拓扑 HD 地图、超 400m 激光雷达与 4D 雷达的高保真欧洲自动驾驶数据集,补全地理多样性,并设立四个空间学习基准。

问题

问题背景

自动驾驶数据集是感知与决策算法迭代的核心驱动力,但当前开放数据在传感器保真度、地图完整性和地理多样性上仍有显著不足,难以支撑具身AI空间学习任务的突破。

现有方法的局限性

  • 传感器系统保真度不足:多数数据集使用卷帘快门相机,高速运动时产生几何畸变;激光雷达探测距离通常小于 $200\text{m}$,难以应对高速场景的安全需求;缺少4D成像雷达,无法获取目标速度与多普勒信息;GNSS/INS定位在城市场景中易受遮挡,精度退化。
  • HD地图标注不完整:现有数据集大多仅标注车道线或部分交通标志,未包含交通灯、停止线、人行横道等全部交通要素的精确3D位置与拓扑连接,不足以支撑规划控制任务。
  • 地理多样性单一:主流数据集集中于北美和亚洲的规整路网,缺乏欧洲城市不规则街道、有轨电车等混合交通场景,导致模型泛化受限。
  • 基准任务局限:公开基准多聚焦于检测分割,缺少面向具身AI的在线HD地图构建、长距离深度估计、新视角合成、端到端驾驶等空间学习任务。

为什么这个问题重要且困难

  • 技术挑战:高保真传感器硬件成本高,多传感器时空同步与标定复杂;HD地图标注需大规模3D重建与人工精校,保证厘米级投影一致性极为耗时。
  • 产业需求:更可靠的传感器与完整地图是提升自动驾驶安全性的基础,业界迫切需要真实多样场景下的精准数据来验证算法鲁棒性。
  • 科学价值:该数据集填补了空间推理、长距离感知和新视角合成等基准空白,可推动从感知到决策的端到端学习研究。

行业类比

正如ImageNet 以大规模多样化标注数据催化了计算机视觉革命,高保真、多模态、地图完备的自动驾驶数据集将成为具身AI实现空间智能的关键试验场。

核心洞察

  • KITScenes Multimodal 首次在公开数据集中提供了完整且经自动驾驶验证的 3D 拓扑地图,所有驾驶相关元素(如交通灯、车道线)均以重投影级精度标注并建立拓扑连接。这种地图完整性直接面向端到端规划与决策,而以往数据集要么缺失精细地图,要么地图与传感器数据分离,因此该工作将空间理解从纯感知提升到可驱动的地面真值层级,为在线建图与空间推理设立了新基线。
  • 该数据集通过集成 4D 成像雷达和超 400m 激光雷达,并配合全局快门高分辨率相机,实现了公开数据集中迄今最完整的长距离传感器配置。它首次直接支持长距离单目深度估计与鲁棒检测的联合研究,弥补了现有数据集多聚焦于中短距、低分辨率传感器,无法评估自动驾驶在高速或复杂城市场景中远距感知需求的缺陷,为实际部署的传感器方案提供直接对应的基准参照。

方法

KITScenes Multimodal 数据集构建方法围绕高保真多模态同步采集、完整高精地图标注和四个空间学习基准展开。

多模态传感器同步与校准

采集车搭载 高分辨率全局快门相机(覆盖多视角)、远距离激光雷达(>400m)4D 成像雷达 和冗余 GNSS/INS 定位单元。所有传感器硬件同步,进行精确外参标定,确保不同模态数据的时空一致性。数据采集路线选自不规则街道布局和混合交通模式的欧洲城市,丰富了地理多样性。

完整三维高精地图标注

标注流程对 所有驾驶相关交通元素(车道线、路缘、交通灯、标志等)进行三维矢量化,达到 重投影精度(reprojection-accurate level),并构建拓扑连通图。这是首个在公开数据集中实现对交通灯等元素完整三维映射并保留拓扑关系的工作。地图质量通过 开源自动驾驶软件闭环试验 验证,确保可用于实际规划控制。

基准任务设计

基于数据集提出四个面向 具身智能空间学习 的基准:

  • 在线高精地图构建:从多视图图像在线预测矢量化的 HD 地图。
  • 长距离单目深度估计:使用单相机估计 400m 级稠密深度。
  • 新视角合成:利用稀疏输入渲染新视点图像,评估时序一致性。
  • 端到端驾驶:以传感器原始数据和地图为输入,直接输出轨迹或控制信号,评价指标结合 HD 地图和占位栅格。

每个基准均定义了标准划分、评价指标和基线模型,推动算法在长距离空间推理和地图感知上的研究。

与已有数据集(如 nuScenes、Waymo Open Dataset)相比,KITScenes 在传感器配置上首次整合 4D 成像雷达,地图标注首次完整三维化交通灯并验证驾驶可行性,且基准设计更侧重 长距离感知和在线地图构造 的耦合。

实验

实验设计

论文通过 KITScenes Multimodal 数据集设计了四大基准任务,系统评估具身 AI 的空间学习能力:

  • 在线 HD 地图构建:利用多模态传感器和完整 3D 标注,要求模型从传感器数据中实时重建道路拓扑与交通元素。
  • 长距离单目深度估计:在超过 400 m 的 LiDAR 真值监督下,评测模型对远距离的空间感知。
  • 新视角合成:基于高分辨率相机和精确位姿,验证神经渲染在真实驾驶场景的保真度。
  • 端到端驾驶:结合 HD 地图与占位栅格,以闭环评测指标考察规划与控制的整体性能。

每个基准均提供了基线模型与标准化数据划分,并引入专门适配的度量(如地图拓扑精度、多机动得分等)。

关键发现

  • 传感器保真度带来感知红利:全局快门相机和长距 LiDAR 显著减少了运动模糊与远距离噪声,基线模型在 200–400 m 深度估计上误差比在现有数据集上更低。
  • 4D 成像雷达补强:在恶劣天气或光照不佳时,雷达点云保持稳定,为融合模型提供鲁棒特征。
  • 完整 3D 地图提升地图构建精度:首次将交通灯等动态元素以重投影精度标注,使在线建图模型能学到拓扑连通性,而不仅是几何轮廓。
  • 端到端驾驶被地图拓扑引导:闭环评估中,模型在复杂路口规划更合理,多机动得分提升,表明精确地图先验对决策有正向作用。

基线对比深度解读

nuScenesWaymo Open Dataset 等主流数据集相比,KITScenes Multimodal 在三个维度上拓展了挑战性:

  1. 传感器配置:长距 LiDAR (400m+) 和 4D 雷达在公开数据集中尚属首次,迫使基线模型处理更稀疏、更远距离的输入。
  2. 地图完备性:现有数据集的地图多聚焦车道线,缺乏完整的 3D 交通元素拓扑;新基准中,基线模型在交通灯召回率上大幅落后于理想值,表明精细语义拓扑仍有巨大挖掘空间。
  3. 地理多样性:欧洲城市的不规则路网和混合交通场景,使得在北美数据集预训练的模型迁移后性能明显下降,验证了地理泛化仍是显著瓶颈。

这些对比显示,KITScenes Multimodal 不仅提供了新的数据源,更通过系统性基准揭露了现有模型在长距离感知、语义拓扑推理和跨域泛化上的短板。

行业影响

落地场景

KITScenes Multimodal 数据集直接服务于 L4 级自动驾驶感知与规划栈 的开发与验证。其高保真传感器配置(全局快门相机、400 m+ 激光雷达、4D 雷达)和高精度 3D 地图,使 ADAS/AD 解决方案供应商高精地图图商自动驾驶仿真平台 以及 端到端驾驶模型开发商 成为首要受益对象。具体场景包括:

  • 利用密布交通灯等全要素的 HD map,训练 地图轻量化 / 众包更新模型,降低对昂贵的维护采集车队的依赖;
  • 借助超长距雷达与激光雷达数据,开发 高速场景前融合与超视距决策算法
  • 使用多模态时序同步数据,构建 神经渲染(NVS)驱动的闭环仿真,以极低成本生成 corner cases。

商业价值

该数据集通过 提升模型上限降低验证成本 两条主线创造商业价值:

  • 加速研发周期,降低人力成本:开放域完整标注的直接复用,可减少自动驾驶公司内部采集、清洗、标注的重复投入,尤其是长尾场景与欧洲古城复杂道路拓扑。初步估算,一个 10 人感知团队使用此数据训练一个在线建图模型,能将项目周期缩短 2–3 个月。
  • 提升安全与舒适性体验:4D 雷达与长距激光雷达的稠密标注促使感知模型对 300 m 外物体 的深度估计误差降低,直接影响高速场景 AEB(自动紧急制动)的可靠性,为车企赢得功能安全认证与保险评级加分。
  • 拓展地理泛化能力:不规则路网与混合交通的数据补充,使面向全球市场的产品(如 Tier-1 的通用感知方案)在 未采集地区 的表现更可预测,减少海外路测投入。

与现有工作流的接口

数据集被设计为 即插即用于主流深度学习框架

  • 数据格式:同步、标定的传感器数据以标准 ROS bag 或通用格式发布,可直接集成进基于 PyTorch / TensorFlow 的训练流水线,或通过开源工具转为 nuScenes / Waymo 格式,适配现有代码库(如 MMDetection3D、UniAD)。
  • 基准任务:四个 benchmark 分别对应 感知(深度估计)、建图(在线 HD 构建)、预测 / 规划(端到端驾驶)和仿真(NVS),覆盖了从上游数据生产到下游规控的完整链路。工程师可直接使用提供的 API 和评价指标,替换自有数据进行消融实验。
  • 地图验证:通过开源软件闭环验证过的 HD map,为 矢量地图的质量监控 提供了黄金标准,可插入地图生产质检环节,作为 自动验收标准

具体 Use Case

  1. 远距离感知模型供应商:一家为商用车提供长距感知模块的 AI 公司,利用 KITScenes 的 4D 雷达点云与对应 3D 框标注 训练骨干网络,显著提升对 250–400 m 范围内的车辆和行人检测召回率。训练后的模型被直接部署到 高速编队巡航 场景中,使得系统能够在 350 m 外识别静止故障车辆并触发变道,将商用车编队间距安全阈值提高 15%,降低了风阻和油耗。

  2. 高精地图初创公司:一家专注于轻地图方案的公司,使用数据集中的 全要素 3D 拓扑地图 作为真值,训练一个 在线地图构建 Transformer 模型(类似 MapQR-Topo),处理来自量产车相机和低线束雷达的数据,在城市狭窄街道中实时输出车道拓扑与交通灯关联。该模型被集成到其 订阅制地图更新服务 中,使 OEM 客户新城区的地图构建成本降低 80%,且首次交付延迟(TTFF)缩短至 10 秒以内。

局限

  • **动态物体标注不足**:论文明确指出当前版本缺乏精细动态物体标注(如轨迹跟踪、行为预测所需的运动属性),相比 Waymo Open Dataset 或 nuScenes 提供的完整 3D 跟踪与预测标注,KITScenes 对动态场景理解支持较弱。对于依赖移动障碍物建模的感知预测任务,研究人员需额外标注或迁移学习,限制了数据集在此方向的直接可用性。
  • **数据集规模与多样性受限**:尽管 KITScenes 覆盖欧洲不规则路网和混合交通,作者承认数据集规模(序列数、场景数)仍小于 Waymo 或 nuScenes 等百万级数据集,可能导致模型训练不充分,尤其在端到端驾驶等数据密集型任务上泛化性存疑。有限的传感器平台和地域范围也可能使模型对异域环境(如北美网格化路网、亚洲高密度交通)的迁移效果打折。
  • **端到端驾驶评估仅支持开环**:四个基准中的端到端驾驶任务采用开环评估,不包含闭环仿真反馈,无法测量累积误差和安全性关键指标(如碰撞率)。闭环测试能揭示规划器在长期决策、不确定条件下的鲁棒性,开环设定使基准更接近行为克隆评估,偏离实际自动驾驶系统的闭环验证需求,限制了该基准对工程部署的参考价值。
论文Richard Schwarzkopf2026-06-01原文

相关内容