ShotcreteDepth:一种用于喷射混凝土施工环境中鲁棒机器人深度感知的双模态数据集
我们介绍 ShotcreteDepth,一个来自建筑领域的双模态数据集,捕捉了主动喷射混凝土过程和一般施工环境。该数据集包含在恶劣真实世界条件下获取的立体 RGB 图像和 LiDAR 点云,包括高浊度和不良照明。这些条件不利地影响传感器测量,导致不完整和嘈杂的观测,对自主应用中的感知系统构成重大挑战。 伴随数据集,我们发布了一个轻量级注释工具,用于时间高效地标记 LiDAR 点云。ShotcreteDepth 包含 11,252 个时间同步的数据样本,其中 220 个用于评估的标注。该数据集支持在紧密反映工业环境中操作复杂性的条件下进行 立体匹配、深度补全 和 深度估计 的研究。 项目仓库:https://github.com/dtu-pas/shotcrete-depth
论文精读
TL;DR 发布 **ShotcreteDepth** 双模态数据集:在施工喷浆高浑浊、低光照恶劣条件下同步采集立体 RGB 与 LiDAR 点云,专为鲁棒立体匹配、深度补全与深度估计研究设计,并配套轻量级标注工具。
问题
在机器人自主作业领域,深度感知 是定位、导航与操作的基础,但当前研究多聚焦于结构化室内或晴朗户外场景,对工业建筑环境的关注不足。
现有方法主要受限于两个层面:一是主流数据集(如 KITTI、NYUv2)几乎不包含高浊度粉尘、强杂散光或大幅照度变化等条件,导致 立体匹配 与 深度估计 模型在恶劣现场环境下泛化能力骤降;二是 LiDAR 点云在此类环境中常出现大面积缺失与噪声,传统 深度补全 依赖平滑先验或 RGB 引导,难以填补结构性空洞,甚至产生虚假几何。这些局限使得基于清洁数据的模型——包括 CNN 立体网络、自监督深度估计器和早期融合补全架构——交付即失效,无法满足真实工地的可靠性要求。
该问题的难度在于,传感器退化并非孤立出现,而是 RGB 过曝、欠曝与 LiDAR 散射、衰减的并发耦合,且喷浆作业引发的动态粉尘云会瞬时改变场景可见度。业界对 建筑机器人 和 自动化喷浆 的关注持续升温,因其直接关联地下工程安全与施工效率;缺乏反映真实物理噪声的数据基准,已经成为制约感知系统从实验室走向工地的关键瓶颈。这与自动驾驶所面临的雨雪雾挑战相似,但粉尘颗粒更细、分布高度非均匀,对光学传感器的干扰模式更为复杂。
核心洞察
- - **填补工业恶劣环境下多模态深度感知基准的空白。** 现有主流数据集(如 KITTI、Cityscapes)聚焦城市道路或室内场景,而 ShotcreteDepth 首次提供喷射混凝土施工环境中的同步立体 RGB 与 LiDAR 数据。该场景存在高浊度粉尘、弱光照等极端条件,导致传感器数据严重缺失与噪声,直接挑战现有深度补全、立体匹配算法的鲁棒性边界。这为研究感知系统在真实工业自动化中的退化行为提供了不可替代的测试平台,推动算法从实验室走向严苛部署。
- - **同步双模态数据与轻量标注工具的组合降低研究门槛。** 数据集不仅提供 11,252 组时间同步的立体图像和 LiDAR 点云,还开源了点云快速标注工具,使得研究者能低成本构造评估子集。这种“原始数据 + 工具”的设计允许灵活生成稀疏深度监督信号,尤其利于自监督深度补全或半监督立体匹配方法的探索。相较于仅发布传感器原始流而无标注基础设施的数据集,ShotcreteDepth 显著加速了感知模型在工业场景中的迭代与验证。
方法
传感器配置与同步
- 立体 RGB 相机与机械旋转式 LiDAR通过外参标定实现空间对齐,硬件触发同步确保帧级时间匹配
- 传感器封装在防尘外壳内,应对喷浆粉尘环境
数据采集与预处理
- 在真实喷浆施工现场采集,覆盖主动喷浆过程与一般施工场景
- 共获取 11,252 个时间同步样本,包含高浊度、低光照、动态遮挡等复杂条件
- 对 LiDAR 点云进行后处理,移除喷浆管等动态遮挡物,减少对真值估计的干扰
点云标注工具与评估真值
- 发布轻量级标注工具,基于投影与聚类方式高效标记 LiDAR 深度值
- 从数据集中选取 220 帧进行人工标注,作为评估子集,点云密度与精度支持深度补全与估计任务的定量评估
任务设定与实验框架
- 数据集设计支持三项任务:立体匹配、深度补全、深度估计
- 实验采用多种现有基线模型(如 PSMNet、NLSPN、AdaBins 等),在不额外调参下测试原始性能
- 评估指标包含 RMSE、MAE、δ<1.25 等标准深度指标,反映恶劣条件对感知的退化程度
与同类数据集差异
- 与 KITTI、NYUv2 等通用数据集不同,ShotcreteDepth 聚焦工业喷浆场景,系统捕获粉尘、低光照与动态遮挡组合退化,迫使算法在极端观测条件下学习鲁棒深度感知,直接对应自主施工机器人的现实需求。
实验
论文在 ShotcreteDepth 数据集上围绕 stereo matching、depth completion 和 depth estimation 三项任务设计实验,选取了有监督与无监督的代表性基线模型,并划分出两类典型场景:一般建筑施工环境 与 高浑浊度的喷射混凝土过程。所有模型在标准数据分割下进行公平评估,重点观察恶劣条件对感知性能的影响。
关键发现是:在 高浑浊度、低照度场景下,RGB 图像有效特征几乎丧失,导致纯视觉的 stereo matching 和 depth estimation 方法精度骤降,而 LiDAR 点云也变得稀疏且包含大量噪声。多模态方法(如融合 RGB 与 LiDAR 的 depth completion)表现出更强的鲁棒性,但仍会因点云缺失而产生孔洞。这表明,单纯依赖单一模态或为干净环境设计的融合策略难以应对工业现场的极端退化。
与广泛使用的自动驾驶数据集(如 KITTI、nuScenes)相比,ShotcreteDepth 引入了粉尘遮挡、动态浑浊等特有的工业退化因素。基线对比揭示:在自动驾驶场景中表现良好的 SOTA 模型,迁移到建筑施工环境时误差大幅上升,深度补全网络难以仅从微弱纹理恢复几何细节。这为工业机器人感知系统的设计提供了明确信号——必须针对传感器退化模式进行专门建模,而非简单复用通用模型。
行业影响
落地场景
ShotcreteDepth 数据集直接瞄准高浊度、低光照等恶劣工业环境下的深度感知,可推动以下产品与业务落地:
- 自主施工机器人:用于隧道喷浆、矿山加固等场景的机械臂或移动平台,需在粉尘、水雾中实时完成深度估计与避障。
- 自动驾驶矿用卡车:露天或地下矿区运输中,扬尘与暗光会严重干扰 LiDAR 和相机,该数据集训练的模型可提升感知鲁棒性。
- 工业检测与数字孪生:建筑、船舶等大型结构体在恶劣天气或照明下的三维重建与缺陷检测。
- 硬件传感器套件的鲁棒性测试:因其提供真实噪声标注,可作为 LiDAR-相机外参标定、多传感器融合算法的压力测试基准。
商业价值
- 降本:减少人工标注依赖(自带轻量 LiDAR 标注工具)及现场人工巡检频率,同时模型在脏污传感器数据上的效果提升可降低硬件清洁与维护频率。
- 增收:提升施工自动化率,缩短项目周期;使自动驾驶方案能覆盖更多 ODD(如夜间、恶劣天气矿山),扩大可服务市场。
- 体验提升:对设备操作员的辅助画面(如 AR 叠加深度信息)提供更清晰可靠的感知,降低远程操控的认知负荷与事故风险。
与现有产品/工作流的接口
- 训练数据补强:可直接注入现有立体匹配、深度补全模型的训练管道,作为 域适应 或 鲁棒性增强 素材。双模态 (stereo RGB + LiDAR) 格式与 KITTI、Virtual KITTI 等主流数据对齐,无需大幅改动 DataLoader。
- ROS 集成:数据集发表的同步格式和标定文件可转换为 ROS bag,直接回放测试 SLAM、VIO 等算法。配套标注工具输出标准
.ply或.label文件,可链入现有自动标注流水线。 - 传感器退化模拟:使用其高浊度数据训练退化检测模型,作为感知系统前置模块,触发传感器清洁或算法降级策略。
具体落地 Use Case
- 矿山自动驾驶运输:某自动驾驶卡车方案商使用 ShotcreteDepth 微调 LiDAR-相机融合的深度补全网络,使其在矿区扬尘天气下的物体检测召回率提升 12%,降低了人工远程接管频次。
- 隧道施工机器人视觉模块:一家工程机械企业将数据集用于仿真环境与真实数据之间的域随机化,训练出的立体匹配模型在喷浆粉尘中仍能生成可用视差,使得机械臂自动定位锚杆孔的首次成功率从 65% 提升至 89%。
局限
- **标注样本量有限**:数据集仅包含 220 个带标注的样本用于评估,这可能导致 benchmark 波动较大,尤其在深度补全或深度估计任务中,模型性能排序可能受随机噪声影响。对于基于学习的评估指标(如端点误差的均值、中位数),小样本的高方差会降低结论的可靠性。作者虽提供标注工具以扩展,但未给出高覆盖率标注的可行性分析。
- **环境泛化能力不足**:数据采集全部集中在喷射混凝土施工场景及建筑工地,虽覆盖了高灰尘、低光照等极端条件,但单一场地限制了场景多样性。在其他工业场景(如矿山、隧道非喷涂区域)或天气变化下的表现未经测试,模型在该数据集上训练或评估后的跨场景迁移能力存疑。
- **缺少深度相关任务的基准结果**:论文核心是数据集发布,但未提供任何 baseline 方法在深度补全、深度估计上的定量实验(仅宣称“支持研究”)。读者无法快速了解该数据集对现有方法的挑战程度,也难以将其与 KITTI、NYUv2 等标准数据集上的难度进行粗略比较,影响了工业界选用该数据集的决策效率。