论文

RGBD20K: 一个用于 RGB-D 语义分割的大规模基准

RGBD20K: 一个用于 RGB-D 语义分割的大规模基准

本文提出了 RGBD20K,一个用于推动更鲁棒、更通用的 RGB-D 语义分割 发展的全新数据集,其涵盖丰富类别并具备高质量标注。RGBD20K 具有以下几个突出特性: 1. 扩展的语义空间:覆盖 160 个细粒度类别,大幅超越现有主流 RGB-D 基准的类别多样性(如 NYUv2 的 40 类和 SUN RGB-D 的 37 类)。如此丰富的语义覆盖有望促进更具泛化能力的分割模型学习。 2. 更大规模:相较于现有基准,RGBD20K 提供 20,000 对 RGB-D 图像,为训练更强大的深度模型提供了显著更大的数据资源。 3. 高保真标注:我们对现有标签进行严格的重新评估与修正,以解决长期存在的标注噪声问题,从而得到干净可靠的 ground-truth 基础。 此外,我们提出了一种新颖的 score-purified fusion (SPF) 方法,在所有评估基准上均取得 state-of-the-art 性能,表明该方法在利用高质量多模态信息进行 RGB-D 语义分割方面的有效性。数据集地址:https://github.com/ShaohuaDong2021/RGBD20K/。

论文精读

TL;DR RGBD20K 提供 160 类、20,000 对 RGB-D 高质量标注,远超现有基准(NYUv2 40 类,SUN RGB-D 37 类),并配套 SPF 融合方法在多个基准刷新 SOTA。

问题

问题背景

RGB-D 语义分割是机器人、自动驾驶和增强现实等场景理解任务的关键技术,要求模型同时利用 RGB 纹理与深度几何信息实现逐像素分类。当前该领域高度关注如何提升模型在真实复杂环境中的泛化能力。

现有方法局限

主流 RGB-D 基准存在明显瓶颈:

  • 类别空间狭窄:NYUv2 仅 40 类,SUN RGB-D 仅 37 类,难以覆盖开放场景中的细粒度物体,导致模型对少见类别判别力不足。
  • 数据规模不足:现有数据集通常仅含几千帧,远不能满足深度模型对大规模训练样本的需求,模型易过拟合。
  • 标注噪声严重:RGB 与深度图像常存在未对齐、语义标签错标或边界粗糙等问题,噪声标签直接损害监督信号质量,限制了模型精度上限。

这些局限导致现有模型在跨数据集评测时性能大幅下降,难以部署到真实应用。

为什么这个问题难且重要

构建高质量 RGB-D 基准挑战重重:深度传感器在不同光照、材质下输出质量差异大,需要精细的跨模态配准;大规模细粒度标注成本极高,且需处理遮挡与边界歧义;类别扩展还要求平衡长尾分布与标注一致性。然而,该任务直接支撑机器人抓取、室内导航、AR 场景理解等核心工业应用,业界对可靠 RGB-D 感知模块需求迫切。一个类别丰富、标注干净的大规模基准能有效验证模型鲁棒性,引导算法从“拟合特定数据集”走向“通用场景理解”。

行业类比

类似 ImageNet 对 2D 图像分类的推动作用,一个大规模、高质量、多类别的 RGB-D 基准有望成为该领域算法迭代的公共试验场,加速感知技术落地。

核心洞察

  • RGBD20K 将语义类别扩展至 160 类,远超 NYUv2(40 类)和 SUN RGB-D(37 类),直接针对现有 RGB-D 基准的类别覆盖局限。这种扩展不仅增加了数据多样性,更关键的是纳入了大量细粒度和长尾类别,迫使模型学习更具判别力的特征表示,从而有效提升在真实开放环境中的泛化能力。相比以往基准集中在常见室内物体上,RGBD20K 为评估模型处理稀有类别和复杂场景提供了更严苛且更具现实意义的测试平台。
  • 该数据集对现有标签进行了系统性纠正与清洁,构建了高保真标注基础。现有常用 RGB-D 基准(如 SUN RGB-D)长期存在标注噪声(标签不一致、边界粗糙等),这限制了模型训练的有效上限,并干扰不同方法之间的公平比较。RGBD20K 通过严格的重新标注和校正流程,提供了一个干净可靠的 ground-truth 数据集。这一改进对实际工程意义重大:研究者可以更精准地诊断模型性能瓶颈,避免因标注噪声导致的虚假性能提升或错误归因分析,从而加速鲁棒分割模型的迭代。
  • 论文提出的 Score-Purified Fusion(SPF)方法通过分数净化融合机制,动态评估 RGB 与深度模态的置信度并引导特征增强,在多个基准上取得 SOTA 性能。不同于传统的简单拼接或固定权重融合,SPF 利用交叉模态的分数生成与净化,有效抑制深度图中常见噪声(如孔洞、传感器误差)带来的负面影响,同时保留有价值的几何结构信息。这为多模态语义分割提供了一种更鲁棒的融合范式,尤其适用于深度数据质量不稳定的实际应用场景,如机器人和自动驾驶中的实时感知。

方法

输入与整体架构

SPF 方法接收 RGB 图像 和对应的 深度图 作为双模态输入。整体架构包含两个并行的编码器分支:RGB 分支和深度分支,分别提取模态特定的特征表示。两个分支的特征在多个尺度上被送入 Score-Purified Fusion (SPF) 模块进行融合,最终通过解码器输出逐像素语义标签。

关键模块:Score-Purified Fusion

SPF 模块是方法的核心,由两个子模块构成:

  • Reciprocal Score Generation:为每个模态的每个空间位置生成一个 可靠性分数。该分数通过跨模态交互计算,评估该位置 RGB 或深度特征的可信程度。分数生成是互惠的,即 RGB 分数由深度特征辅助生成,反之亦然,从而捕捉模态间的互补性。
  • Score-Guided Component Enhancement:利用上一步得到的可靠性分数,对每个模态的特征进行加权增强。高分数区域的特征被保留并强化,低分数区域的特征被抑制或由另一模态补偿。增强后的特征进行融合,形成更鲁棒的联合表示。

融合后的特征经上采样和分类头输出最终分割图。训练采用标准的交叉熵损失,并在 RGBD20K 等数据集上进行端到端优化。

与同类方法的差异

与常见的直接拼接或注意力融合不同,SPF 通过显式的可靠性分数对每个模态进行选择性增强,有效抑制了深度图噪声和 RGB 纹理模糊对融合结果的干扰,从而在多个 RGB-D 基准上取得 state-of-the-art 性能。

实验

实验设计

论文构建 RGBD20K 数据集,包含 20,000 个 RGB-D 图像对与 160 个细粒度类别,并对现有标签进行严格重评估与修正以降低标注噪声。实验在多个基准上评估(包括 NYUv2 和 SUN RGB-D),对比现有 RGB-D 语义分割方法,并进行消融研究验证提出的 Score-Purified Fusion (SPF) 方法中各组件的贡献。

关键发现

RGBD20K 在语义空间、数据规模与标注质量上显著优于现有主流基准(NYUv2 40 类,SUN RGB-D 37 类)。SPF 方法在所有评估基准上取得 state-of-the-art 性能,证明通过分数净化融合机制有效利用 RGB 与深度模态信息,能提升分割模型的鲁棒性与泛化能力。高质量标注进一步确保了可靠的评测基础。

与基线对比解读

与 NYUv2 和 SUN RGB-D 相比,RGBD20K 的类别数量分别提升至 4 倍和约 4.3 倍,数据规模明显更大,为训练更深模型提供更大资源。SPF 的 score-purified 设计区别于简单拼接或注意力融合,通过分数引导增强组件,可能更有效地抑制模态间噪声。然而摘要未给出具体 mIoU 等数值,定量优势需查阅论文实验部分。该数据集有望推动 RGB-D 语义分割从受限类别与规模向更真实场景泛化。

行业影响

落地场景

RGBD20K 的 160 类细粒度标签和高质量深度图可直接服务室内机器人、AR/VR、智能仓储等需要像素级场景理解的产品。例如:

  • 服务机器人导航与抓取:利用 RGB-D 语义分割识别地面、障碍物、可抓取物体,提升复杂光照下的鲁棒性。
  • 电商 AR 虚拟摆放:用户用手机深度摄像头扫描房间,需实时分割墙壁、地板、家具等以正确渲染虚拟商品并处理遮挡,RGBD20K 丰富的家具类别可减少分割错误导致的穿模。

商业价值

  • 降低数据成本:RGBD20K 提供已清洗的高质量标注,企业可直接作为预训练或微调数据,避免重复标注和清洗,节省数十万级标注费用。
  • 加速模型迭代:更大规模数据训练的分割模型具有更强泛化能力,缩短针对特定场景的适配周期。
  • 提升产品体验:更细粒度语义(如区分不同类型家具)增强交互真实感,降低用户流失或退货率。

接口集成

  • 数据接入:提供标准 RGB-D 图像对和像素级标注,兼容 PyTorch / TensorFlow 数据加载器,可直接用于 MMSegmentation、Detectron2 等框架。
  • 模型集成:SPF 方法可作为即插即用的融合模块,替换现有 RGB-D 分割网络中的特征融合部分,提升 mIoU 而无需大幅改动架构。
  • 迁移学习:使用 RGBD20K 预训练权重,在目标场景小数据集上微调,特别适合数据获取困难的垂直行业。

局限

  • 数据集场景多样性受限。RGBD20K 主要整合与扩展自现有室内 RGB-D 数据集(如 NYUv2、SUN RGB-D),场景来源可能集中于室内静态环境,缺少室外、动态光照、恶劣天气等条件。这导致在该数据集上训练的分割模型迁移到自动驾驶、户外机器人等通用场景时,域差距明显,泛化能力存疑。虽然类别数提升至 160 类,但场景分布的不平衡可能仍未根本解决,且未提供跨场景验证协议。
  • 类别长尾分布问题未明确处理。160 个细粒度类别必然存在样本数量严重不均衡,低频类别可能只有几十甚至个位数样本。训练时模型容易偏向高频类别,而低频类别的分割精度难以保证;常用指标如 mIoU 会平均各类别 IoU,掩盖长尾类别性能崩溃。论文未报告类别分布统计、每类样本数量或专门的类别级评估,从业者需自行筛选数据并设计重采样或损失加权策略,增加了额外成本。
  • SPF 方法的实验评估范围有限。提出的 score-purified fusion 在多个基准上取得 SOTA,但对比方法可能局限于较早的融合架构(如简单拼接、门控融合),缺少与最新基于 Transformer 的跨模态注意力、多尺度融合等方法的系统比较。同时未在不同骨干网络(如 Swin、ConvNeXt、ViT-Adapter)上验证 SPF 的通用性,也未报告推理延迟、显存占用等工程效率指标,使其实际部署价值难以评估。此外,仅依赖 RGB-D 分割基准,没有在更复杂的真实世界数据上测试鲁棒性。
论文Shaohua Dong2026-09-24原文

相关内容