论文

DF3DV-1K: 面向无干扰新视角合成的大规模数据集与基准

DF3DV-1K: 面向无干扰新视角合成的大规模数据集与基准

辐射场领域的进展已实现逼真的新视角合成。在多个领域中,大规模真实世界数据集已被构建,以支持全面基准测试并促进超越场景特定重建的进步。然而,对于无干扰辐射场,仍缺乏一个包含每场景干净与杂乱图像的大规模数据集,这限制了其发展。为填补这一空白,我们引入了 DF3DV-1K,一个大规模真实世界数据集,包含 1,048 个场景,每个场景提供干净与杂乱的图像集用于基准测试。 该数据集总计 89,924 张图像,使用消费级相机拍摄以模拟随意采集,覆盖 128 种干扰物类型和 161 种场景主题,包括室内与室外环境。我们精心挑选了一个包含 41 个场景的子集 DF3DV-41,系统设计用于评估无干扰辐射场方法在挑战性场景下的鲁棒性。 利用 DF3DV-1K,我们对九种最新无干扰辐射场方法和 3D Gaussian Splatting 进行了基准测试,识别出最鲁棒的方法和最挑战性的场景。除基准测试外,我们展示了 DF3DV-1K 的一个应用:微调一个基于扩散的二维增强器以改进辐射场方法,在保留集(如 DF3DV-41)和 On-the-go 数据集上实现了平均 PSNR 提升 0.96 dB、LPIPS 降低 0.057。 我们希望 DF3DV-1K 能促进无干扰视觉的发展,并推动超越场景特定方法的进步。数据集与排行榜见 https://johnnylu305.github.io/df3dv1kweb/。

论文精读

TL;DR DF3DV-1K 是一个包含 1,048 个场景的大规模真实数据集,提供干净与杂乱图像对,专门用于评估无干扰物新视角合成的鲁棒性,并展示了通过微调扩散增强器提升辐射场方法性能的潜力。

问题

问题背景

辐射场(如 NeRF3D Gaussian Splatting)在新视角合成中已能生成照片级真实感的图像,但训练通常依赖高质量的“干净”图像序列。然而,日常手机随手拍摄的影像中往往充斥着行人、车辆、垃圾等动态或无关物体(称为 干扰物),直接使用这些图像会导致重建结果出现伪影或残缺,严重影响视觉质量。因此,无干扰物辐射场(distractor-free radiance field)成为研究焦点,旨在从含干扰物的杂乱图像中恢复出干净的场景表示。

现有方法的局限

目前针对干扰物的方法(如 NeRF-WRobustNeRFS-NeRF 等)主要通过不确定性建模、鲁棒损失函数或语义引导来滤除干扰物,但它们存在以下局限:

  • 缺乏统一的评测基准:各方法多在小规模自定义数据集上验证,场景数量少(通常几十个),干扰物类型单一,且很少提供同一场景的“干净 vs. 杂乱”图像配对,使得公平对比和鲁棒性评估难以进行。
  • 场景特定调优依赖:部分方法需要为每个场景手动调整超参或预分割干扰物,难以推广到大规模、多样化的现实场景。
  • 方法进步与数据规模脱节:相比目标检测、图像分割等领域,无干扰物辐射场由于缺少像 ImageNetCOCO 那样的大规模基准数据集,导致算法创新缺乏驱动,进展缓慢。

为什么这个问题难且重要

  • 技术挑战:干扰物具有极高的多样性(128 种类型,涵盖 161 种场景主题),且常与场景语义混淆(如坐在长椅上的人与长椅本身的纹理难以区分),模型需要在不破坏场景结构的前提下精准剔除干扰物,同时保持多视角一致性。
  • 应用价值:无干扰物辐射场是实现消费级设备 3D 重建(如手机扫描房间、旅游视频建模)的关键技术,可直接赋能 AR/VR、电影特效、数字孪生等产业,大量杂乱数据源的利用将极大降低 3D 数据生产成本。
  • 业界关注:随着 3D Gaussian Splatting 等高效表示方法的兴起,如何让这类方法在非受控环境下鲁棒运行已成为产学研共同的痛点。

行业类比

类似 2D 图像修复中的“物体移除”,但要求在 3D 空间实现跨视角一致的“内容感知填充”,复杂度更高,然而其工程价值也更为显著。

核心洞察

  • **配对干净与杂乱真实图像的大规模数据集填补了无干扰辐射场研究的空白**。现有辐射场基准要么聚焦于干扰物丰富但无干净对照的野外场景,要么局限于小型受控环境,DF3DV-1K 首次提供 1,048 个场景的成对图像,使模型能在同一场景下评估干扰物消除能力,推动方法从“场景特定微调”走向“跨场景鲁棒性”,并为下游任务(如 2D 增强器训练)提供高质量监督信号。
  • **DF3DV-41 子集通过系统化设计暴露了当前方法的盲点**。不同于随机选取测试场景,DF3DV-41 按干扰物类型、场景主题和观察方向分组,定量揭示了现有无干扰辐射场方法在镜面反射、透明物体等常见干扰物下的性能落差,为算法改进指明具体方向,例如 3D Gaussian Splatting 对复杂遮挡敏感,而鲁棒性较强的方法如 RobustNeRF 仍受限于慢速训练,引导社区在精度与效率间权衡。

方法

数据集构建流程

DF3DV-1K 的构建以真实场景中干净与杂乱图像对的规模化采集为核心。输入为 1,048 个室内外场景,使用消费级相机模拟 casual capture,每个场景拍摄一组无干扰的干净图像和一组包含干扰物的杂乱图像,共得到 89,924 张图像。场景覆盖 161 个主题,干扰物涵盖 128 种常见类型(如行人、车辆、宠物等),并记录相机位姿用于三维重建。

关键模块之一是场景组织与子集划分:从全量数据中精心筛选出 41 个极具挑战的场景形成 DF3DV-41 子集,专门用于评估无干扰辐射场方法在极端遮挡、光照变化、非刚性运动等情况下的鲁棒性。

基准测试协议

基准测试以 干净与杂乱图像对 作为监督信号,对 9 种最新的无干扰辐射场方法(含 3D Gaussian Splatting 变体)进行统一评测。评估指标采用 PSNR、SSIM、LPIPS,在新型视图合成任务上量化各方法消除干扰物并恢复清晰场景的能力。测试流程按场景独立运行,确保公平对比。

扩散增强器微调

除基准测试外,DF3DV-1K 还被用于 下游优化应用:将干净图像作为 ground truth 监督,微调一个基于 扩散模型的 2D 图像增强器,使其学会从初始辐射场渲染结果中去除残留伪影。微调后的增强器作为一个即插即用后处理模块,直接提升辐射场方法输出质量。在留出集 DF3DV-41 和公开数据集 On-the-go 上,平均带来 0.96 dB PSNR 增益0.057 LPIPS 下降,且无需修改原始三维重建流水线。

与同类工作差异:DF3DV-1K 首次在大规模真实数据中系统提供同场景的干净-杂乱配对,并支持从数据增强角度提升辐射场鲁棒性,区别于以往只依赖算法改进或合成干扰的思路。

实验

实验设计:基于 DF3DV-1K(1,048 个场景,每场景包含干净与杂乱图像对),研究者首先在完整数据集上对 9 种最新的去干扰辐射场方法及 3D Gaussian Splatting 进行全面基准测试,涵盖 128 种干扰物类型与 161 种场景主题。进一步,从 DF3DV-1K 中精选 41 个挑战性场景构成 DF3DV-41 子集,系统评估各方法在极端遮挡、光照变化、动态混杂等条件下的鲁棒性。最后,利用数据集的干净-杂乱配对特性,微调一个基于扩散的 2D 增强器,将其集成到辐射场管线中以验证数据对下游任务的提升潜力,在留出集(DF3DV-41 与 On-the-go)上测试泛化能力。

关键发现:(1) 基准测试揭示了方法间鲁棒性的显著差异,部分方法在严重干扰下性能急剧下降,而具备显式遮挡推理或学习型去噪模块的方法表现更优。(2) 最困难的场景包含高度纹理化背景、类干扰物外观的遮挡物以及动态物体,这些对当前所有方法均构成挑战。(3) 数据驱动的增强器微调策略带来了平均 0.96 dB PSNR 提升0.057 LPIPS 降低,证明大规模干净-杂乱配对数据可用于学习鲁棒先验,而无需修改辐射场核心架构。

对比解读:此数据集的价值在于填补了真实世界中干净与杂乱图像配对的空白,相比以往仅基于合成数据或多视基准的评测,DF3DV-1K 更贴近消费级随意拍摄场景。与场景特定优化方法相比,经微调的增强器展现了跨场景泛化能力,尽管提升幅度尚不惊人,但为去干扰视图合成从“场景修补”迈向“通用增强”提供了可行路径,也指出了数据规模与多样性对学习通用抗干扰表示的重要性。

行业影响

落地场景

DF3DV-1K 数据集直接服务于干扰物移除的神经渲染(distractor-free radiance fields),典型应用包括:

  • 电商 3D 商品展示:拍摄商品时常有杂物、背景干扰,使用该方法可直接生成干净的多视角新视图,用于 AR 预览或详情页 360° 展示。
  • 房地产与旅游:虚拟看房、景点漫游中,游客或家具等移动物体是常见干扰,干净的场景重建可提升体验一致性。
  • 自动驾驶仿真:从真实道路采集的数据中移除动态车辆与行人,生成干净的静态环境用于传感器模拟。
  • 影视后期与内容创作:快速从实拍镜头中生成无干扰背景,用于虚拟制作或视效合成。

商业价值

  • 降本增效:传统干扰物移除依赖人工修图或逐帧处理,成本高。基于辐射场的方法可一次重建即输出多视角干净场景,大幅减少后期人力,缩短制作周期。
  • 体验升级:电商与房产平台的 3D 展示若包含杂物,会显著降低用户信任与购买意愿。干净、一致的交互体验可直接提升转化率与停留时长。
  • 数据飞轮:该数据集提供标准化基准,推动算法迭代,使中小型团队也能用消费级相机完成专业级干扰物移除,降低入场门槛。

与现有产品/工作流的接口

  • 与 NeRF/3DGS 管线集成:该方法可嵌入现有三维重建流程,在 COLMAP 位姿估计之后、训练前增加干扰标记或注意力机制,输出干净辐射场。
  • 与 diffusion 增强器协同:文中使用扩散模型微调来提升质量,这为已有的 AI 图像增强产品(如 Upscale、去噪插件)提供了新增值功能——直接对辐射场渲染结果进行后处理,获得更高 PSNR 和 LPIPS。
  • 数据标注与评估工具:可基于 DF3DV-1K 构建自动评估服务,集成到 MLOps 平台中,为三维重建模型的选型与调优提供量化依据。

具体落地用例

  1. 电商 AR 试戴/试摆:用户上传一段手机拍摄的含干扰物品的视频,系统自动移除杂物并生成无干扰的 3D 模型,用于虚拟摆放。此流程可直接集成到Shopify AR 工具包宜家 Place 应用的后端,减少内容制作周期。
  2. 自动驾驶地图更新:众包采集的路侧图像常含有临时停靠车辆、行人,利用 distractor-free 辐射场可批量生成无动态物的街景,作为高精地图的纹理图层,降低人工众包审核成本。

局限

  • - **干扰物类型和场景覆盖有限**:数据集包含 128 种干扰物类型和 161 种场景主题,但仍可能无法覆盖现实世界中的长尾干扰情况(例如镜面反射、半透明遮挡、动态光照变化)。消费级相机采集方式虽贴近日常拍摄,但也引入了传感器噪声和自动曝光等变量,可能对基于光度一致性的方法产生不可预知的干扰。因此,基准测试的结论在迁移到极端或专业拍摄条件时需谨慎解读。
  • - **评估指标依赖传统图像质量度量**:基准测试主要采用 **PSNR** 和 **LPIPS**,这些指标虽被广泛使用,但无法完全反映感知质量、几何一致性或对下游任务的实用性(例如,新视图合成用于 AR 时的时域稳定性)。缺少像 **FID**、**CLIP score** 或人类主观评价等多维度评估,可能给方法排序带来偏差,尤其是对于 fine-tune 后的扩散增强器,其生成效果可能与真实场景存在细节伪造。
  • - **应用场景和泛化性未充分验证**:论文仅展示了用数据集微调扩散去噪器来改进辐射场结果的案例,但该策略的泛化性依赖于所收集数据的特定分布。若在其他数据集上直接使用该微调模型,性能提升可能不显著;论文并未探索如何让模型适应未知干扰物或跨数据集迁移。另外,目前基准测试仅针对静态场景,未涉及 **动态干扰物** 或 **视频增强**,限制了在更复杂视觉应用中的借鉴价值。
论文Cheng-You Lu2026-06-18原文

相关内容