Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction
多视图三维重建在前馈三维重建模型的发展下取得了显著进展。然而,这些模型通常在理想无退化成像条件下训练和评估,而真实观测往往包含与此类环境差异显著的退化。因此,提升多视图三维重建在退化条件下的鲁棒性仍是一个重要挑战。 本文提出几何感知表示去噪(GARD),一种新颖框架,直接在前馈三维重建模型的特征空间中执行基于扩散的多视图恢复。该设计利用三维重建器的几何感知特征表示,有效恢复准确的场景几何。此外,通过附加的RGB图像解码器,精炼的表示还可用于恢复高质量RGB图像,从而同时恢复三维场景几何和高质图像。 在Depth Anything 3(DA3)基准上的全面实验证明了所提GARD框架的有效性。
论文精读
TL;DR GARD 在 3D 重建模型的特征空间中执行扩散去噪,同时恢复场景几何与高清图像,显著提升退化条件下的多视图重建鲁棒性。
问题
问题背景
多视角 3D 重建正从传统几何方法快速转向基于前馈网络的模型(如 DUSt3R、MASt3R、Depth Anything 3),它们能在理想成像条件下高效地从无位姿图像预测场景几何。然而,现实采集的图像常包含传感器噪声、运动模糊、低光照或压缩伪影等退化因素,导致这类模型的精度和鲁棒性急剧下降。
现有方法的局限
主流应对策略是先复原、后重建(cascaded pipeline):用独立训练的扩散模型在像素空间对每张视图单独去退化,再将“干净”图像输入重建网络。这种做法有根本缺陷:
- 忽略多视图一致性:像素级去噪仅优化单图视觉质量,未考虑跨视图的几何对应关系,可能平滑掉对深度估计至关重要的纹理细节,或引入虚假高频信息,破坏特征匹配。
- 误差隔离与累积:复原阶段的误差会直接传播给重建模块,且两者缺乏联合优化的信号,无法从 3D 几何反馈中指导复原过程。
- 特征解耦难题:重建模型内部的几何感知特征(geometry-aware features)能编码场景结构,但现有去噪方法完全不触及该表示空间,错失了利用强先验的机会。
为什么该问题既难又重要
- 技术挑战:退化条件下,跨视图的光度一致性假设失效,位姿估计的对应点搜索引入大量异常值;同时,需在保持纹理真实感与保留几何细节之间平衡,而扩散模型容易产生幻觉纹理,使重建点云扭曲。
- 工业关注度:在自主移动系统、AR/VR 内容创建、数字孪生等场景中,输入常来自低成本摄像头或恶劣光照条件,若重建鲁棒性不足,会直接阻碍产品落地。
行业类比
类似自动驾驶感知栈中,原始传感器数据需在经过联合降噪与检测的一体化网络处理,而非先美化点云再检测,以保留时空几何约束;多视角重建同样需要在统一表示空间中同时恢复外观与 3D 结构。
核心洞察
- GARD 将扩散去噪从像素空间迁移到前馈三维重建模型的特征空间,利用几何感知特征恢复场景结构,而非在像素域独立处理各视图。这突破了像素级去噪忽略多视图一致性、难以保持几何约束的局限,使重建模型在退化条件下仍能输出精确几何,与仅针对单图像质量增强的基线有本质区别。
- 通过额外 RGB 解码器,GARD 可从净化后的特征中同时恢复高保真图像,实现三维几何与图像质量的联合提升。相比以往孤立处理三维重建或图像恢复的管线,这种统一范式消除了多任务间的信息割裂,在 Depth Anything 3 基准上验证了其对姿态估计、重建精度和视图合成的一致性增益。
方法
任务设定与动机
多视图 3D 重建模型(如 Depth Anything 3 等前馈网络)通常在干净数据上训练,面对真实场景中的退化观测(噪声、模糊、低光等)时性能骤降。传统思路是在像素空间执行多视图图像恢复(去噪、增强),再送入重建模型。但像素级恢复难以显式利用多视图几何一致性,容易平滑掉有利于重建的细节。
GARD 的核心理念:将恢复任务从像素空间迁移到 3D 重构器的特征空间。这样,扩散模型能够直接操纵几何感知的中间表示,实现“恢复几何结构”与“生成高清图像”的统一。
方法框架
输入:一组存在退化的多视图 RGB 图像。
关键模块:
冻结的 3D 重建编码器:选用预训练的前馈重建模型(如处理多视图的 Transformer 架构),提取多视图的几何感知特征。该特征天然编码了场景的几何与外观对应关系,且对视图间一致性敏感。
表征去噪器(Representation Denoiser):基于扩散模型构建,但操作在特征空间而非像素空间。它使用 插值流匹配损失(Interpolated Flow Matching Loss) 进行训练,从带噪特征逐步恢复干净特征。此外,引入注意力对齐损失(Attention Alignment Loss) 来强制不同视图间的注意力分布保持一致,增强几何稳定性。
RGB 图像解码器:一个额外的轻量解码器,将去噪后的特征重新映射回 RGB 图像,实现高清图像恢复。该解码器与去噪器联合训练,但不参与重建主干的反传,保持几何恢复与图像恢复的独立优化路径。
输出:
- 精炼的特征表示:直接送入重建模型的后续部分(如 cost volume 构建、深度估计头),生成准确的 3D 几何(深度图、点云等)。
- 恢复的高质量 RGB 图像:多视图一致的去噪/增强图像,可用于可视化或下游任务。
与同类方法的差异
与传统像素空间多视图恢复相比,GARD 首次在 3D 重构器的几何感知特征空间内执行扩散去噪,使得恢复过程能够显式利用预训练重建模型中内嵌的多视图几何先验,从而更有效地保留对 3D 重建至关重要的结构细节,同时实现几何与图像质量的联合提升。
实验
实验设计
实验在 Depth Anything 3 (DA3) 基准上评估,覆盖姿态估计、3D 重建与图像恢复三项任务。输入是带噪声或退化(如模糊、低光照)的多视角图像,目标是恢复精确的场景几何与高质量 RGB 图像。对比对象包括在像素空间直接进行扩散去噪的基线方法,以及原始未去噪的 feed-forward 重建模型。
关键发现
- 特征空间去噪显著优于像素空间:GARD 利用 3D 重建器内部的几何感知特征表示(geometry-aware features),能更有效地去除退化,并在重建精度上大幅领先像素空间去噪。
- 联合恢复几何与纹理:通过附加的 RGB 图像解码器,去噪后的特征可同时输出干净的多视角图像,证明几何与纹理恢复能相互促进。
- 特征代价体可视化显示 GARD 恢复的特征相关性图更接近干净输入,表明其在保持跨视角对应关系上的优势。
与基线的深度对比
直接在像素空间去噪的方法忽略了多视角一致性,容易产生模糊或细节丢失,且下游重建模型对像素误差敏感。GARD 将扩散过程嵌入到重建模型的中间特征空间,使得去噪与几何推理深度耦合:扩散模型学习恢复的特征表示直接驱动更准确的三维估计,同时重建出的几何反馈又规范了特征的去噪方向。这一闭环设计在应对严重退化时鲁棒性突出,且该方法具有模型无关性,可适配不同的 feed-forward 重建 backbone。
行业影响
落地场景
GARD 框架从受损多视图输入中同时恢复 3D 几何与高质量图像,可直接应用于 自动驾驶感知、AR/VR 空间计算 以及 电商 3D 商品展示 等业务线。在自动驾驶中,摄像头因雨雾、低光照或运动模糊导致成像质量下降,GARD 可在特征空间去噪后稳定输出深度与点云,提升感知可靠性。电商平台对商品进行多角度拍摄时,环境光不足或反光噪声会影响重建质量,GARD 能从廉价拍摄设备中恢复精细几何与纹理,降低对专业采集环境的依赖。
商业价值
核心价值在于 降低高质量 3D 重建的硬件门槛 并 提升在非理想环境下的重建可用率。传统 3D 扫描需要激光雷达或多相机阵列,成本高昂且部署复杂;基于学习的重建模型虽快但对退化敏感。GARD 允许企业继续使用低成本、易受损的视觉传感器(如手机摄像头),通过软件补偿实现专业级重建,节省大量硬件采购与维护成本。对于内容平台,这直接转化为更快的 3D 资产生成流水线,提升 UGC 3D 内容的产出效率,从而增强用户活跃度与商业变现。
与现有产品/工作流的接口
GARD 可作为 预处理插件 或 特征增强层 插入现有重建管线。对于使用 DUSt3R、Depth Anything 3 等前馈重建模型的团队,GARD 可直接替换输入图像的特征提取阶段,无需改动下游网络。具体集成方式包括:
- 在推理服务中封装为
RestorationModel,接受多视图原始图像,输出去噪后的特征和恢复的 RGB 图像,再接入现有重建模块。 - 训练时,GARD 的扩散去噪模块可作为数据增强的一种形式,模拟真实退化让模型更鲁棒。
其设计兼容端到端训练,可部署于 ONNX 或 TensorRT 以加速推理,适合云端或边缘端多视图应用。
具体落地 use case
自动驾驶感知增强
车载摄像头在夜间或雨雾天气中成像噪声多,常规重建模型易产生空洞或扭曲几何。GARD 可在特征空间直接去噪,利用跨视图几何一致性恢复准确深度,为规划控制提供可靠 3D 场景表示,降低因感知错误导致的接管概率。电商 3D 商品重建
卖家使用手机环绕拍摄商品时,手持抖动和室内光线不足导致输入图像模糊、色彩失真。GARD 能从这些低质量多视图图像中恢复清晰纹理和完整网格,自动生成可用于 AR 试穿的商品模型,提升用户购买转化率。
局限
- **依赖预训练 3D 重建模型**:GARD 的特征空间去噪直接建立在特定 3D 重建器(如 Depth Anything 3)之上,若更换 backbone 或下游任务,需重新训练去噪模块,泛化成本较高。这在论文的 Limitation 部分被提及,也与当前多数 representation-space 方法的共性弱点一致。
- **扩散模型推理开销大**:虽然特征空间维度比像素空间低,但扩散模型的迭代采样仍带来显著的计算延迟,难以满足实时或低功耗场景需求。论文未讨论推理加速策略或轻量化变体,限制了其在移动端或在线系统中的应用。
- **合成降质与真实世界的差距**:实验主要在 DA3 基准上使用合成降质评估(如噪声、模糊),缺乏对真实传感器退化(如低光、压缩噪声、运动模糊混合)的系统验证。这可能导致方法在野外条件下性能下降,鲁棒性边界尚不明确。