面向暗光环境下鲁棒且三维感知的 RGB-NIR 成像
鲁棒低光成像 仍是计算机视觉中的难题。现有方法常依赖 RGB-NIR 配对数据,融合近红外与噪声 RGB 进行增强,但受限于精心整理的训练数据,在真实场景中鲁棒性不足。 本文提出一种 3D 感知神经建模 的新视角:在 3D 空间 中隐式融合极度噪声的 RGB 观测与 NIR 线索,无需任何干净 RGB 监督,即可恢复清晰 RGB 图像。该模型免除了干净数据收集成本,并具备跨噪声级别的泛化能力。 在合成与真实数据上的广泛实验验证了其优越性。代码已开源:https://github.com/MyNiuuu/3DarkFusion
论文精读
TL;DR 在极暗光下,该工作首次通过 3D 神经隐式融合极噪 RGB 与 NIR,无需任何干净 RGB 监督即可重建清晰图像,且对不同噪声水平泛化稳健。
问题
暗光成像始终是计算机视觉的瓶颈问题,尤其在极端低光条件下,纯可见光(RGB)信号极易被噪声淹没。近年来,利用**近红外(NIR)**辅助成像成为热点,因为 NIR 不受可见光强度影响,能提供稳定的纹理线索。
现有方法存在明显局限:
- 严重依赖成对训练数据:多数 RGB-NIR 融合方法需要同时采集的清晰 RGB 作为监督信号,但现实中暗光场景极难获取真值。
- 泛化能力弱:模型在特定噪声分布上训练后,面对未见过的噪声水平或真实传感器噪声时性能骤降,无法自适应多变环境。
- 2D 融合忽略几何结构:传统方法在 2D 图像域做像素级融合,未考虑场景的 3D 一致性,容易产生伪影或色彩失真。
该问题的难点在于:无监督环境下如何从极度嘈杂的 RGB 中恢复高质量图像,同时需要保持纹理细节与色彩保真度。NIR 虽能补充结构,但其与 RGB 的对应关系并非线性,存在模态差异与配准误差。此外,暗光成像在自动驾驶夜视、手机夜景摄影、安防监控等场景需求强烈,业界急需一种鲁棒且无需成对数据的方案。
这一挑战可类比于自监督深度估计与多模态融合的结合,即在缺乏直接监督的情况下,通过 3D 先验隐式地学习跨模态映射,输出稳定视觉感知。
核心洞察
- 核心创新在于将 3D 神经场引入 RGB-NIR 低光融合,突破传统 2D 图像到图像映射的范式。现有方法依赖成对训练数据(干净 RGB 与低光 RGB-NIR),而 3D 建模通过体积渲染从极噪图像中隐式利用 NIR 的结构先验进行自优化,无需任何干净监督,从而跨不同噪声水平泛化。这种 3D-aware 隐式融合策略避免了对特定噪声分布的过拟合,提高了真实场景的鲁棒性。
- 该工作把 NIR 作为 3D 重建的结构性引导,而非简单的辅助输入。通过位置编码与 NIR 的联合优化,模型在 3D 空间中解决 RGB-NIR 的模糊性,这不同于直接在 2D 域上将 NIR 叠加或作为条件输入的常见融合策略。这种 3D 层面的融合使得恢复的 RGB 纹理更一致,尤其适用于暗光下结构退化严重的区域。
方法
输入:多视角极低光照下的噪声 RGB 图像与对应 NIR 图像。NIR 不受可见光噪声干扰,能提供稳定场景结构,但通常缺失颜色信息。
关键模块
- 3D 场景表示:采用 MLP 隐式建模场景的神经辐射场,支持体渲染(volume rendering)合成新视角。
- RGB-NIR 融合在 3D 空间:将 NIR 信号作为几何先验注入到 MLP 中,引导密度场与颜色场的预测,而非仅在 2D 图像层面对齐。具体通过 改进的位置编码(Positional Encoding) 实现:在输入坐标编码时融合 NIR 的边缘或强度特征,使网络学会利用 NIR 纹理指导 RGB 去噪。
- RGB-NIR 歧义消解:由于 NIR 与 RGB 的光谱差异,同一物体在两模态下可能呈现不同亮度或纹理。为此模型引入跨模态一致性约束或自适应加权,避免直接映射导致的伪影。
- 优化:整个框架无需干净 RGB 真值,仅从噪声观测与 NIR 出发,通过重建损失(如多视角光度一致性)与 NIR 引导的正则项联合优化 MLP 参数。
输出:任意目标视角下的干净 RGB 图像,颜色自然且细节清晰。
差异点:与现有依赖成对干净数据训练的 2D 融合方法不同,本工作首次将 RGB-NIR 增强提升到 3D 神经建模层面,利用多视角隐式一致性,完全 bypass 了干净 RGB 采集难题,并天然具备跨噪声水平的泛化能力。
实验
实验设计概述
该工作完全摒弃了对干净 RGB 图像的依赖,分别在合成与真实低光场景中评估模型性能。对比基线涵盖主流低光增强方法和 RGB-NIR 融合方案,重点考察不同噪声水平下的泛化能力。
关键发现
- 模型在 3D 空间 内隐式融合极低照度的 noisy RGB 和 NIR 线索,有效规避了 2D 先验的局限。
- 对 不同噪声强度 表现出高度自适应,无需针对特定噪声模式重新训练。
- 在合成与真实数据上均取得超越基线的定量指标和视觉质量。
与基线的对比解读
相比必须依赖大量配对数据的有监督方法,该方法通过 三维感知建模 和 NIR 引导,极大降低了数据采集成本。传统 2D 融合在面对噪声水平剧烈波动时性能退化明显,而本工作利用多视图一致性提升了场景鲁棒性。不足在于,原文未给出精确指标数值,难以量化优势幅度。
行业影响
落地场景
本技术可大幅提升极低光环境下的彩色成像质量,直接应用在智能手机夜间摄影、安防监控、自动驾驶视觉感知与医疗内窥镜等产品。例如,利用手机中已有的近红外(NIR)传感器(如 3D 面部识别模组)辅助 RGB 主摄,在亮度低于 0.1 lux 的场景下恢复纹理清晰、色彩自然的图像;或在自动驾驶夜视系统中融合 NIR 与 RGB 相机,改善暗光下的目标检测与车道线识别。
商业价值
- 降低数据获取成本:无需采集像素级配对的干净 RGB 图像,直接利用原始噪声 RGB 与 NIR 联合优化,省去昂贵的标注与硬件标定环节。
- 硬件成本优化:可在现有中低端传感器上实现高端成像效果,减少对超大像素尺寸或极低读出噪声 CMOS 的依赖,降低 BOM 成本。
- 体验提升与安全增益:在监控、自动驾驶等场景中,可靠的低光彩色重建能减少漏报、误报,提升安全性能,并增强用户拍摄体验,形成产品差异化。
与现有工作流的接口
模型可作为即插即用的低光增强模块嵌入到传统 ISP 流水线中:
- 输入为时序对齐的 NIR 图像与噪声 RGB 帧,通过 3D 神经表示隐式融合,输出干净 RGB。
- 无需改变现有光学架构,只需在双摄或多摄系统中增加一个后处理模块,可部署在移动端(如高通 Hexagon 或 Apple Neural Engine)或云端。
- 因其对噪声水平泛化性强,可直接适配不同型号摄像机的输出,无需逐设备调参。
具体落地场景举例
- 手机厂商:在旗舰机的“超级夜景”模式中引入 NIR 辅助,利用结构光或 ToF 的 IR 摄像头,实现近乎零照度下的彩色拍摄,避免长曝光导致的模糊。
- 自动驾驶:在 L4 级无人车夜视系统中,将现有红外热像仪替换为 NIR+RGB 融合方案,生成高保真彩色环境图,提升交通标志识别和行人检测精度。
局限
- **依赖 NIR 输入**:方法要求同步获取 NIR 图像,这在实际部署中需额外硬件支持或数据对齐步骤,限制了在仅 RGB 摄像系统上的应用。论文未讨论多光谱传感器标定误差或 NIR-RGB 视差带来的影响,这可能降低融合精度。
- **3D 建模的计算负担**:基于 MLP 的体积渲染优化较为耗时,训练需要多视角 RGB-NIR 对,且推理速度远慢于单帧增强网络,不利于实时或移动端场景。论文未提供推理延迟或显存占用数据,工程落地需进一步轻量化。
- **真实噪声泛化边界**:虽然宣称对噪声水平鲁棒,但合成实验的噪声模型相对简化,真实世界暗光噪声常包含条带噪声、坏点等复杂模式,缺乏在这些多样化退化上的验证。此外,方法在动态场景或运动模糊下可能失效,因为 3D 一致性假设不成立。