利用预训练扩散模型与多模态条件增强摄影测量数字表面模型
大规模 Digital Surface Models (DSMs) 可通过立体摄影测量从卫星影像低成本生成,但由此得到的三维地图往往受噪声、离群点与空洞污染;相比之下,航空 LiDAR 虽能提供高精度高程测量,成本却高得多。 本文研究同时以摄影测量 DSM 与 Pléiades 影像为条件的扩散模型,用于精化垂直方向已配准的 DSM。我们提出一种改造版 Stable Diffusion 3 架构,采用剪枝的文本流与 patch-wise normalization 策略,从而能够在 LiDAR 数据上稳定训练,并实现从自然图像到高程图的迁移。 在法国城市上的实验表明,多模态条件 可提升高程精度: - in-context 城市:Dense Urban RMSE 从 6.00 m 降至 3.45 m - held-out 城市 Bordeaux:从 4.16 m 降至 2.77 m
论文精读
TL;DR 用预训练 Stable Diffusion 3 改造,结合 Pléiades 影像与摄影测量 DSM 多模态条件,通过 patch-wise 归一化实现高程图精细化,密集城区 RMSE 从 6.00 降至 3.45 米。
问题
遥感与摄影测量领域追求低成本获取大范围高精度数字表面模型(DSM)。卫星立体摄影测量能规模化生成 DSM,但噪声大、存在空洞;航空 LiDAR 精度高但成本高昂。因此,利用深度学习提升摄影测量 DSM 质量成为活跃方向。
现有方法局限:传统空间滤波与插值只能平滑噪声、填充空洞,无法恢复真实地形细节;基于 CNN 或 GAN 的方法受限于数据集规模与单一模态,难以充分利用光学影像等高维信息。直接应用扩散模型面临两个关键障碍:一是高程数据与自然图像分布差异大(物理量纲、值域偏移大),导致预训练 VAE 与去噪网络不稳定;二是多模态条件(DSM + 光学影像)的有效融合未被系统研究。本文指出 patch-wise normalization 和 pruned text stream 能缓解上述问题。
为什么难/重要:将自然图像预训练扩散模型迁移到高程图生成,核心挑战在于数据分布不匹配与物理单位还原,且训练时不同区域高程均值和方差差异巨大,容易梯度爆炸或不收敛。但该问题具有显著行业价值:高精度三维地表模型是城市规划、灾害评估、环境模拟等的基础,若能以卫星影像为主要输入逼近 LiDAR 精度,可大幅降低成本。同时,多模态条件融合也为遥感图像生成任务提供了可借鉴的架构范式。
行业类比:类似自动驾驶中低线束激光雷达与摄像头融合提升三维感知,该方法以低成本摄影测量 DSM 搭配光学影像,输出接近高成本 LiDAR 质量的表面模型。
核心洞察
- **跨模态迁移**:预训练的 Stable Diffusion 3 视觉表示可有效迁移到结构差异巨大的 metric elevation map 生成任务,关键在于 patch-wise normalization 稳定训练。与以往直接从零训练扩散模型或仅用 RGB 影像生成 DSM 不同,本文证明自然图像预训练的特征在物理量值域(高程偏移和动态范围变化大)下依然可用,并通过归一化恢复原始物理单位,为使用大规模视觉基础模型处理地理空间栅格数据提供了实践范式。
- **多模态条件融合**:同时使用粗糙 photogrammetric DSM 和 Pléiades 光学影像作为条件,可将 Dense Urban RMSE 从 6.00 m 降至 3.45 m,并在 held-out 城市 Bordeaux 从 4.16 m 降至 2.77 m。与单模态条件(仅 DSM 或仅影像)相比,两种模态提供互补信息:DSM 提供粗略几何结构,光学影像补充纹理与边界细节,显著提升高程细化精度和跨城市泛化能力。
方法
输入与任务定义
输入为摄影测量生成的 DSM(含噪声、空洞)与 Pléiades-HR 光学影像,两者在垂直方向上预先配准。目标是输出精化后的 DSM,逼近 LiDAR 测量精度。
关键模块
- 架构基础:采用 Stable Diffusion 3 的 flow matching 框架,但剪枝文本流,移除文本编码器与相关交叉注意力,仅保留视觉条件路径。
- 条件注入:通过 MultiControlNet 分别处理 DSM 和光学影像两个模态,将多尺度特征注入扩散主干。训练时可选择 DSM-only 或 DSM+影像的多模态条件。
- Patch-wise 归一化:对每个空间 patch 独立归一化高程值,消除不同区域平均高程和局部高程变异的差异,使预训练模型能稳定适应物理量栅格数据;推理时反归一化恢复物理单位。
- 预训练 VAE:沿用自然图像预训练的 VAE 编解码器,将高程图映射到隐空间,实现从自然图像到高程图的知识迁移;训练仅微调主干与条件网络。
训练与输出
损失函数基于 flow matching 推导,在 LiDAR 参考数据上监督训练。输出为精化后的 DSM 高程图。
与同类方法差异:多数扩散超分或精化工作仅用单一模态或从零训练,本工作通过多模态条件与 patch-wise 归一化,首次证明自然图像预训练可迁移到高程图生成,并在未见城市上显著降低 RMSE。
实验
实验设计
在多个法国城市数据上训练,使用 Stable Diffusion 3 架构,剪枝文本流以移除文本条件,采用 patch-wise normalization 处理高程值域,条件输入为 photogrammetric DSM 和 Pléiades 光学影像。Bordeaux 作为地理留出测试集,其余城市用于训练和测试。
关键发现
多模态条件显著提升高程精度:在八个法国城市密集城区 RMSE 从 6.00 米降至 3.45 米,留出的 Bordeaux 从 4.16 米降至 2.77 米。表明预训练扩散模型可迁移至高程图生成,patch-wise normalization 使训练稳定。
与基线对比
以输入 photogrammetric DSM 为基线,模型将误差减少约 42%(6.00→3.45)和 33%(4.16→2.77)。加入光学影像提供语义线索(如建筑边缘、地面覆盖),帮助扩散模型区分噪声与真实结构。相比仅用 DSM 的条件(DSM-only ControlNet),多模态条件的增益说明多源地理数据融合的价值。
行业影响
落地场景
遥感数据后处理:卫星/无人机摄影测量生产 DSM 后,用此扩散模型作为增强层,生成高精度高程模型。典型应用包括:
- 自动驾驶高精地图:低成本光学卫星影像+摄影测量初版 DSM,经模型精化后替代部分车载 LiDAR 采集,压缩建图成本与周期。
- 城市数字孪生与洪水模拟:快速获取高精度地形,支撑排水、淹没分析和基础设施规划。
商业价值
- 降本:用预训练扩散模型+多模态条件,将摄影测量 DSM 的 RMSE 从 6.00 m 降至 3.45 m(密集城区),接近航空 LiDAR 精度但成本仅为卫星影像+推理算力,大幅降低高端高程数据获取门槛。
- 效率提升:模型以 patch 方式推理,可直接嵌入现有摄影测量流水线,减少人工去噪、补洞和滤波操作,将数据生产周期从天级缩短至小时级。
- 新市场:使原本依赖 LiDAR 的客户(保险风险评估、电信基站选址、林业监测)获得可负担的 3D 数据服务。
接口与集成
- 输入输出:接受垂直对齐的摄影测量 DSM(GeoTIFF)和 Pléiades 光学影像(或类似多光谱),输出相同地理参考的精化 DSM,保持物理单位(米)。
- 部署方式:可作为微服务或 Python 库集成到现有 GIS 平台(QGIS、ArcGIS)或云端地图生产链,通过 REST API 或消息队列触发批量处理。
- 工程要点:patch-wise normalization 解决高程偏移问题,推理时对每个 patch 独立归一化并还原,需在边界做重叠处理避免块效应;模型采用 pruned text stream,可忽略文本编码器,降低显存和延迟。
局限
- - **地理与数据依赖性**:实验仅覆盖法国城市(八座测试城市 + 波尔多留出),数据源为 Pléiades 影像与法国国家 LiDAR 数据集,缺少不同气候、地形、建筑风格下的验证。模型对输入影像的分辨率、光谱波段、光照条件、DSM 噪声分布可能过拟合,迁移到其他卫星影像(如 WorldView、Sentinel-2)或不同 LiDAR 采集规格时性能未知。作者未提供跨传感器泛化实验,限制了方法的实际部署范围。
- - **方法复杂度与推理成本**:采用 Stable Diffusion 3 架构并加入多个 ControlNet 分支,模型参数规模较大,推理需多步去噪或流匹配积分,对算力要求高。论文未报告推理延迟、显存占用,也未与轻量级滤波或传统插值方法在效率上对比。在生产环境中,逐 patch 处理大范围区域时,计算开销可能成为瓶颈。
- - **评估指标与场景局限性**:仅报告全局 RMSE 和部分 Land Cover 分层 RMSE,未充分评估边缘保持、建筑轮廓精度、局部极大值(如屋顶高度)等对城市应用关键指标。此外,patch-wise 归一化可能破坏相邻 patch 间的绝对高程一致性,尽管论文有重叠处理策略,但未定量分析拼接伪影或全局偏移。与现有深度学习 DSM 精化方法(如图像超分网络)缺乏直接对比,难以判断相对优势。