论文

GeoCR:从异构观测中学习通用的云去除先验

GeoCR:从异构观测中学习通用的云去除先验

现有云去除方法通常针对单一数据集和输入配置专门设计,难以在传感器、光谱波段和观测设置之间复用。为此,我们提出 GeoCR,一个通用模型,在单网络中统一 RGB-only 与 multispectral 云去除,支持单时相或多时相含云观测,并可选用 SAR 引导。 为适应不同光谱与传感域,GeoCR 使用紧凑的输入/输出 stem 扩展预训练 RGB 自编码器,同时冻结其 encoder 与 decoder 主干。共享的 latent 接口让单个 flow transformer 能联合建模干净 RGB 与非 RGB latent,并以独立的含云观测流和可选 SAR token 为条件。通过在十个数据集的训练划分(共 883,331 张无云目标图像)上联合预训练,GeoCR 学到跨异构配置的共享去云先验。同一预训练 checkpoint 支持无需数据集特定微调的直接推理,并可通过 LoRA 高效适配。 我们在贡献数据集的测试划分上,以全波段和 RGB-only 设置,将 GeoCR 与通用图像复原及云去除方法比较。GeoCR 在全波段 SEN12MS-CR 与 Sen2MTCNew 以及 RGB-only CUHK-CR2 上取得最佳 FID 与 DISTS,优于现有模型,展示了可复用生成模型在多样设置下的有效性。

论文精读

TL;DR GeoCR 用单个网络统一 RGB/多光谱、单/多时相与可选 SAR 引导的去云,冻结预训练 RGB 自编码器加紧凑 stem 适配异构输入,联合预训练十个数据集后,零样本推理在多个基准取得最佳 FID/DISTS。

问题

问题背景

云去除是遥感图像处理的关键预处理步骤,直接影响土地覆盖分类、变化检测等下游任务。随着多传感器、多时相观测数据爆炸增长,构建一个可跨传感器、波段和观测设置复用的云去除模型成为迫切需求。

现有方法局限

  • 当前主流方法通常针对特定数据集和输入配置定制,例如 SEN12MS-CR 仅处理多光谱单时相,CUHK-CR2 仅处理 RGB 多时相,导致模型无法直接迁移至其他传感器或波段组合。
  • 架构设计假设固定输入维度和时序长度,缺乏对可选 SAR 引导、混合光谱分辨率的统一支持;每个新场景都需要重新设计网络、重新训练,造成大量重复劳动。
  • 缺少跨数据集联合训练的共享表征,无法利用大规模异构数据学习通用的云去除先验,限制了模型泛化能力和数据效率。

为什么这个问题难/重要

  • 云去除本质是 ill-posed 逆问题,需要同时推断被遮挡的地物空间结构、光谱反射率和时序变化,而不同传感器的波段数、空间分辨率、辐射定标差异很大,构建统一的潜在空间困难。
  • 将异构观测(RGB / 多光谱 / SAR、单时相 / 多时相)映射到共享表征且避免模态间负迁移,是技术难点;一旦解决,能显著降低部署成本,支持新传感器快速适配。
  • 业界对可复用基础模型的需求日益增长,类似 CLIP 或 SAM 在视觉任务中的统一作用,云去除领域也需要一个“基础模型”来整合碎片化方案。

行业类比

这类似于自然语言处理从任务专用模型向 GPT 系列通用模型的演进:通过大规模预训练 + 轻量适配(如 LoRA),一个模型即可服务多种下游需求。

核心洞察

  • GeoCR 的核心贡献在于通过**冻结预训练 RGB 自编码器主干**,用轻量级输入/输出 stem 适配任意光谱和观测配置,将不同传感器数据映射到统一潜在空间,从而复用大规模 RGB 预训练表示,避免为每个数据集单独训练大模型,显著降低计算与数据成本。这与现有云去除方法通常为每个传感器或模态专门设计模型形成对比:现有方法往往针对 RGB 或多光谱分别训练独立网络,无法共享表示,而 GeoCR 证明了通用视觉主干在遥感复原任务中的可迁移性,并对实际工程部署提供了参数高效适配的路径。
  • GeoCR 将云去除重新定义为**条件生成式先验学习**问题,在共享潜在空间中用单个 flow transformer 联合建模干净 RGB 与多光谱图像的分布,并以不同 cloudy 观测流和可选 SAR token 作为条件。这种统一建模方式使得训练好的模型能够直接处理单/多时相、RGB/多光谱、有无 SAR 辅助的任意组合输入,无需在推理时为每种组合切换模型或进行数据集特定微调。与逐任务设计的判别式云去除模型相比,GeoCR 的生成式框架保留了更多结构先验和分布多样性,在 FID 和 DISTS 等感知指标上优于现有方法,且支持 LoRA 低秩适配进行个性化调整,体现了遥感图像复原从专用模型向通用基础模型演进的趋势。

方法

输入与输出

GeoCR 接收异构去云任务输入:RGB 或多光谱 单时相/多时相多云观测,可附带 SAR 引导。输出为对应的无云影像,光谱通道与输入匹配(RGB 或多光谱全波段)。模型不依赖特定数据集,支持 单时相、多时相、有/无 SAR 等多种配置。

关键模块

  • 输入/输出 stems:在预训练 RGB 自动编码器 基础上,新增紧凑 stem 将不同光谱/传感域映射到共享潜在空间;编码器/解码器主干保持冻结,仅训练 stems。
  • 共享潜在接口:一个 流变换器(flow transformer)联合建模干净 RGB 与非 RGB 潜在表示,以分离的多云观测流和可选 SAR token 为条件。
  • 两阶段训练:
    1. Stage 1:重建式 stem 适应,使不同配置的输入能正确映射到预训练潜在空间。
    2. Stage 2:联合去云预训练,使用条件潜在流匹配,在大规模多源数据(10 数据集,883,331 张无云目标)上学习共享去云先验。

推理与适应

预训练 checkpoint 支持直接推理,无需数据集特定微调;也可通过 LoRA 高效适应到新配置。

与同类方法差异:与分别针对 RGB 或多光谱、单时相或多时相训练的专用模型不同,GeoCR 通过共享潜在空间和联合流匹配,在单个网络中统一多种去云设置,实现跨传感器与光谱的泛化。

实验

实验设计

GeoCR 在十个异构数据集的联合训练集上预训练,共包含 883,331 张无云目标图像。模型冻结预训练 RGB 自编码器的 encoder/decoder 主干,仅训练紧凑的输入/输出 stems 和一个 flow transformer,在共享 latent 空间内统一建模 RGB 与非 RGB 表征,同时接受多时相云观测和可选 SAR 令牌作为条件。评估在 SEN12MS-CR、Sen2_MTC_New 和 CUHK-CR2 三个测试集上进行,覆盖 full-band 与 RGB-only 两种设置,对比通用图像复原和专用云去除方法。

关键发现

单一预训练 checkpoint 可直接推理,无需逐数据集微调;通过 LoRA 可高效适配新场景。在 full-band 的 SEN12MS-CR 与 Sen2_MTC_New、以及 RGB-only 的 CUHK-CR2 上,GeoCR 取得了最佳的 FID 和 DISTS,表明其跨传感器、光谱配置和观测模式的泛化能力。

与基线对比解读

相比专用云去除模型,GeoCR 利用共享 latent 先验避免了为每个数据配置单独训练的开销;相比通用图像修复模型,其引入的条件流匹配和 SAR 指导机制专门针对云去除任务,在多模态证据融合上更有优势。但论文未在摘要中给出具体数值,需查阅正文获取定量对比。

行业影响

落地场景

GeoCR 的通用去云能力可嵌入遥感数据预处理管线,服务于 农业保险、灾害应急、环境监测 和 地图更新 等业务。典型产品包括卫星影像 API 服务、农业分析平台、保险定损系统。该模型统一处理 RGB 与多光谱、单时相与多时相、可选 SAR 引导,使单一模型覆盖多源传感器,减少为每个数据集维护专用模型的工程负担。

商业价值

  • 降本:用单一预训练 checkpoint 替代多套专用去云模型,降低训练、部署和维护成本;支持 LoRA 适配进一步降低微调成本。
  • 增收/体验提升:提高可用影像数量与质量,减少因云遮挡导致的数据缺口,提升下游分析精度(如作物分类、灾损评估),增强产品竞争力。
  • 时效性:多时相与 SAR 融合可更快获得无云影像,加速应急响应。

与现有产品/工作流的接口

GeoCR 以 冻结的 RGB 自编码器主干 + 轻量 stem 适配 为架构,可无缝集成到现有基于 RGB 自编码器的生成式图像处理 stack。API 形式提供输入输出张量接口,支持直接推理或 LoRA 微调。对于遥感平台,可作为预处理模块插入影像服务流水线,接受多光谱/单时相输入,输出无云影像。模型权重小(仅需训练 stem 和 flow transformer),适合云端或边缘部署。

具体落地 use case

  1. 农业保险定损:保险公司使用卫星影像评估洪涝或干旱后的作物受损面积。GeoCR 去除云遮挡,生成完整的多光谱时间序列,使定损模型能在更多日期获得有效输入,提高理赔精度。
  2. 全球地图服务商:如 Google Earth / Bing Maps 更新卫星底图时,经常遇到云遮挡。GeoCR 可处理多时相影像,自动合成无云底图,减少人工筛选和重拍成本。

局限

  • **泛化边界**:GeoCR 在十个数据集上联合预训练,覆盖 RGB / 多光谱、单时相 / 多时相与 SAR 辅助等配置,但其 stem 适应模块依赖于预训练 RGB autoencoder 的冻结 trunk。对于未参与预训练的传感器光谱响应、辐射定标或几何分辨率,stem 的适配能力可能有限,零样本推理可能无法保证与参与预训练数据集相当的性能。实际部署时仍需针对新数据域进行 LoRA 微调或重新训练少量 stem 参数,这削弱了“单一预训练 checkpoint 直接通用”的实用性。
  • **评估指标局限**:论文在 full-band SEN12MS-CR、Sen2_MTC_New 和 RGB-only CUHK-CR2 上报告了最佳 FID 和 DISTS,但未公开 PSNR / SSIM / SAM 等像素级或光谱保真指标。对于需要定量辐射精度(如地表反射率反演)的下游任务,仅凭分布感知质量可能不够,GeoCR 或许在严格参考对齐上不如专门的物理模型或监督回归方法,这限制了其在高精度定量遥感场景中的采用。
  • **计算与数据需求**:GeoCR 依赖 883,331 张无云图像的联合预训练,且包含多个输入流(cloudy optical、SAR token)和 flow transformer 生成器。虽然论文强调单一 checkpoint 支持推理,但在训练和推理阶段的计算 / 显存开销并未详细分析,可能对资源有限的边缘设备或快速迭代场景不友好。相比专用轻量级 CR 模型,其部署成本可能更高,需要进一步压缩或蒸馏才能用于实时处理。
论文Jeonghyeok Do2026-09-26原文

相关内容