TerraDiT-Ω: 基于任意地理空间基元的卫星图像合成统一空间控制
生成模型取得了显著进展,但将其应用于卫星影像仍面临挑战。与自然影像不同,卫星场景由空间复杂且语义不同的几何结构组成。先前的工作通过采用密集栅格或稀疏提示来适配自然图像框架,以权衡标注成本与保真度,但破坏了与常用于表示地理信息的矢量基元的兼容性。 我们提出了 TerraDiT-Ω,一个统一空间控制框架,可直接从任意原生地理空间基元生成卫星影像。通过联合利用精确标注(多边形、折线)和粗略标注(边界框、点),该模型支持在不同标注预算下实现可控布局,拓宽了在城市规划等设计任务中的适用性,同时自然兼容端到端的地理空间人工智能工作流。为了在生成过程中有效利用这些基元,我们提出了 几何感知局部注意力,一种将显式几何线索注入注意力空间的调节机制。 在所有调节格式下,我们的方法均优于密集控制和稀疏控制基线。此外,这种灵活性使得仅使用单一生成模型即可进行可控的合成数据增强,提升了下游任务性能,包括:土地覆盖分割、目标检测、道路图提取和场景分类。代码、数据和权重已开源。
论文精读
TL;DR TerraDiT-Ω 统一支持任意地理空间基元(点/框/多边形/折线)控制卫星图像生成,通过几何感知局部注意力注入空间线索,在不同标注预算下均优于密集与稀疏控制基线。
问题
问题背景
可控生成在卫星图像领域的关注点,是将空间约束精准注入生成模型,以支持规划、仿真及合成数据增强等下游 GeoAI 应用。
现有方法局限
- 密集控制法:如将 ControlNet 等框架直接迁移到遥感图像,依赖语义分割图等像素级栅格条件。这类精细标注耗时费钱,且与 GIS 行业通行的矢量数据格式(多边形、线、点)不兼容,导致工作流割裂。
- 稀疏控制法:使用边界框、点或文本提示虽降低了标注成本,但丢失空间几何细节,生成物体的形状、方位与连通性保真度不足,难以满足道路提取、建筑检测等对几何精度要求高的任务。 两种方案均无法在任意标注预算下提供统一的空间控制,且忽视了地理空间数据的原生矢量表征。
为什么这个问题难/重要
卫星场景中的地物具有强几何规律性——道路呈线状、农田呈块状,空间关系远比自然图像复杂。要让生成模型理解多边形边界、折线拓扑及多种原语的组合约束,需要设计能显式编码几何线索的注意力机制。同时,不同下游任务(土地覆盖分割、目标检测、道路图提取)所需的标注粒度差异很大,一个统一框架若可接受从粗略框到精细多边形等多种输入,将极大降低数据准备成本。业界急需这类单一模型,以支撑从城市设计草图生成图像、到可控数据增强提升小样本学习性能等实用场景。
如同自动驾驶领域用矢量化高精地图生成驾驶场景来提升感知模型,TerraDiT-Ω 让地理空间工作者直接编辑原生几何图元,端到端驱动图像生成,打通 GIS 数据到视觉仿真的闭环。
核心洞察
- 统一原生地理基元控制:TerraDiT-Ω 能够直接使用多边形、折线、边界框、点等矢量基元进行图像生成,而无需转换为密集栅格或依赖稀疏提示。这突破了先前方法在标注成本与生成保真度之间的取舍,因为密集控制(如分割图)昂贵但保真度高,稀疏控制(如点)便宜但结构信息不足,本方法通过联合利用多精度基元,实现了布局控制力度与标注成本的灵活平衡。
- 几何感知局部注意力:通过 Geometry-Aware Local Attention,模型在注意力计算时注入显式几何先验,使生成过程更精准地遵循基元形状与边界。相比将基元编码为条件嵌入或渲染为栅格再卷积处理,该机制直接作用于空间注意力图,对线、面等结构的扭曲与粘连问题具有更强的鲁棒性,尤其在细粒度道路图或建筑边界生成上优势明显。
- 端到端 GeoAI 工作流兼容:TerraDiT-Ω 的原生基元接口自然融入地理空间分析流水线,无需额外的栅格化或后处理,即可直接为地物分类、目标检测、路网提取等下游任务提供可控数据增广。单一生成模型可适配多种标注质量,显著简化了在真实 GIS 场景中的部署复杂度,并有效提升稀缺标注场景下的下游模型性能。
方法
输入:地理空间基元统一建模
TerraDiT-Ω 直接接受 原生地理空间基元 作为空间条件,包括 多边形(polygons)、折线(polylines)、边界框(bounding boxes) 及 点(points)。这些基元以矢量形式表示,能够保留精确的空间布局与语义信息,支持从粗糙标注到精细标注的连续可控性。训练时,模型通过从同一数据源中采样不同精度的基元,学习从任意混合输入中生成图像。
关键模块:基于扩散 Transformer 的架构与几何感知局部注意力
模型主干为 扩散 Transformer (DiT),在去噪过程中融入空间控制信号。核心创新是 几何感知局部注意力 (Geometry-Aware Local Attention, GALA),它替代了标准自注意力层。GALA 通过构建局部注意力掩码,强制查询 Token 仅关注位于同一几何基元区域内的 Key/Value,从而将显式的几何约束注入特征交互。这种机制使生成过程既能保持全局一致性,又能精确遵循每个基元定义的边界与形状。此外,模型联合学习一个基元编码器,将各类矢量基元转换为统一的 Token 序列,并与时间步嵌入、文本提示等条件融合。
输出:高保真卫星图像
经多步去噪后,模型输出与输入基元布局严格对齐的卫星图像。生成图像可用于城市规划等设计任务,或作为可控合成数据直接增强下游模型(如地物覆盖分割、目标检测、道路图提取、场景分类)。
与仅依赖密集栅格(如分割图)或稀疏提示(如框/点)的先前工作相比,TerraDiT-Ω 原生兼容行业标准的矢量基元,避免了栅格化带来的精度损失,并实现了从稀疏到密集控制的统一框架,无需针对不同标注预算训练多个模型。
实验
实验设计
TerraDiT-Ω 的实验围绕多粒度地理基元控制生成与下游任务数据增强展开。
- 生成质量评估:在不同标注精度(多边形、折线、边界框、点)下,对比两类基线:密集控制方法(如基于语义分割图的 ControlNet 变体)和稀疏控制方法(如基于框/点的 GLIGEN)。定量指标包括 FID、LPIPS 及控制精度指标。
- 数据增强验证:利用单一 TerraDiT-Ω 模型为土地覆盖分割、目标检测、道路图提取、场景分类四个任务合成训练数据,对比不增强、传统增强及其他生成模型增强。
关键发现
- 统一基元条件一致领先:在所有条件格式下,TerraDiT-Ω 的生成质量和布局可控性均优于专用密集或稀疏基线,尤其在混合粗细标注场景(如同时给定多边形和点)下,生成结果保持高保真与几何一致性。
- 几何感知局部注意力(GALA)有效:消融实验证实,注入显式几何 cue 的注意力机制是性能提升的关键,能强化局部区域的空间结构保持。
- 单模型多任务增强:仅用一个生成模型即可实现可控数据增强,显著提升下游四个任务的性能,且对标注预算具有弹性适应能力。
与基线对比的深度解读
密集控制方法(如 ControlNet)依赖逐像素栅格标注,虽能获得高精度但标注成本高昂;稀疏控制方法(如点、框)成本低但易丢失细粒度空间细节。TerraDiT-Ω 通过原生支持地理矢量基元,绕开了栅格化过程中的几何精度损失,同时继承了稀疏标注的灵活性。其核心机制 GALA 在注意力空间中直接注入线段、边界等几何约束,使模型在不同粒度的条件组合下仍能维持空间一致性,这是传统框/点条件方法难以做到的。实验结果表明,在遥感图像生成中,原生几何表示比传统栅格或稀疏提示更具优势,该框架为可控合成与 GeoAI 管线提供了一种更高效、更保真的新范式。
行业影响
落地场景
TerraDiT-Ω 的核心能力是从任意地理空间原语(多边形、折线、边界框、点)统一生成高保真卫星图像,直接适配地理信息系统 (GIS)、遥感分析平台与自动标注管线。典型业务包括:
- 智慧城市与基础设施规划:输入道路矢量与建筑轮廓,生成不同发展情景的俯视影像,辅助交通仿真、用地审批展示。
- 农业与林业监测:用点标注或田间边界框生成不同物候期、受灾情况的作物/林地图,用于产量预测、病虫害检测模型的训练数据扩充。
- 应急响应与保险定损:基于灾害区域的多边形,快速合成灾后影像,支持建筑物损毁分类器的迭代优化。
- 自动驾驶与高精地图:利用路网折线生成多视角卫星图,提升道路图提取模型对道路结构变化的鲁棒性。
商业价值
- 降本:通过可控生成替代昂贵的实地采集与人工标注,尤其在高分辨率卫星影像采购成本高的区域。实验显示该方法在土地覆盖分割、目标检测、道路图提取、场景分类四大下游任务上均带来显著性能提升,意味着用合成数据增强即可减少对真实标注数据的依赖。
- 增收:为 GIS 软件供应商、卫星数据平台提供“生成即服务”新功能,客户可按需定制训练集,创造新的订阅型收入。
- 体验提升:允许用户使用熟悉的矢量格式(shapefile、GeoJSON)直接操控生成结果,无需学习复杂的光栅编辑工具,降低使用门槛,加速从设计到仿真的迭代。
与现有产品/工作流的接口
TerraDiT-Ω 以扩散模型为核心,可无缝嵌入现有 GeoAI 栈:
- 输入为 OGC 标准矢量数据(通过坐标归一化与栅格化转为控制图),输出为 2D 遥感图像,可直接对接 PyTorch、TorchGeo 等框架。
- 可利用 Geometry-Aware Local Attention 作为条件注入模块,集成到其他基于 DiT 的生成器或 ControlNet 类架构中,适应不同分辨率需求。
- 数据增强环节可封装为自动化管道:从地理数据库抽取原语 → 生成多样图像 → 与现有标注联合训练下游模型,无需改动模型代码。
具体落地用例:
- 高精地图初创公司:使用全球路网 OpenStreetMap 折线数据生成不同气候、光照条件下的卫星图像,训练道路提取网络,降低对多国卫星影像采购的依赖。
- 农作物保险平台:根据农田边界多边形生成不同受灾等级的合成影像,扩充罕见灾害类别,提升理赔审核模型的准确率与泛化性。
局限
- **多原语联合训练的平衡性**:TerraDiT-Ω 统一接受多边形、折线、边界框、点等多种地理原语作为条件,但不同原语携带的结构信息粒度差异很大。联合训练时,模型可能偏向某类原语,导致在稀疏条件(如点、边界框)下的生成质量或可控性弱于专用稀疏控制模型。论文未详细分析各原语在训练中的梯度贡献或平衡策略,可能限制了在极端稀疏标注场景下的实用性。
- **几何注入的计算开销**:所提出的 Geometry-Aware Local Attention 需要为每个 token 动态构建局部注意力的几何掩码,计算复杂度与 token 数量和原语复杂度有关。论文未给出该模块的延迟、内存占用的定量分析,也未讨论在高分辨率生成(如 1024×1024 以上)时的可扩展性,这对其落地到实时交互设计或大区域批量生成构成潜在瓶颈。
- **标注依赖与分布外泛化**:训练依赖大量高质量矢量标注,数据集覆盖面有限(可能以特定地域/传感器为主)。模型对未见地理区域、气候、光照或成像参数变化时的生成保真度未做充分评估;同时,生成图像用于下游数据增强时的**标签一致性**(如分割掩码与合成图像的对齐误差)未量化,可能高估数据增强的实际增益。