论文

TESSERA v2: 扩展像素级地球基础模型

TESSERA v2: 扩展像素级地球基础模型

像素级地球观测基础模型通过生成空间嵌入实现了最先进的性能,但其缩放规律和预训练预算的最佳分配尚不明确。我们进行了迄今最大规模的地球观测控制实验:在固定像素级 Barlow Twins 框架内,使用 1,024 个 GH200 超芯片进行 395 次训练,每次均在 15 个下游任务上评估。 主要发现: 1. 预训练损失几乎不能预测下游性能(|Pearson r| < 0.2),按损失选择模型会浪费大量算力。 2. 随着训练预算增长,编码器和数据应同步增长,而投影器保持固定——这给出了算力分配的简单规则。 基于此规则,我们训练了 0.5B 和 1B 参数的像素级模型(2B 模型正在训练),并将其蒸馏为紧凑的学生模型用于嵌入即数据部署。2100 万参数的蒸馏模型 TESSERA v2-1B-M 在总体性能上超过了所有测试的开源和专有模型(其中一些规模大数个数量级)。这些学生模型生成 Matryoshka 表征,服务成本低廉:仅 16 维前缀即可保留完整 128 维性能的 92%,存储仅需 1/8。训练完成后,我们计划发布覆盖 2017-2025 年的全球嵌入。 综上,我们为缩放像素级地球观测基础模型提供了具体、经验验证的配方:训练大的编码器、根据下游性能选择、蒸馏为灵活的学生模型。所有代码将在 https://github.com/ucam-eo/tessera 开源。

论文精读

TL;DR 通过大规模实验揭示地球观测基础模型规模化法则:编码器和数据需随算力增长,投影器固定;蒸馏出21M参数小模型即超越超大模型,并支持Matryoshka高效部署。

问题

像素级地球观测(Earth Observation,EO)基础模型通过生成空间嵌入(spatial embeddings)在下游任务中取得领先性能,但如何高效分配预训练计算预算以最大化下游表现,一直缺少系统的实证指引。现有方法普遍依赖预训练损失 作为模型筛选或超参调整的代理指标,然而,TESSERA v2 的大规模受控扩展研究(395次训练)表明,预训练损失与下游任务性能几乎不相关(|Pearson r| < 0.2),这导致大量计算被损失看似更优、实际下游表现平庸的模型浪费。同时,在固定计算预算下,编码器容量、投影器大小和训练数据量的最优分配规则未知,传统做法是成比例放大所有组件,可能并非最优。

该问题的技术难点在于:像素级EO下游任务多样(如语义分割、变化检测、回归等),且损失函数与最终性能之间的映射关系复杂、非线性,远不如语言模型中 next-token 损失那般具有预测性,因此需要下游任务驱动的扩展律。此外,实际部署场景(如全球地物覆盖分析、变化监测)要求轻量、低延迟的推理服务,而原始大模型参数量动辄数亿,存储与计算成本 构成严峻挑战。

这一挑战与语言模型 早期探索类似:BERT 的预训练困惑度与微调后 GLUE 得分之间相关性有限,促使社区关注基于下游任务的选择和蒸馏策略。TESSERA v2 为像素级EO引入了同样的经验法则:大规模编码器预训练、下游择优、蒸馏出灵活的学生模型,并产出Matryoshka 表示 以支持多级存储与推理的性价比。

类比:如同LLM领域发现扩展律后推动模型参数与数据的协同增长,EO需要类似的下游性能驱动扩展律 来指导从 0.5B 到 2B 甚至更大模型的训练资源分配。

核心洞察

  • **预训练损失几乎无法预测下游任务性能:** 在 395 次训练运行中,预训练损失与 15 个下游任务性能的 Pearson 相关系数 |r| < 0.2,表明用损失选模几乎等同于随机。这一发现挑战了标准预训练中依赖损失作为模型选择代理的惯例,尤其与 NLP/CV 领域不同,揭示了地球观测中空间嵌入质量更依赖任务特异性,必须通过下游评估来指导模型选择,避免大量计算浪费。
  • **随着计算预算增加,编码器和数据量应同步扩展,而投影器保持固定:** 这是从大规模控制实验中得出的计算分配规则,与同时缩放所有组件的常见做法相反。具体而言,在固定 Barlow Twins 框架下,增大编码器和增加数据可有效提升下游性能,而投影器容量对性能提升贡献甚微。这条规则为未来训练更大的像素级 EO 基础模型提供了直接的工程指导,优化了硬件资源的利用效率。

方法

输入

像素级遥感时间序列:每个空间位置对应一段多光谱、多时相观测(如 Sentinal-2 2 年堆叠)。训练时对同一像素的时序段做随机增广(掩码、抖动、光谱变换),生成两个视图。

教师模型预训练

采用 Barlow Twins 自监督框架,架构包含一个可伸缩的 ViT 编码器(Encoder)和一个容量固定的 MLP 投影器(Projector)。训练目标是最大化不同增广视图嵌入的互相关矩阵的对角一致性,同时消去非对角冗余。

大规模受控实验发现关键缩放规则:

  • 编码器与数据量应同步增长,以消耗更大的预训练预算;
  • 投影器容量保持恒定,增加其参数量不会带来下游收益;
  • 预训练损失无法预测下游性能(|Pearson r| < 0.2),故模型选择必须基于下游任务分数,而非验证损失。

蒸馏与嵌套表示

使用上述规则训练出 0.5B/1B 教师模型后,将其知识蒸馏至小型学生网络(≈21M 参数)。蒸馏目标为 Matryoshka 蒸馏损失:在多个嵌套维度(如 16、32、64、128)上对齐学生输出与教师嵌入的排序关系,从而让学生直接输出可裁剪的 Matryoshka 嵌套嵌入。推理时采用 自适应桶采样(adaptive bucket sampling)聚合时序信息。

输出

学生模型对每个像素生成 128 维嵌入向量,其前 16 维前缀即可保留 92% 的全维度下游性能,存储降低至 1/8。该嵌入可直接作为语义特征用于分类、回归、变化检测等下游任务,无需额外微调。

与同类自监督遥感模型的差异点:本工作首次通过 395 次受控训练系统地量化了像素级基础模型的缩放行为,并将模型选择准则从损失驱动转变为下游任务驱动,配合蒸馏产生的嵌套嵌入,实现了小参数下的极致推理效率。

实验

实验设计

本研究进行了目前最大规模的地球观测 (EO) 基础模型控制性缩放实验。基于固定的像素级 Barlow Twins 架构族,在 1,024 块 GH200 超级芯片上执行了 395 次独立训练运行,每个模型在 15 个下游任务上评估。通过系统改变编码器大小、投影器大小和训练数据量,探索预训练计算预算在模型组件之间的最优分配。

关键发现

  1. 预训练损失不能预测下游性能:Pearson 相关系数 $|r| < 0.2$,表明单纯依据损失选择模型会浪费大量计算资源。应直接基于下游任务指标进行模型筛选。
  2. 计算预算的最优分配规则:随着训练预算增加,编码器参数和训练数据量应同步增长,而投影器规模保持固定。这一规则简单实用,可为大规模训练提供清晰的算力分配指导。
  3. 高效蒸馏部署:应用上述规则训练了 0.5B 和 1B 参数的教师模型,并将其蒸馏为仅 21M 参数的紧凑学生模型 TESSERA v2-1B-M。学生模型输出 Matryoshka 嵌套表示,仅使用 16 维前缀即可保留完整 128 维性能的 92% ,存储需求降至 1/8,极大降低推理成本。

与基线模型的对比深度解读

TESSERA v2-1B-M 在综合基准上全面超越所有被测的开放和专有 EO 基础模型,其中部分模型参数量大数个数量级。这一结果并非单纯依靠更大规模的预训练堆叠,而是源自下游驱动的缩放定律蒸馏策略的有机结合。传统 EO 基础模型往往直接增加模型尺寸以求性能提升,但 TESSERA 的发现表明:合理的算力分配(编码器与数据共同扩增、投影器固定)比盲目扩大模型更有效;再通过面向部署的知识蒸馏,可将大模型能力无损压缩至轻量级学生模型,实现性能与效率的双重领先。此外,嵌套表示让同一嵌入可根据不同存储/精度需求灵活截取,无需重新训练或存储多份,这一设计为 EO 嵌入产品的实际落地提供了极具竞争力的工程方案。

行业影响

落地场景

该工作可直接嵌入遥感数据价值链,为 地理空间情报平台农业科技、灾害响应、碳信用核查 等场景提供通用、低成本的像素级特征。例如,农业保险公司 可将其用于田块尺度作物健康与产量预测;气候科技企业 可基于逐年全球嵌入快速评估森林退化或土壤碳汇变化;地图与物流公司 可将变化检测嵌入实时更新路网或建筑轮廓。

商业价值

降本 是核心卖点:21M 参数的蒸馏学生模型在性能上超越千倍大的专有模型,且支持 Matryoshka 表示,16 维前缀即可保留 92% 性能,存储成本降至 1/8。推理时无需重型编码器,可直接使用预计算嵌入,显著降低 API 调用费用和延迟。增收 路径上,厂商可将高质量全球嵌入作为数据产品出售,或基于其快速开发高精度垂直应用(如 ESG 报告自动生成),缩短上市周期。

与现有工作流的接口

模型以 embeddings-as-data 范式交付,天然适配现有 ML stack:

  • 输出为标准 npyzarr 格式,直接接入 GDAL/Rasterio 等 GIS 工具链;
  • 可像普通特征向量一样用于下游分类、回归或聚类,无需修改现有框架;
  • 蒸馏学生模型提供轻量推理代码,便于边缘设备或浏览器端集成;
  • 计划发布的全球 2017–2025 嵌入可作为 静态数据集 被查询,与大数据平台(如 Spark/Dask)联动。

具象用例

  1. 碳信用市场:核查机构利用逐年 TESSERA v2 嵌入,追踪全球任一像素的植被扰动历史,自动化生成审计报告,替代昂贵的人工野外调查。
  2. 农业供应链:食品巨头可整合近实时卫星嵌入,监测签约农田是否遵守免耕或轮作承诺,预警违约风险,支撑可持续采购承诺。

局限

  • 研究仅在 **Barlow Twins** 自监督框架下进行缩放实验,虽然通过 395 组训练严格控制变量,但未检验其他主流目标(如 **MAE**、**DINO**)是否遵循相似的扩展规律。若将结论(如编码器与数据同步增长、投影器固定)直接迁移到不同架构,可能带来性能风险。
  • 下游任务集由 15 个常见地球观测基准组成,主要覆盖分类与回归,缺少时序变化检测、多模态融合等更复杂的场景。这可能高估模型的真实泛化能力,且“预训练损失无法预测下游表现”这一结论在其他任务类型下是否成立,仍有待进一步验证。
论文Zhengpeng Feng2026-07-04原文

相关内容