论文

The Galaxy's Guide to the Tokenizer: 科学基础模型的基准测试

The Galaxy's Guide to the Tokenizer: 科学基础模型的基准测试

标记化(tokenization)是将科学数据适配到基于 Transformer 的基础模型的核心步骤,但其对学习表示的影响仍不明确。我们在一个统一的 Transformer 框架中比较了四种标记化策略——Affine、AIM、JetFormer 和 VQ-VAE,应用于天文成像任务。 使用来自 DESI Legacy Survey 的 640,000 张星系图像和共享的 AstroPT 骨干网络,我们从重建保真度和物理属性预测两方面评估每种方法。结果揭示了各方法间的权衡:基于流的 JetFormer 实现了更高的重建质量,而 VQ-VAE 在星系物理属性探针任务上表现强劲;Affine 和 AIM 则更好地保留了局部形态信息。 我们发现重建质量与表示质量是解耦的,且没有单一方法在所有任务中持续表现最佳。通过将评估基于独立测量的物理量,本研究旨在突出科学数据作为构建可解释基础模型基准的潜力。

论文精读

TL;DR 在天文图像基础模型中系统对比四种分词方法,发现重建质量与表示质量解耦,倡导以独立测量的物理量构建可解释基准。

问题

问题背景

Transformer 基础模型正在天文学等科学领域加速落地,用于从海量观测图像中预测星系物理参数。然而,与模型架构的广泛探索相比,tokenization 策略——即将像素映射为序列化 token 的方式——始终未得到系统研究,其对所学表征质量的影响尚不明朗。

现有方法的局限

当前主流 tokenizer 可分为四类:Affine(线性投影)、AIM(自回归图像建模)、JetFormer(基于流的量化)、VQ-VAE(矢量量化变分自编码器)。已有工作通常仅孤立地选用其中一种,缺少在统一骨干(如 AstroPT)下的公平对比,导致两个关键盲区:

  • 评估指标与物理规律脱节:多数工作仅报告重建 PSNR 等像素级指标,但高重建质量未必代表编码了准确的物理知识(如红移、恒星质量);
  • 表征与重建的耦合误解:业界常默认“更好的重建 → 更好的表征”,但多任务物理属性预测证明二者可以解耦,且不同 tokenizer 在不同科学任务上优势各异。

为什么这个问题难且重要

  1. 物理可解释性要求严苛:token 序列必须从图像中抽取并保留微小形态特征(旋臂、并合潮汐尾等),这对量化策略的离散化粒度和信息压缩比提出挑战。
  2. 多物理任务协同评估:科学基础模型最终要服务于多个下行任务(红移估计、恒星质量推断、形态分类),没有单一指标能全面评价tokenizer,必须构建物理真值驱动的多维度基准。
  3. 工程权衡:流模型(JetFormer)重建细腻但计算成本高;VQ-VAE 物理预测强但可能丢失局部细节;线性方法(Affine、AIM)则更纯粹保留形态但物理表征能力适中。如何为特定科学应用选择 tokenizer 尚无指导原则。

行业类比

该问题与 自监督视觉 Transformer(如 MAE)中 patch 划分策略类似:不同 tokenization 粒度直接影响下游语义分割和检测的性能,但天文学额外提供了独立测量的物理真值,使表征评价从“任务代理”跃迁为“物理真实性验证”。

核心洞察

  • **重建质量与下游物理探针性能解耦**:流模型 JetFormer 在图像重建上表现最优,但基于 VQ-VAE 的 tokenizer 在预测星系物理属性(如红移、恒星质量)时效果更佳。这与传统图像 tokenizer 设计中“重建越好则潜在表征越丰富”的假设相悖,提示在科学数据上,tokenizer 的优化目标应脱离纯信号保真度,转而考虑下游物理知识的提取。该发现为科学基础模型选择 tokenization 策略提供了任务相关的取舍依据,区别于仅关注感知质量的工作。
  • **科学数据提供天然物理锚定基准**:利用 DESI Legacy Survey 中独立测量的星系物理参量作为 ground truth,本文构建了以物理一致性为评价核心的基准,而非依赖人工标注或下游分类精度。这种评估范式使得不同 tokenizer 产生的潜在表征可直接通过预测真实物理量的能力进行比较,为科学基础模型的可解释性评估提供了客观标尺,也为其他科学领域(如气候、生物医学)借鉴此类物理锚定评估提供了范例。

方法

方法:统一框架下 tokenization 的系统性对比

输入数据:使用 DESI Legacy Survey 提供的 640,000 张多波段星系图像,每张均附带独立测量的物理参数(红移、恒星质量、恒星形成率等),构成物理 grounded 的 ground truth。

关键模块与实验管线

  1. Tokenization 策略:为剥离 tokenization 对表征的影响,在同一 AstroPT(天文图像预训练 Transformer)骨架下比较四种方法:
    • Affine:朴素线性投影,将图像 patch 展平后经仿射变换映射为 token 序列。
    • AIM(Autoencoding Image Models):自编码器风格,随机掩码 patch 并训练重建,token 由编码器的隐层表示产生。
    • JetFormer:基于流的生成式 tokenizer,利用归一化流对 patch 分布建模,支持高保真似然估计与离散 token 生成。
    • VQ-VAE:引入矢量量化码本的变分自编码器,通过离散化连续特征实现压缩,侧重语义保留。
  2. 共享 Backbone:所有 tokenizer 产出的 token 序列送入固定架构的 AstroPT,一个适配天文数据的 Vision Transformer 变体,仅替换 tokenizer 模块以确保差异的唯一来源。
  3. 多任务评估
    • 图像重建:将 backbone 输出的潜在表征经对应解码器重建原图,使用 MSE、SSIM 等指标衡量信息保留程度。
    • 物理参数探测:在 latent 表征上训练线性回归头预测星系物理属性(红移、质量、恒星形成率),通过线性可分离性评估表征对物理规律的编码能力,无需端到端微调。

该设置的独特之处在于:不依赖任务特定标签微调,而是以物理探测性能作为表征质量的直接判据,揭示了重建质量与物理知识保留的脱钩——例如 JetFormer 重建更好,但 VQ-VAE 在物理参数预测上表现更优。与常规视觉基准仅关注像素或分类指标不同,本文首次将独立测量的物理量引入基础模型评估,为科学领域可解释基准设计提供了新视角。

实验

实验设计

DESI Legacy Survey64 万张星系图像 为基础,统一使用 AstroPT 作为 transformer 骨架,横向对比四种 tokenization 策略:Affine(线性变换)、AIM(自回归图像模型)、JetFormer(基于流模型)和 VQ-VAE。评估维度兼顾重建保真度与下游物理属性预测,物理量包括红移、恒星质量、恒星形成率等独立测量值,构成物理可解释的评估框架。

关键发现

  • JetFormer 在图像重建质量上领先,反映其连续流建模对像素级保真度的优势。
  • VQ-VAE 的离散编码在预测星系物理属性时表现最强,可能与量化带来的紧凑表示有关。
  • AffineAIM 更好地保留了局部形态信息(如旋臂、潮汐尾),适合形态分析。
  • 重建质量与表示质量明显脱钩——高重建 PSNR 并不保证更强的物理量预测能力。
  • 没有任何单一 tokenizer 在所有任务上全面胜出,揭示出任务相关性与表示偏差的深层权衡。

与同类工作对比

不同于仅关注图像生成或分类的 tokenization 对比,本研究将评估锚定在 独立测量的物理量 上,使 benchmark 更具科学解释力。相比依赖语义标签的 CV 任务,星系物理参数为连续、客观的真值,帮助揭示 tokenizer 在捕捉结构化先验方面的差异。JetFormer 的流式设计虽然重建精细,但在物理探针上并未超越 VQ-VAE,这暗示连续 vs. 离散表示在科学预测任务中可能存在本质差异,对后续天文基础模型设计有直接指导意义。

行业影响

落地场景

该工作量化了科学基础模型中 tokenization 对表征质量的影响,其方法论可直接迁移至工业界依赖结构化物理观测的场景。一是遥感与地球观测平台:卫星影像的云层去除、地表分类等任务中,不同 tokenizer(如 VQ-VAE、流模型)的选择直接影响下游物性反演精度。二是医疗影像分析:CT/MRI 重建与病变检测需在像素保真度和病理特征提取间权衡,本研究的解耦发现可指导选择更适合临床的 tokenizer。三是工业缺陷检测:高分辨率产线图像通过序列化 token 输入 Transformer,tokenization 方式决定了对局部瑕疵形态的保持能力。

商业价值

降本增效的贡献体现在三方面。首先,通过基准测试提前锁定最优 tokenizer 与任务配对,可减少模型选型阶段的试错成本,缩短从数据到可部署模型的周期。其次,在内容平台/云服务中,图像/视频压缩与传输时,选择重建质量优先(如 JetFormer)或语义保持优先(如 VQ-VAE)可直接降低带宽成本并提升用户体验。最后,对于提供预训练模型 API 的企业,明确 tokenizer 特性有助于产品分层:面向视觉重建场景和面向物理量预测场景的模型可差异化定价,实现收入最大化。

与现有产品/工作流的接口

该方案可作为数据预处理插件整合进现有 MLOps 链路。具体地,在数据进入 Transformer backbone 前增加一个可插拔的 tokenizer 模块,支持 Affine/AIM/JetFormer/VQ-VAE 四种策略。通过 GitHub 开源的 AstroPT backbone 和标准化评估协议,团队可直接在其自有的科学或工业图像数据集上运行比较实验。模型上线后,该 tokenizer 模块可根据线上 A/B test 的物性预测误差重建质量指标动态切换,无需改动下游任务 head。

具体落地场景案例

  • 自动驾驶感知:将 LiDAR 点云投影为 2D 深度图后,对比不同 tokenizer 在三维物体检测精度(类比物理参数预测)与深度图补全质量(类比图像重建)之间的权衡,选取最适合在线感知流水线的方案。
  • 保险定损:事故车辆图像通过 tokenizer 序列化后,需同时保持损伤区域细节(形态学信息)和全局损伤程度估计(物理量预测)。可参照本工作结论,使用 Affine tokenizer 保留局部形态,并与 VQ-VAE 的物理量预测能力互补,构建多任务定损模型。

局限

  • **任务依赖性与缺乏指导原则**:研究发现重建质量与表征质量解耦,且没有单一 tokenizer 在所有任务上一致最优,这本身即承认了**当前缺乏通用的 tokenizer 选择准则**。然而,论文未从理论上分析不同方法产生差异的原因,也未给出面向特定下游任务(如物理参数回归 vs. 形态分析)的实用选择建议,仅停留在现象描述层面。
  • **实验范围的窄化**:评估仅基于**单个天文数据集**(DESI Legacy)和**单一模型骨干**(AstroPT),未探索不同 transformer 规模、架构或训练预训练目标的影响。天文图像特有的噪声、点扩散函数等特性可能主导 tokenizer 行为,结论是否能迁移到其他科学成像领域(如医学、材料科学)存疑。同时,下游任务仅限于重建和物理参数回归,缺乏**密集预测、分割或异常检测**等更丰富的科学场景。
  • **工程实用性与计算代价评估不够**:与计算机视觉中成熟的简单线性投影或重叠卷积 patch 相比,**JetFormer**(基于流模型)和**VQ-VAE** 等复杂 tokenizer 在训练和推理中拥有更高计算成本。论文虽提供碳足迹,但未系统对比各方法在吞吐量、内存占用和收敛速度上的差异,对实际工程部署的决策支持不足。未讨论 tokenizer 训练开销是否可以被预训练或下游收益抵消。
论文Sogol Sanjaripour2026-06-24原文

相关内容