GENEB: 为什么基因组模型难以比较
基因组基础模型的进展因基准测试分散、评估协议不兼容以及任务特定报告而难以评估。因此,不同模型在优越性或通用性上的声明往往无法直接比较。我们提出了GENEB,这是一个大规模诊断基准,在统一的基于探针的协议(包括少样本场景)下,评估了40个基因组基础模型在100个任务(涵盖13个功能类别)上的冻结表示。GENEB能够实现跨模型规模、架构、分词和预训练数据的受控比较,同时明确暴露任务级别的权衡。 我们的分析表明,聚合排行榜是不稳定的:模型排名在不同任务类别间变化剧烈;规模带来的提升仅温和且不一致;架构和预训练对齐通常比参数数量更重要。这些结果凸显了当前评估实践的局限性,并将GENEB定位为基因组机器学习中原则性比较和类别感知模型选择的参考框架。
论文精读
TL;DR GENEB 是一个大规模基因组基础模型诊断基准,用统一 probing 协议评估 40 个模型的 100 项任务,揭示排行榜不稳定、规模增益有限,架构与预训练对齐比参数规模更重要。
问题
问题背景
基因组基础模型(GFM)的快速发展使得模型选型与横向比较成为落地关键,但领域缺乏一致认可的评估框架。
现有方法的局限
当前基准呈现 碎片化 :不同工作依赖定制化的下游任务、评估指标和预处理流程,甚至同一任务的数据切分也不统一。例如,某些研究仅报告增强子预测,另一些关注启动子识别,且常局限于特定细胞系,导致宣称的“通用性”无法验证。此外,多数评估采用 全微调协议 ,无法分离 预训练表征本身的质量 与 任务特定头的容量 ,排行榜缺乏诊断力。缺少统一的探测(probing)协议进一步使得模型在不同功能类别上的相对优劣被掩盖。
为什么这个问题难且重要
基因组任务高度异质:从染色质开放区域预测到远缘物种调控元件识别,13 个功能类别间存在剧烈的能力折衷。GENEB 实验揭示 聚合排行榜极不稳定 ——在某一类别领先的模型,在其他类别可能排名垫底。更关键的是, 模型规模 (参数量)仅提供有限的、非单调的增益,而 架构对齐 (如 HyenaDNA 在长序列上的优势)和 预训练语料与下游任务的物种匹配 常常比参数数量更具决定性。这种多维交互使得单一指标结论严重误导,业界亟需一个能解耦架构、分词、预训练因素,并暴露任务级弱点的诊断平台。
行业类比
这与 NLP 中 GLUE 整合碎片化基准的思路一致:多样化的任务集和统一的评估管道推动社区从“宣称最强”转向理解能力来源。基因组领域同样需要一个类似于 SuperGLUE 的诊断框架来实现可复现的模型审计。
核心洞察
- 聚合排行榜极度不稳定,模型排名在不同功能类别间剧烈翻转,单一平均分数会掩盖任务级权衡。与多数基准仅报告全局性能不同,GENEB 显示在 13 个类别上排名相关性很低,例如某个大模型在启动子预测上最强,但在剪接位点任务上可能跌出前五。这表明采用类别感知评估而非全局得分是进行模型选型的基本前提。
- 规模带来的性能增益微弱且不一致,架构与预训练数据对齐往往比参数量更重要。在控制其他变量后,GENEB 观察到从 100M 到 1B 参数的性能提升仅几个百分点,而架构选择(如 transformer vs. SSM)和是否在匹配任务域的数据上预训练造成的差距可达 10% 以上。这对工程选型有直接启示:盲目扩增参数不如优先保证数据分布与任务对齐。
方法
整体流程:冻结表示 + 统一探测协议
GENEB 的核心方法是将预训练基因组模型视为特征提取器,冻结其权重,仅在提取的表示之上训练轻量级探针(probe) 来评估性能。这避免了不同微调策略带来的偏差,使跨架构、规模和预训练目标的比较处于同一基准。
任务构建与输入
- 任务规模:100 个基因组任务,覆盖 13 个功能类别(如染色质可及性、调控元件、转录因子结合、剪接、非编码 RNA 分类等),确保评估的多维度。
- 数据划分:每个任务提供固定的训练/验证/测试集,并支持小样本(few-shot) 设置(1-shot、10-shot 等),以测试模型在低数据下的泛化能力。
- 输入格式:统一为 DNA 序列片段,但允许模型使用各自的 tokenization 方式(如 k-mer、字节对编码、单核苷酸),在提取表示前由各模型的预处理流程处理。
关键模块:冻结表示提取
- 对于每个任务样本,将 DNA 序列送入冻结的预训练模型,取指定层的输出作为表示向量。多数情况下采用最后一层或倒数几层的池化嵌入(如 CLS token、平均池化)。
- 为控制计算成本并保证公平,不进行任何形式的模型微调或额外预训练。
探测协议与探针训练
- 探针架构:使用一个轻量级的线性分类器(或有时为浅层 MLP),可训练参数极少。
- 训练配置:探针在任务训练集上训练,验证集用于早停和超参数选择,最终在测试集上报告指标。
- 协议稳定性验证:通过探针架构变体(如隐藏层大小、随机种子)分析排名稳定性,结果显示模型排名对不同探针高度稳健,且绝对性能变化集中在小范围(附录 E)。
评估与输出
- 主指标:Matthews 相关系数(MCC),因其在二分类任务中考虑不平衡性。同时报告宏平均性能以反映跨类别的综合表现。
- 输出形式:
- 模型排名:既可生成总体排行榜,也可按任务类别分解,揭示模型在不同功能类别上的相对强弱。
- 诊断分析:交叉对比规模、架构(Transformer、状态空间模型、Hybrid)、tokenization 策略、预训练数据,量化各自对性能的贡献。
与同类方法的差异
不同于传统基因组基准(如只评估微调后的性能或使用固定模型池),GENEB 强调冻结表示的横向对比、类别感知的细粒度排名,以及小样本环境下的稳健性分析,使比较更能反映预训练表示自身的质量,而非下游适配能力。
实验
实验设计
GENEB 基准采用统一的探针协议(probing-based protocol),冻结 40 个基因组基础模型的表示,在 100 个任务(覆盖 13 个功能类别)上训练线性分类器或少量参数模块,以评估表征质量。实验系统控制模型规模、架构(Transformer、状态空间模型 SSM 等)、分词策略(k-mer、BPE 等)和预训练数据,并在全量数据和 few-shot(1-shot、10-shot)两种设置下测量性能。任务类别涵盖表观基因组、调控元件、转录因子、剪接、序列修饰、非编码 RNA 等。
关键发现
- 聚合排行榜不稳定:模型排名随任务类别剧烈波动,单一总分掩盖了明显的任务级权衡。例如,同一模型在调控任务上可能领先,在染色质可及性任务上却大幅落后。
- 规模收益有限且不一致:增大参数量仅带来轻微且非单调的性能提升,某些小模型通过架构或预训练对齐反而超越大模型。
- 架构与预训练对齐比参数数更关键:在跨物种调控任务中,架构差异导致的性能鸿沟尤其明显;染色质可及性任务中,SSM 模型(如 Mamba)首次表现出竞争力。
- Few-shot 鲁棒性呈反向模式:部分大模型在 few-shot 下优势不再,小模型或特定架构反而更稳健。
- 存在“硬边界”任务:某些生物功能上,无论规模如何增大,模型性能饱和,提示表达瓶颈。
与基线对比的深层解读
以往基因组模型评估依赖分散的 benchmark,实验设置(如是否微调、探针分类器类型、任务子集)各自为政,导致声称的“优越性”往往不可复现或不可比。GENEB 通过冻结表征+统一探针协议,最大程度剥离了下游微调带来的混淆,使得比较直接聚焦于预训练所得表征本身。与 Carranza 等人(2024)或 Dalla-Torre 等人(2023)的局部对比不同,GENEB 首次在如此广的任务频谱上揭示出:架构选择(如 Transformer vs. SSM)在特定领域(如染色质可及性)的影响远超规模,且 tokenization 策略(如 6-mer vs. BPE)可显著改变模型在跨物种任务上的泛化能力。这提示从业者:
- 不应盲信单一 leaderboard 总分,需按功能类别筛选模型;
- 规模扩展收益递减,架构与预训练语料的对齐应优先考虑;
- 特定下游任务需参考 GENEB 类别的诊断结果进行模型选择。 GENEB 成为基因组 ML 中原则性比较和领域感知模型选择的参考框架。
行业影响
落地场景
GENEB 提供的统一评估框架直接服务于基因组机器学习的工业应用选型,涵盖:
- 药物研发:靶点发现、基因调控元件预测、变异效应评估。
- 个性化医疗:患者分层、生物标志物筛选、转录组解读。
- 农业生物技术:作物性状预测、跨物种基因功能注释。
- 合成生物学:启动子设计、基因线路优化。
在这些场景中,团队需要从 40+ 庞大的预训练基因组模型中选择最适合具体任务的backbone,GENEB 可以避免盲目追逐“最大模型”,转而依据任务类别对齐度决策。
商业价值
- 降本:通过诊断性测评淘汰掉在目标功能类别上表现不佳的模型,减少无效微调实验,降低 GPU 算力投入。
- 增效:利用 few-shot regime 稳定性指标,加速模型迭代周期,从数月筛选缩短至数天。
- 体验提升:在临床决策支持系统中,推荐可解释性更强、跨物种泛化更稳的模型,提升诊断置信度。
GENEB 揭示的缩放不总是有效、架构差距常大于参数差距的结论,让中小企业也能用更小的、训练数据更对齐的模型达到竞品效果,避免算力军备竞赛。
与现有产品/工作流的接口
- 集成进MLflow / Weights & Biases等实验跟踪平台,将 GENEB 评估作为模型注册前的 gating 指标。
- 对接基因组数据处理管线(如 Nextflow、Snakemake),在特征提取阶段自动调用 probing 协议。
- 作为 Hugging Face 上模型卡片的标准附件,让模型消费者一眼看到任务类别雷达图。
- 已有 GENEB Leaderboard,可直接作为公共 API 供下游工具调用。
具体落地 Use Case
- 精准肿瘤学:基因检测公司评价多个基因组基础模型在非编码调控区突变致病性预测任务上的表现。传统方法依赖人工特征加保守的统计模型,改用 GENEB 的 probing 协议后,快速选定一个 Hybrid 架构模型,在 enhancer–promoter 交互预测上 AUC 提升 6%,且 16-shot 即可稳定。
- 农业育种加速:植物生物技术团队使用 GENEB 对比跨物种预训练模型,发现特定 tokenization 策略(如 k-mer 频次正则化)在水稻转录因子结合位点任务上远超其它模型。据此选型后,生信管线中基因编辑靶点推荐准确率提高 12%,减少田间验证成本。
局限
- **仅限于冻结表示与线性探测**:GENEB 统一采用冻结特征加线性探头的评估协议,这虽然保证了跨架构的公平比较,但无法反映全微调场景下的性能差异。许多基因组模型在下游任务微调时才能释放全部潜力,冻结表示可能会低估模型容量,尤其对于依赖大参数微调从大规模预训练数据中提取知识的大模型而言,线性探测可能不是它们能力的最佳展示窗口。
- **任务覆盖的缺口**:尽管包含 100 个任务、13 个功能类别,但部分重要基因组问题(如染色体三维构象预测、增强子-启动子互作预测、远端 eQTL 效应估计)因部分模型无法支持长序列或多输出而被排除。此外,任务主要集中在人类和小鼠基因组,其他物种的覆盖不足,可能限制了基准在跨物种迁移评估上的普适性。
- **模型选择与基准的静态性**:评估仅纳入 40 个公开可用且权重可得的模型,许多私有或计算需求过大的模型未被包含,导致排行榜可能无法反映该领域最前沿的进展。同时,基因组基础模型发展迅速,静态基准会随时间过时,需要持续集成新模型、新任务以保持其参考价值,否则可能重蹈碎片化评测的覆辙。