后训练如何塑造生物推理模型
生物科学推理模型结合了语言模型与在多模态生物数据(包括DNA、RNA和蛋白质)上训练的基础模型。这些模型通过后训练构建,但每个阶段如何影响推理与泛化仍不完全清楚。 我们研究了后训练何时提升性能、何时导致过专化。在基因组学、转录组学和蛋白质组学中,我们训练并评估了100多个生物推理模型,控制主干、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)等变量,测量域内(ID)和域外(OOD)性能。 结果表明:每个后训练阶段以不同方式重塑泛化,而非贡献均匀增益。CPT通过使模型对齐生物语言来提升下游性能。SFT持续提升ID性能,但导致OOD性能过早达到峰值后下降,因为模型拟合了训练分布。RL应用于强SFT检查点并对齐奖励时,可提升OOD性能,部分恢复泛化。 这些结果说明,生物推理并非随额外监督或计算单调提升,而是依赖于训练阶段的组合方式。在固定后训练预算下,最佳的ID-OOD权衡来自简短SFT、更大的RL分配以及各阶段的不对称适应能力。
论文精读
TL;DR 系统揭示生物推理模型的后训练阶段以截然不同的方式重塑泛化:SFT 提升 ID 但损害 OOD,RL 可恢复泛化,最优策略需短暂 SFT + 更多 RL。
问题
问题背景
生物推理模型正成为连接大型语言模型(LLM)与生物基础模型的核心方向,旨在整合基因组学、转录组学、蛋白质组学等多模态生物数据,执行通路预测、药物靶点发现等复杂科学推理任务。当前领域高度关注如何通过后训练(post-training) 将通用LLM转化为具备生物学专业推理能力的模型,但不同训练阶段对模型泛化性的塑造机制仍缺乏系统理解。
现有方法局限
现有后训练流程通常将持续预训练(CPT)、监督微调(SFT)和强化学习(RL) 视为顺序叠加的模块,默认每增加一个阶段即可单调提升性能。然而实际中:
- SFT在对齐到特定任务分布时,会显著提升分布内(ID) 准确率,但导致分布外(OOD) 泛化能力过早衰减,模型过度拟合训练集而丧失对新序列变异的鲁棒性;
- RL虽能部分恢复OOD性能,但其效果极度依赖于SFT阶段生成的策略质量和奖励模型的对齐程度,不当的奖励设计反而加剧过拟合;
- 缺乏对阶段间计算预算分配与适应能力的系统研究,多数工作仅在固定流水线上调整单一超参,无法解释不同阶段相互作用如何影响最终泛化边界。
为什么这个问题难/重要
生物学数据模态异构(DNA、RNA、蛋白质的序列、结构与功能标注),推理任务横跨序列理解、图谱构建和因果推断,ID与OOD评估空间巨大。模型在未见过的基因/蛋白质变异上的表现,直接关系到药物发现、精准诊断等高风险应用的可信度。后训练策略若导致OOD退化,可能使模型在真实世界新数据上产生错误结论。此外,生物基础模型计算成本高昂,每个后训练阶段都消耗大量算力,如何在不盲目增加训练量的前提下达成最佳泛化,是业界落地必须解决的成本-性能权衡难题。
行业类比
类似于自动驾驶感知模型在专有数据集微调后,面对新光照/天气条件时性能骤降,需要精细平衡领域特化与场景泛化;生物推理模型的后训练同样需要在“记住实验室条件”和“理解生物学底层规律”之间寻找最优解。
核心洞察
- 后训练各阶段并非统一增益,而是以截然不同的方式重塑生物推理模型的泛化能力,其中的非线性交互常被忽视。以往工作多将预训练后阶段视为性能的单调叠加,但本研究发现**继续预训练**对齐生物语言、**监督微调**牺牲OOD换取ID提升、**强化学习**则部分逆转OOD劣化。这种阶段间对抗/互补效应揭示了后训练不应仅堆砌更多监督信号,而是需针对任务精心编排阶段组合。
- SFT导致的OOD峰值早现与后续劣化,证实了生物推理中的过度专业化现象,而RL是逆转该趋势的有效手段。这区别于传统NLP中SFT通常带来均匀增益的假设。实验表明,即使总计算量固定,**缩短SFT周期并增加RL分配**可在ID/OOD间取得最优权衡,且这种不对称适应能力分配对资源有限的生物场景具有关键工程指导意义。
方法
本研究以语言模型(如 Llama 等)与生物基础模型(处理 DNA/RNA/蛋白序列)为骨干,构建多模态生物推理管线。输入为生物序列(核苷酸/氨基酸)及自然语言指令,通过以下关键模块完成训练与评估:
继续预训练(CPT)
在生物序列语料上进行自回归预训练,使模型对齐生物序列的统计规律与“语言”分布,为下游推理奠定表征基础。
监督微调(SFT)
使用专家标注的推理轨迹(如通路推演步骤、靶标识别依据)对模型进行指令微调。通过 LoRA 等技术适配,让模型学会生成结构化的推理链。SFT 数据覆盖三个核心任务:通路预测、药物靶标识别、蛋白功能预测。
强化学习(RL)
采用 GRPO 算法,以 SFT 的最优检查点为热启动。奖励函数与生物学正确性对齐(如预测靶标与已知实验证据的吻合度),通过采样多个推理路径并对比奖励,引导模型生成更鲁棒的推理,缓解 SFT 引起的分布外(OOD)性能退化。
输出与评估
在固定后训练预算下,模型输出最终推理结果。重点衡量分布内(ID) 与分布外(OOD) 性能,后者通过跨物种、跨组织或未见过的功能类别构造 OOD 测试集。
与同类方法的差异
区别于以往将后训练视作“叠加增益”的黑盒视角,本方法首次系统解耦 CPT、SFT、RL 对泛化的异质影响,揭示了 SFT 导致的 OOD 退化可被 RL 部分恢复,并量化了各阶段的最优资源分配策略。
实验
实验设计
本研究系统考察后训练(Post-Training)阶段对生物推理模型泛化能力的影响。在DNA、RNA、蛋白质三种模态上,选取多种规模的语言模型作为骨干,统一控制继续预训练(CPT)、监督微调(SFT)、**强化学习(RL)**三个阶段的条件,训练并评估超过100个模型变体。通过跨基因组学、转录组学和蛋白质功能的域内(ID)与域外(OOD)数据集划分,量化各阶段对性能与泛化性的单独及组合效应。实验设置包括:固定数据量变化计算量、固定计算量变化数据量、以及不同SFT/RL资源分配比例,从而揭示训练动态的非单调性。
关键发现
不同后训练阶段对泛化性的塑造方式截然不同:
- CPT 通过使模型对齐生物序列的统计分布,建立下游任务的性能基础,提供全局增益。
- SFT 显著提升ID性能,但OOD性能在训练早期达到峰值后持续下降,显示明显的过拟合风险。
- RL 在强SFT检查点上,若采用对齐的奖励信号,能够有效恢复OOD性能并部分挽回泛化性。
因此,生物推理能力并非随监督信号或计算量线性提升,而是严格依赖各阶段的组合方式。在固定后训练预算下,最佳ID-OOD权衡来自:短暂SFT、将更多计算分配给RL、并让适应容量在阶段间不对称(如SFT用较小LoRA秩,RL用较大秩)。
与基线对比与工程启示
与假设后训练阶段均匀增益的常规认知不同,本研究首次揭示:
- 过度SFT会以牺牲OOD为代价换取ID提升,这种折衷在大规模生物推理模型中尤为显著。
- RL并非仅用于对齐,它能够在SFT后再拓展泛化边界。
工程上,这要求部署生物推理模型时,不应盲目堆砌SFT数据或算力,而应动态分配后训练资源:早期用少量SFT定位于任务,随后用RL保持分布外鲁棒性。该方法在同等计算成本下取得更优的ID-OOD均衡,为实际应用中模型的选择与训练流程设计提供了可操作的准则。
行业影响
落地场景
论文揭示了后训练阶段(CPT/SFT/RL) 对生物推理模型泛化能力的不同影响,可直接指导AI 制药、基因组学分析、蛋白质设计等产品的迭代。例如,在药物靶点发现SaaS 中,可依据任务分布动态组合 SFT 与 RL 权重,避免过拟合训练集;在基因通路预测 API 中,通过简短的 SFT + 大量 RL 预算,提升跨物种或跨数据集的外推稳定性。此外,多模态生物基础模型(如 ESM、DNABERT)的 post-training 管线设计,亦可借鉴不对称适应容量分配策略,缩短从研究到落地的时间。
商业价值
该研究直接对应降本增效:通过理解 post-training 阶段如何影响 OOD 泛化,团队能更精准地分配计算资源,避免无效的大规模 SFT 带来的收益递减。对于 CRO(合同研究组织) 或生物科技公司,可减少湿实验验证次数,提高预测结果的可靠性,从而降低研发成本。同时,在产品体验上,能提供更鲁棒的跨模态推理结果,增强用户对 AI 辅助决策的信任,推动平台订阅或成果转化的营收增长。
与现有产品/工作流的接口
接入现有 MLOps 堆栈时,可将 CPT/SFT/RL 作为可组合的流水线模块。例如,在Hugging Face Transformers + PEFT(如 LoRA) 框架下,通过配置不同的训练阶段比重,实现类似论文中的预算分配优化。RL 阶段可使用 TRL 库与自定义奖励函数对接,评估时监控 ID/OOD 指标曲线,自动触发早停或阶段切换。在生物信息学云平台(如 AWS HealthOmics、Terra.bio)中,可将此策略打包为Post-Training 推荐器,根据下游任务类型和可用数据规模,推荐 SFT/RL 的 token 分配比例,降低用户试错成本。
具体落地用例
- 基因治疗企业:在训练靶点推荐模型时,采用“少量 SFT + 大比例 RL” 策略,确保在未见过的罕见病基因突变数据上仍保持高 precision,避免因过拟合常见靶点导致漏检。
- 蛋白质设计平台:针对酶功能预测任务,先用 CPT 让模型学习蛋白质序列“语法”,再通过 RL 优化序列生成符合特定 pH/温度稳定性目标,减少实验室筛选工作量。
局限
- 论文承认的局限:实验仅在三个生物学推理任务(通路预测、药物靶点识别、蛋白质功能预测)上进行,数据集构造存在简化,令牌化和输入表示未详尽遍历所有可能性;模型规模限于特定主干(如Llama-3.1-8B、Llama-3.2-3B),未探索更大规模模型下的趋势,且所有微调均基于LoRA,可能限制了对全参数微调场景的推广。
- 可推断的局限:OOD评估仅依据物种或蛋白质家族划分,未覆盖其他现实分布偏移(如实验条件变化、跨测序平台差异);RL阶段依赖固定奖励模型,奖励设计本身可能引入偏差,影响结论的鲁棒性;研究假设训练阶段顺序固定(CPT→SFT→RL),未探讨不同顺序组合的影响,对实际工程中灵活编排预算的指导有限。
- 与同类工作对比的弱点:未与端到端预训练的生物基础模型(如从零训练的多模态大模型)进行直接对比,难以判断后训练相对于完全预训练的增益边界;报告泛化损失时未提供置信区间或统计检验,削弱了结论的说服力;仅关注生物学语言对齐,未涉及更复杂的结构化知识(如通路图、分子图)编码,落后于多视图融合工作。