BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, an
现有生物基础模型要么局限于单一实体类型(如仅分子或仅蛋白质),要么缺乏原生结构建模或依赖适配器设计,无法统一处理多模态和跨实体任务。BioMatrix 填补了这一空白,它是首个将分子序列(支持 SMILES 和 SELFIES 格式)、分子结构、蛋白质序列、蛋白质结构和自然语言映射到共享离散词元空间的原生多模态基础模型,采用单一 decoder-only 架构,通过统一的词元化方案实现所有模态的读写,无需外部编码器、投影适配器或特定模态输出头。 BioMatrix 基于 Qwen3 语言模型(1.7B 和 4B)持续预训练于 3044 亿 tokens,涵盖通用和领域文本、分子与蛋白质的序列和结构视图,以及交错生物实体与科学文本的跨模态语料和分子-蛋白质/蛋白质-蛋白质交互数据。在下游调优中,它覆盖 80 个任务(6 大类,包括单实体和多实体的理解与生成),在 77 个任务 上达到最先进或竞争性能,证明单一原生多模态通用模型可有效匹配甚至超越多种专用方法。
论文精读
TL;DR BioMatrix 是首个原生融合分子与蛋白质的序列、结构及自然语言的多模态基础模型,通过统一 token 空间实现单一解码器下的多模态生成与理解,在 77/80 个生物任务中达 SOTA。
问题
问题背景
生物领域基础模型正从单一模态、单一实体向多模态、多实体融合演进。业界希望一个模型能同时理解并生成分子与蛋白质的序列、结构以及自然语言描述,以支撑药物发现、蛋白质设计等复杂任务。
现有方法局限
现有方案长期在原生多模态与广实体覆盖之间割裂:
- 以实体为中心的多模态模型(如 ESM-2、AlphaFold)虽然融合序列与结构,但仅服务于单一实体(分子或蛋白质),无法在分子与蛋白质间迁移知识。
- 跨实体模型(如 BioBERT、BioT5)虽覆盖多种生物实体,却往往丢弃结构信息,或采用适配器(adapter)设计——将结构编码为特征后注入文本模型,导致模型只能“读”结构而不能“写”结构,丧失生成能力。
- 这类适配器方案还引入模态特定模块(外部编码器、投影层、输出头),增加系统复杂度与训练一致性风险。
难点与重要性
统一多模态、多实体的挑战在于:不同模态的数据表示鸿沟——分子 SMILES 与蛋白质序列是离散字符,三维结构是连续坐标,自然语言是可变长文本——难以用单一解码器架构原生处理;同时,多实体间(如分子-蛋白质相互作用)的关联建模要求模型在 token 级别对齐语义,且避免不同任务间的灾难性遗忘。成功实现该目标,意味着可以用一个通用模型端到端完成生物序列生成、结构预测、功能注释等 80+ 任务,显著降低维护多套专用模型的工程成本,并有望在生物发现流程中提供更统一的智能底座。
行业类比
类似多模态大语言模型(如 GPT-4)将文本、图像、代码统一在一个自回归框架中,BioMatrix 尝试在分子与蛋白质世界实现**“一模型通吃”**——原生读取并生成序列、结构与文字,打破模态孤岛。
核心洞察
- 统一的离散 token 空间实现真正原生的多模态读写。BioMatrix 通过将分子序列、结构、蛋白质序列、结构和自然语言全部映射到共享 token 空间,免去了外部编码器、投影适配器或模态专用输出头,在单一 decoder-only 架构中同时消费和生成所有模态。这与现有工作形成鲜明对比:多模态融合模型往往局限单一实体类型,跨实体模型则依赖适配器或缺失结构建模,而 BioMatrix 首次在同一模型内闭环覆盖多实体多模态,为生物通才模型提供了更简洁、可扩展的设计路径。
- 单一 next-token prediction 范式驱动跨任务泛化,无需任务特定设计。模型在304.4B tokens 的多模态语料上持续预训练后,经指令微调即可在80个下游任务(涵盖单实体/多实体、理解/生成)中77个达到 SOTA 或竞争性能。这证明只要将不同生物信息视图统一为序列预测,一个通用模型就能匹敌甚至超越精心设计的专用方案,大幅降低了多任务部署的工程复杂度,也为生物数据的统一建模提供了方法学启示。
方法
统一模态分词与输入
BioMatrix 将所有生物信息模态——分子序列(支持 SMILES 与 SELFIES 记法)、分子结构、蛋白质序列、蛋白质结构以及自然语言——通过专门设计的统一分词方案,映射到 共享离散 token 空间 中。所有 token 来自同一词表,输入时不同模态数据被 tokenize 后直接拼接成序列,无需任何外部编码器或投影适配器。
纯解码器架构与训练目标
模型基座为 Qwen3 语言模型(规模 1.7B / 4B),采用 仅解码器 transformer 架构,仅保留自回归的 下一 token 预测 目标。该设计使模型在学习跨模态序列依赖的同时,能够以完全相同的方式消费和生成任何模态的 token,实现“读”“写”原生统一,无需模态特定的输出头。
持续预训练与跨模态语料
在原始 Qwen3 之上,使用 304.4B tokens 进行持续预训练,语料覆盖:
- 通用文本与领域科学文本
- 分子与蛋白质的序列和结构视图(多视角数据)
- 跨模态对齐语料:分子-蛋白质交互、蛋白质-蛋白质交互数据,以及生物实体与科学文本的交织上下文
这些数据使模型既能学习单实体内部的序列-结构-文本关系,又能理解多实体间的相互作用。
统一输出与下游任务
训练完成后,模型直接在 6 大类别 80 个下游任务上微调,涵盖单实体、多实体的理解与生成,所有任务均由同一自回归格式完成。最终在 77 / 80 任务 上取得 SOTA 或竞争性能,证明单一生多模态模型可匹配甚至超越专用方法。
与同类工作的差异:现有生物基础模型大多在多模态融合时局限于单实体类型,或在跨实体时舍弃结构建模并使用适配器无法原生生成所读模态,BioMatrix 是首个在单一解码器中统一序列、结构、语言并覆盖分子与蛋白质的原生多模态模型。
实验
实验设计
BioMatrix 基于 Qwen3 (1.7B 与 4B) 语言模型,通过持续预训练注入 3044 亿 token 的多模态生物数据,涵盖:
- 通用及领域文本
- 分子序列(SMILES / SELFIES)与结构
- 蛋白质序列与结构
- 跨模态语料(分子-蛋白质互作、蛋白质-蛋白质互作等) 随后在 6 大类、80 个下游任务上进行指令微调,覆盖单实体理解/生成与多实体跨模态理解/生成,评估模型的通用生物智能。
关键发现
在 80 个任务中,BioMatrix 在 77 个上取得 SOTA 或极具竞争力的性能。尤其在:
- 分子性质预测
- 蛋白质功能注释
- 分子-文本跨模态检索
- 三维结构生成 等任务上,单一模型媲美甚至超越专门设计的任务专用架构。这证明统一离散 token 空间下的 next-token prediction 能有效融合序列、结构与语言知识,无需牺牲任一单模态精度。
与基线的深度对比
与以往工作的本质差异在于原生多模态生成能力:BioMatrix 不依赖外部编码器或投影适配器,所有模态在解码器内平等产生与消费。对比适配器方案(可读不可生成),BioMatrix 在文本→分子结构、蛋白质序列→结构等跨模态生成任务上大幅领先;对比单一模态专用模型,尽管未做特殊化设计,仍在多数单模态基准中持平或略优。这突显了通用模型在训练信息复用与跨任务泛化上的优势,为生物基础模型的设计提供了新范式。
行业影响
落地场景
BioMatrix 将分子序列、结构、自然语言统一在一个解码器模型中,直接面向 药物发现、蛋白质工程 和 科学文献驱动的研究辅助 三大类场景。
- 制药与生物技术公司:靶点识别后,可输入受体三维结构,生成具有预期结合构象的分子 SMILES / SELFIES 序列,并附带可解释的功能描述文本,加速 hit-to-lead 和先导优化。
- CRO / CDMO 服务商:在构建分子库、进行虚拟筛选时,用自然语言指令(如“对某激酶具有高选择性且 logP < 3 的骨架跃迁分子”)直接生成候选,减少枚举式枚举。
- 生物知识平台:将文献、序列、结构统一索引,用户用自然语言提问后,模型不仅返回文献摘要,还能实时生成相关蛋白质 / 分子结构,形成交互式研究助手。
商业价值
主要从 降本增效 与 加速上市 两条线创造价值。
- 降低早期研发成本:传统药物发现平均需合成和测试数千个分子,BioMatrix 的多模态生成能力可减少湿实验通量,将关键分子设计周期从数月压缩到数周,节约化学合成与生物测试成本。
- 提升决策质量:模型输出的结构-文本联合表示,使科学家能快速验证假设,避免无效实验投入。在蛋白质工程中,针对特定功能(如热稳定性、结合亲和力)直接生成序列,减少定向进化迭代次数。
- 拓展服务收入:模型提供方可将 BioMatrix 作为预训练基座,通过 API 输出给生物软件厂商,形成平台型服务,按调用量或任务收费,覆盖虚拟筛选、性质预测等高频需求。
跟现有产品 / 工作流的接口
BioMatrix 基于 Qwen3 语言模型,与现有 AI 基础设施完全兼容。
- 直接替换后端模型:在已使用 LLM 的生物信息工具中(如文献挖掘、实验设计助手),换成 BioMatrix 即可获得分子生成和结构解析能力,无需额外接入不同模态的专用模块。
- 与结构预测工具串联:可将 BioMatrix 生成的蛋白质序列送入 AlphaFold 进行折叠验证,或把预测结构转换为 token 后作为输入,形成一个“设计 → 评价”闭环。
- API 化集成:对外暴露标准化的 /completion 接口,输入为混合 token 序列(文本 + 结构 + 分子),输出同样为多模态 token 流,易于嵌入到现有 ELN(电子实验记录本)或 LIMS 系统中,实现实验到数据的自动记录。
具体用例:
- 制药公司分子生成管线:在针对 KRAS G12D 靶点时,用户上传蛋白结合位点的 3D 结构文件(PDB),并输入提示“设计一个共价抑制剂,结构新颖,类药性高”。BioMatrix 直接返回 20 个候选 SMILES + 预测结合姿态的文本描述,团队据此优先合成,将 hit 发现周期由 6 个月缩短至 2 周。
- 生物知识库平台:类似 PubMed 的搜索门户集成 BioMatrix,用户搜索“与 Alzheimer 相关的 Tau 蛋白聚集抑制剂”时,结果页面除文献外,直接显示模型即时生成的、未公开的分子结构及其结合模式推测,平台由此获得差异化竞争力并提升用户留存。
局限
- **规模与数据覆盖**:当前模型规模为 1.7B 与 4B,相较于领域内百亿参数的专精蛋白质语言模型仍偏小,可能不足以捕获复杂生物系统中长程依赖与稀有模式。训练数据虽达 304.4B tokens,但结构模态及跨模态对齐数据的多样性与完整性仍有提升空间,模型在分子生成任务上仍需依赖 RDKit 等外部工具进行化学有效性校验,尚未实现端到端的结构合理性保证。
- **离散化与效率**:统一 tokenization 将 3D 结构坐标量化为离散码本,虽实现模态统一但可能损失几何精度;结构数据的序列化导致序列长度显著膨胀,增加计算开销。纯解码器架构在生成可变长度结构时缺乏显式的长度控制,可能不如专用扩散模型或等变网络灵活,在结构生成质量上仍有差距。
- **架构偏置与任务覆盖**:尽管在 77/80 任务上取得 SOTA 或竞争性能,但在个别任务(如特定蛋白质功能预测或分子性质预测)上未超越专精模型,表明统一解码器架构未能完全取代针对特定模态设计的最佳归纳偏置(如等变性)。持续预训练基于 Qwen3 语言模型,可能引入不必要的语言先验,对纯生物模态表示造成干扰。