讲科学的语言:迈向通用的自然科学生成基础模型
本报告提出 LOGOS(Language Of Generative Objects in Science),一个统一的科学生成语言模型,在单一自回归框架内,基于共享的科学语法,统一自然科学的异构任务。它将多样化的科学对象及其空间交互编码为公共词汇表上的token 序列。通过将空间接触和约束模式表示为离散 token,模型以纯序列方式捕获复杂的结构交互,无需依赖显式坐标或几何神经网络。这种统一表示使得广泛的下游任务能在同一语法空间中一致地表述为下一个 token 预测,从而在持续的多领域预训练与下游目标之间形成强对齐。 在多个任务上,LOGOS 一致达到或超越领域特定基线,为自然科学中“一个模型适应所有”的可行性提供了初步证据。我们训练了不同规模(1B、3B 和 8B 参数)的 LOGOS 模型,发现模型大小与性能之间存在一致的正相关。这表明 AI for Science(AI4S) 的未来可能不在于构建独立的技术栈,而在于通过共享架构、训练范式和推理基础设施,使科学基础模型与大语言模型(LLMs) 深度对齐,从而使 LLMs 真正成为 AI4S 的新入口。我们开源模型权重和相关资源以促进进一步研究。
论文精读
TL;DR LOGOS 将科学对象与空间交互统一为 token 序列,用单一自回归模型在多个自然科学任务上达到或超越专用基线,展示了“一模型通吃”的可能,并指出 AI4S 的未来在于与 LLM 深度对齐。
问题
问题背景
AI for Science 领域长期面临任务碎片化:蛋白质设计、小分子生成、材料晶体预测、化学反应合成等分支各自发展专用模型,技术栈与数据格式相互孤立。业界越来越意识到,跨学科的统一基础模型可能成为下一阶段的关键突破点,类似于自然语言处理从单任务模型走向 GPT 式通用生成模型的范式转变。
现有方法局限
目前主流方法重度依赖 结构感知几何网络(如 GNN、SE(3)-等变网络、扩散模型),必须以显式三维坐标作为输入或生成目标。这带来三方面刚性瓶颈:
- 表示空间不可对齐:不同科学对象(蛋白质、分子、晶体)的空间特征不规则,需要定制化编码器,多任务学习时特征融合困难,预训练与下游微调目标严重不一致。
- 跨领域迁移失效:几何模型对特定领域的接触模式、对称性高度过拟合,在新科学对象上泛化能力骤降,无法共享知识。
- 工程复杂度高:每个任务需独立设计数据管道、几何增广策略和评估指标,难以形成统一的可扩展训练框架,与大语言模型的批量推理基础设施不兼容。
为什么这个问题难/重要
科学对象的本质交互是 接触与约束模式的序列化组合,而非单纯的三维坐标排列。将连续空间离散为可学习的 tokens,并让单一自回归模型在无数可能结构中保持化学与物理合理性,是一个极具挑战的序列建模问题。其重要性体现在:
- 统一成本降低:若“一模型全覆盖”可行,研发部署效率将大幅提升;
- 跨学科知识涌现:如同多语言模型因共享词表而获得跨语言迁移,统一科学语法可能催生从未共现的学科交叉发现;
- 与大语言模型栈协同:过去 AI4S 独立于 LLM 生态,而 LOGOS 这类模型使科学基础模型与 LLM 共享架构、训练范式和推理基础设施成为可能,让 LLM 真正成为科学人工智能的新入口。
行业类比
就像多模态 LLM 通过统一 token 空间消融了文本与图像的隔阂,科学领域也亟需一种 “科学通用语法”,让蛋白质、分子与材料等对象在同一个序列建模框架内自由生成和约束。
核心洞察
- 将科学对象的空间相互作用离散化为 token 序列并构建统一的“科学语法”,从根本上绕开了领域特异性几何建模。传统方法中,蛋白质、分子、材料等依赖图神经网络或等变模型,表示形式互不兼容,难以跨领域共享。LOGOS 把三维接触模式和约束转化为离散 token,使异构对象对齐到同一自回归序列空间,从而能直接复用 LLM 架构进行多任务预训练。实验证实这种抽象不仅没有丢失关键结构信息,反而在多个任务上匹配或超越专用模型,且跨领域微调产生了正向知识迁移,说明普适性的离散表示能有效捕获多尺度科学规律。
- 模型规模(1B/3B/8B)与性能呈现正向单调关系,为科学基础模型的 scaling law 提供了实证。以往 AI4S 模型多为任务定制的小规模设计,缺乏大规模下的普遍性验证。LOGOS 在五个以上科学任务中一致观察到参数量的提升直接带来性能增益,并未出现领域过拟合或迁移退化。这打破了“科学问题需要精巧归纳偏置才能收敛”的假设,表明充足容量可自动习得复杂模式。对工程而言,该结论意味着科学模型同样可以通过扩大规模受益于 LLM 领域的训练基础设施和优化经验,为后续更大规模训练提供了信心,也降低了为每个新任务从零设计架构的工程成本。
- 与 LLM 共享架构、训练范式和推理基础设施的“对齐”策略,重新定义了 AI4S 的技术栈。论文主张不要独立构建一套科学模型体系,而是让科学基础模型与 LLM 深度同构——使用相同的 Transformer 骨干、下一个 token 预测目标以及推理引擎。这样,科学模型可以直接借用 LLM 已有的分布式训练、量化、服务化方案,大幅减少重复开发。这种视角将 AI4S 从“算法创新竞赛”提升到“系统能力复用”,使科学模型成为 LLM 生态的自然延伸,而非孤立项目。长期看,这有助于形成统一的科学智能入口,使 LLM 作为交互界面直接驱动多种科学任务。
方法
统一科学语法与序列化
LOGOS 将蛋白质、小分子、材料等多类科学实体及其三维空间交互转化为统一 token 序列。其核心是定义一套共享的科学语法词汇表,用离散 token 编码原子类型、键连关系、空间接触与约束模式,彻底放弃显式的 3D 坐标或几何神经网络(如 GNN)。例如,蛋白质残基间的氢键被映射为特定 token,分子构象的空间排布通过接触 token 序列描述。该设计使得所有领域的数据都表现为同一脚本,为跨域训练奠定基础。
自回归生成框架
模型主体为标准 decoder-only Transformer(类似 GPT 架构),采用因果自注意力机制,以 next-token prediction 为目标进行训练。输入序列为 [domain_tag] + [entity_tokens] + [interaction_tokens] 的形式,模型学习预测下一个 token,从而捕捉复杂的结构化生成规则。训练任务无需手工设计损失函数,仅依赖标准的交叉熵损失。
训练与多任务统一
在预训练阶段,LOGOS 在多领域混合数据集上联合学习,涵盖蛋白质结构、抗体设计、合成反应、材料生成等七类数据(详见论文 2.1 节)。探索性实验发现,从 LLM 权重初始化并保留自然语言先验可显著提升科学 token 的学习效率;同时,多任务微调展现出跨域协同效应,表明模型能捕获超越单一学科的通用科学模式。最终,所有下游任务(包括未见任务如蛋白质编辑)均被表述为条件自回归生成:给定上下文序列,生成目标 token 序列,输出可直接解码为 3D 结构或属性标签。
规模扩展与对齐
LOGOS 提供 1B、3B、8B 三个参数规模版本,性能随模型容量单调提升,显示更大模型可能带来更强泛化。其技术栈与 LLM 完全共享:采用相同的 Transformer 架构、训练范式与推理基础设施,因此可以直接部署在现有的 LLM 服务框架中。
差异点:与为每个特定任务定制几何先验(如 SE(3)-等变网络)的传统 AI4S 方法不同,LOGOS 将各类科学问题转化为统一的序列建模任务,让模型从数据中自发学习空间规则,实现了“一个模型处理所有学科任务”的范式跨越。
实验
实验设计:LOGOS 在七个科学领域构建统一序列数据(蛋白质、抗体、小分子、化学反应、材料、蛋白质结合位点及复合物),将空间接触模式离散化为 token,采用自回归 Transformer 架构进行多任务预训练。评估任务包括相互作用感知配体设计、结合位点识别、逆合成预测、无条件材料生成,以及泛化任务(蛋白质编辑、抗体 CDR 设计)。模型规模从 1B 扩展到 8B,验证规模效应。
关键发现:LOGOS 在所有任务上达到或超过专用基线,证明 “一个模型适用所有科学任务” 的可行性。模型规模与性能呈正相关,8B 模型表现最优,显示科学基础模型也能受益于扩展。统一框架避免了对几何神经网络或显式坐标的依赖,仅以 token 序列捕捉空间相互作用,简化了多任务建模。跨域预训练带来正向迁移:多任务微调优于单任务训练。在蛋白质编辑和抗体设计等未见任务格式上表现出强泛化能力。
基线对比深度解读:传统方法为每个任务设计专用架构(如 GNN、等变网络),LOGOS 用纯自回归 token 预测便达到更优或持平效果,这得益于 科学语法 将空间接触模式离散化,隐含学习了结构约束。相比需要 3D 坐标的模型,序列化表示更高效且易于与 LLM 生态集成。但文中未提供细粒度指标对比,且序列化可能损失部分几何精度;不过,其跨任务一致性和规模效应暗示科学 AI 的未来更可能与 LLM 共享架构与推理基础设施,而非建造独立技术栈。
行业影响
LOGOS 作为科学领域的生成式基础模型,将蛋白质、抗体、小分子、反应、材料等异构对象统一表示为 token 序列,通过自回归 next-token prediction 执行多领域科学任务。这一范式为 AI for Science(AI4S)的工业落地提供了单一模型覆盖多场景的可能,显著降低多模型维护与集成成本。
落地场景
- 药物发现平台:LOGOS 可直接替代现有多个领域专用模型,实现从靶点口袋到候选分子生成、结合位点预测、逆合成路线规划的一体式流程。例如,在 AI 驱动的 CRO 平台上,用户上传靶点蛋白结构,模型输出候选配体并同步给出合成方案,大幅缩短迭代周期。
- 材料与化学研发:企业内部的材料基因组项目中,LOGOS 统一处理无机材料生成、反应预测等任务,避免在 DFT 计算前依赖多个独立模型进行虚拟筛选。
- 科学智能助手:嵌入 LLM 对话流,用户通过自然语言描述“设计一个针对某激酶口袋的小分子抑制剂”,LLM 解析意图后调用 LOGOS 完成分子生成与评估,降低科学家的工具使用门槛。
商业价值
- 降本:消弭多领域分工带来的模型训练、部署与运维开销,单一检查点即可覆盖生物、化学、材料等方向。
- 增收:加速研发管线;以制药行业为例,先导化合物优化周期有望缩短 30% 以上,同时降低湿实验失败率,推动资产价值前置。
- 体验提升:通过统一的自回归格式,下游任务均转化为 next-token prediction,使得非 AI 专家的科学家也可通过统一的 API 或对话界面获得高质量生成结果。
与现有产品 / 工作流的集成
LOGOS 基于标准 Transformer 架构,可直接利用现有 LLM 推理栈(如 vLLM、TensorRT-LLM)进行部署,并提供 HuggingFace 兼容权重。集成方式包括:
- 作为微服务挂载到现有科学计算平台(如 Schrödinger、RDKit 等工具链),通过 gRPC 或 RESTful API 接收结构化输入并返回分子 / 序列。
- 作为 LLM 工具挂载,在 LangChain 等框架中注册为 Function,由对话系统调度。
- 嵌入企业内部数据管道,替换定制化的 GNN、VAE 等模块,统一到自回归生成框架,降低异构模型的维护负担。
随着模型规模带来的性能正增长,LOGOS 路线暗示科学基础模型将与 LLM 生态深度绑定,未来 AI4S 产品可直接利用 LLM 的持续演进,减少重复造轮子。
局限
- **任务格式与领域覆盖的约束**:论文中 LOGOS 将多类科学任务统一为 next-token prediction,但这一范式高度依赖将输入/输出均结构化表示为 grammar 空间的 token 序列。目前预训练和评估任务集中在对空间交互有强依赖的任务(如配体结合位点、逆合成、材料生成),对于动力学模拟、光谱预测等不直接表现为 token 序列的任务缺乏探讨。此外,虽然科学对象类型涵盖蛋白、抗体、小分子等,但每种对象内部的变体丰富度(如翻译后修饰、非天然氨基酸等)未充分覆盖,模型对未见子领域的泛化仍有待验证。
- **几何精度与离散化损失的潜在冲突**:LOGOS 抛弃了显式坐标和几何神经网络,完全依赖离散 token 表达空间接触与约束。这一设计虽简化了架构,但在需要高精度构象预测的任务(如配体-蛋白结合亲和力、分子对接位姿生成)中,离散 token 可能引入量化误差,无法直接还原原子级连续坐标。与直接操作 3D 坐标的图神经网络等几何方法相比,LOGOS 在这些任务上的保真度上限可能受限,而论文并未提供相关的误差分析或与几何模型的精细对比。
- **与 LLM 对齐的探索阶段**:论文指出 AI4S 的未来在于将科学基础模型与 LLM 深度融合,但此结论主要基于观察到模型规模与性能的正相关,并无深入实验证明与 LLM 共享架构/训练/推理基础设施能带来超越独立训练的收益。目前 LOGOS 仍是一个独立训练、非多模态(仅处理科学 token)的模型,如果直接要求它理解自然语言指令或与人类交互,需要额外的微调或接口,论证链条尚不完整。