S1-Omni: 面向科学理解、预测和生成的统一多模态推理模型
我们提出 S1-Omni,一个用于科学理解、预测和生成的统一多模态推理模型。 问题:人工智能 for Science (AI4S) 通过领域专用模型、工具增强的大语言模型和科学语言模型取得了显著进展,但模型能力高度碎片化,限制了异构数据、科学定律和专家知识的联合建模。 方法:S1-Omni 通过统一表示、自然世界知识对齐和领域专用解码三大核心组件弥合这一差距。首先,它将自然语言指令与科学对象(如 CIF、SMILES、蛋白质序列、光谱和科学图像)映射到共享表示空间。其次,融入科学定律和专家知识至数据构建与训练,使模型能基于科学证据推理。最后,执行任务专用解码,支持属性预测、光谱到分子生成、蛋白质位点与结构预测、科学图像生成与编辑等广泛任务。 实验:S1-Omni 在 S1-Omni-Corpus(覆盖 200 个科学任务,包含数百万推理样本)上训练,并在超过 60 个科学基准上评估。它在大多数基准上超越 GPT-5.5 和 Gemini-3.1-Pro,并在多项基准上匹配或超越领域专用模型。 结论:S1-Omni 为实现统一科学建模提供了实用路径。
论文精读
TL;DR S1-Omni 统一多模态科学推理,覆盖 200+ 任务,在 60+ 基准上超越 GPT-5.5 和 Gemini-3.1-Pro,甚至匹敌专用模型。
问题
问题背景
AI for Science (AI4S) 领域快速发展,但主流模型往往针对单一任务或单一数据模态设计,导致能力高度分散。科学发现迫切需要融合多模态数据并利用领域知识进行跨任务推理。
现有方法局限
当前方法主要包括三类:
- 领域专用模型 仅在特定任务上有效,难以跨领域迁移;
- 工具增强型 LLM 通过调用外部工具处理多模态数据,但依赖人工编排,无法进行端到端优化;
- 科学语言模型 受限于文本或简单序列,难以对齐分子、晶体、光谱、蛋白质结构等异构数据,且未能系统融入科学定律与专家知识。
这些方法的根本局限在于缺乏统一的表示空间与推理框架,导致跨模态、跨任务的协同建模困难,无法有效捕获科学数据的内在关联。
技术挑战与重要性
构建统一科学推理模型需解决三个核心难题:
- 多模态科学数据的统一表示:将自然语言指令与 CIF、SMILES、蛋白序列、光谱图、科学图像等映射到共享空间;
- 科学常识与定律的对齐:确保模型预测符合物理化学约束,不产生违反基本原理的输出;
- 任务专用解码:支持性质预测、光谱到分子生成、蛋白质结构预测、科学图像编辑等多种输出模式。
该方向有望大幅降低多任务科学建模的工程复杂度,加速材料设计、药物发现等迭代式探索,因此受到业界高度关注。
行业类比
类似于 GPT-4o 统一了文本、图像与语音处理,S1-Omni 试图成为科学领域的通用推理引擎,让开发者无需为每个科学任务单独训练模型。
核心洞察
- 统一多模态科学推理架构打破领域碎片化:S1-Omni 将材料科学中的晶体结构(CIF)、化学分子(SMILES)、蛋白质序列、光谱和科学图像等异构数据映射至共享表示空间,并融合科学定律与专家知识,从而在一个模型内完成从性质预测到分子生成、蛋白位点预测、甚至科学图像编辑等多种任务。区别于多数 AI4S 模型仅聚焦单一领域(如 AlphaFold 专做蛋白结构,MolCLR 仅做分子性质),该模型通过多任务统一训练和编码器-解码器解耦设计,首次在大规模科学任务集上验证了跨学科通用推理的可行性。
- 预填充隐藏状态作为稳定下游接口提升多任务性能:论文揭示,从 VLM 骨干网络提取的“预填充表示”(prefill representations)可直接传递给各类专业解码器,无需为每个下游任务微调整个模型。这种设计不仅能大幅减少训练与部署成本,还在属性预测、谱图到分子生成等任务中表现出超越或匹配专用 SOTA 模型的能力。相比传统基于 Token 生成的接口,隐藏状态直接携带更丰富的结构化信息,为构建模块化、可扩展的科学 AI 平台提供了工程参考。
方法
输入:多模态科学数据与自然语言指令
S1-Omni 接收自然语言任务描述,以及六类科学对象:CIF 晶体文件、SMILES 分子串、蛋白质序列、光谱图、科学图像(如显微镜、医学影像)和其他结构化记录。所有输入被统一映射为 token 序列,进入共享的视觉–语言模型(VLM)骨干。
关键模块:统一表示与知识对齐
- 统一表示:采用单一 Transformer 编码器将异构数据嵌入到同一隐空间。不同模态通过特定的线性投影或轻量 adapter 对齐,避免独立分支带来的特征碎片化。
- 自然世界知识对齐:训练中引入科学定律(物理约束、化学规则)和专家知识,通过 structured reasoning supervision 迫使模型在生成最终预测前产出可解释的推理链。例如,属性预测任务强制模型先描述晶格对称性再输出介电常数。
- 任务特定解码器:共享表示之上挂载多个轻量解码头:回归/分类头用于属性预测;自回归 Transformer 解码器用于分子生成;图网络解码器用于蛋白质位点预测;扩散模型头用于图像生成。解码器仅从共享特征中提取任务相关信号,保持骨干通用性。
输出与训练
两阶段训练:先在 S1-Omni-Corpus(覆盖 200 个任务、数百万推理样本)上联合预训练 VLM 骨干与解码器,再单独微调解码器以提升任务精度。输出涵盖属性预测、光谱→分子生成、蛋白质位点/结构预测、科学图像生成与编辑等。在 60+ benchmark 上,性能超越 GPT-5.5 和 Gemini-3.1-Pro,并在多个专用基准上持平或超越领域 SOTA 模型。
差异点:与分领域训练孤立模型或简单拼接工具不同,S1-Omni 将多模态表示、科学推理监督和任务解码有机整合,首次实现单一模型覆盖理解、预测、生成三类科学任务,打破了能力碎片化格局。
实验
实验设计
S1-Omni 在 S1-Omni-Corpus 上训练,该语料库覆盖 200 项科学任务、数百万推理样本。评估涵盖 60+ 基准,分为五大类:属性预测、光谱到分子生成、蛋白质位点预测、蛋白质结构预测和科学图像生成与编辑。每类任务均配备了相应的解码器,并与通用模型 GPT-5.5、Gemini-3.1-Pro 及领域专用模型进行对比。训练采用共享 VLM 训练加特定任务解码器训练的两阶段策略。
关键发现
- 统一建模优势:单模型在多任务上整体优于通用大模型,且在部分基准匹敌甚至超越专用模型,打破了科学 AI 的能力碎片化。
- 推理监督 消融实验表明,加入推理监督显著提升科学表征质量,使模型能从科学证据中推理。
- 预填充表示 作为稳定的下游接口,在不牺牲性能的前提下简化了多任务适配。
- 解码器贡献:在强专家解码器下,骨干网络依然贡献显著,说明统一表示的有效性。
- 模型在专业化后仍保持通用对话能力,未见灾难性遗忘。
与基线模型的对比解读
S1-Omni 相较于 GPT-5.5 和 Gemini-3.1-Pro,在科学推理任务上表现更优,显示出任务特定对齐和自然世界知识注入的价值。与分散的领域专用模型相比,S1-Omni 以单一架构覆盖了多种模态和任务,避免了重复开发和多模型维护成本。其核心创新在于将科学数据统一到共享表示空间,并利用推理监督让模型习得可解释的科学思维链,这比仅依赖工具调用的方案更深入。然而,在极端专门化的任务上,专用解码器仍是保证最优性能的关键。
行业影响
落地场景
S1-Omni 可作为统一的科学 AI 引擎,嵌入药物发现、材料设计、蛋白质工程等研发流程。典型产品形态包括云端 API、实验室信息管理系统(LIMS)的智能模块、或科研辅助 Copilot。它能处理晶体结构(CIF)、分子(SMILES)、蛋白质序列、光谱、科学图像等多模态数据,支撑性质预测、分子生成、位点预测、图像生成等任务,适合制药、化工、生物技术等行业的研发部门。
商业价值
- 降本增效: 用一个模型替代多个专用模型,减少模型训练、维护和许可成本;同时加速研发周期,如将先导化合物优化从数月缩短至数周,降低实验失败率。
- 增收潜力: 通过生成高价值的知识产权(如新分子、新材料),直接输出候选药物或功能材料,创造新的商业机会。
- 体验提升: 为科研人员提供多模态交互式推理界面,例如“上传光谱并提问: 最可能的分子是什么?”,大幅降低 AI 使用门槛。
集成方式
S1-Omni 采用共享的视觉-语言主干(VLM)与任务特定解码器架构,可通过以下方式融入现有技术栈:
- RESTful API 或本地化部署: 接收文本指令与科学多模态数据,返回预测或生成结果。
- 与电子实验记录本(ELN)/LIMS 集成: 作为自动化分析模块,在实验记录中直接调用模型进行预测或设计建议。
- 替代现有单任务工具: 例如,在计算化学平台中,替换多个独立的性质预测模型,简化工作流。
具体落地 Use Case
- 制药行业先导化合物优化: 药物化学家输入分子 SMILES 和目标性质要求,S1-Omni 同时预测 ADMET 性质、合成可及性,并给出蛋白结合位点预测,辅助决策。集成到 CADD 流程中,可替代或增强现有虚拟筛选工具。
- 新能源材料研发: 材料科学家上传晶体结构 CIF 文件,指定目标带隙或介电常数,模型通过多模态理解与推理生成候选材料,并提供性质预测解释。该功能可嵌入到高通量计算框架中,如与 Materials Project 数据结合,加速新型电池或光伏材料的发现。
局限
- **推理监督可能限制生成多样性与灵活性**:模型通过引入结构化推理步骤来对齐科学知识,虽然提升了可解释性与预测精度,但在开放式的科学生成任务(如分子设计或假设生成)中,过度依赖预定义的推理模板可能阻碍模型探索非标准或创新性的推理路径,降低生成多样性。论文在失败案例分析中亦指出,部分预测错误源自推理过程被过度约束。
- **多轮交互与通用对话能力不足**:S1-Omni 主要围绕单轮科学任务设计与评估,虽然附录中涉及多轮对话,但整体对话连贯性与上下文保持能力较弱。这限制了其作为科研交互助手的实用性,难以支撑科学家进行探索性的连续追问、假设迭代和结果讨论,模型在科学任务之外的一般对话能力也存在明显退化。
- **在高度专业化子领域中共享表征的优势有限**:论文指出,当接入强大的任务专用解码器(如蛋白质结构预测模块)时,共享主干网络的贡献被削弱,表明统一表征对已高度优化的领域加成不足。此外,与最先进的专用模型(如 AlphaFold3、RFdiffusion)相比,S1-Omni 在蛋白质结构预测等任务上仍可能存在精度差距,未能在所有科学基准上全面超越专用方案。