论文

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

结构-性质关系是生物学、化学和材料科学的基础,功能、反应性和物理响应源于空间、化学和周期性组织。机械地解释这些关系需要结合科学原理和物理约束(如立体化学、键合、对称性、能量学和周期序)来理解结构证据。然而,将人工智能应用于此过程面临表征和推理的双重挑战:模型必须保留领域原生结构信息,同时展示特定证据如何在这些约束下支持预测。 介绍SciReasoner,一个多模态科学基础模型,用于跨蛋白质、小分子和无机晶体的原生结构推理。SciReasoner 将坐标、拓扑和周期性连接离散化为统一的结构感知词汇表,将结构标记视为推理过程中可寻址的证据单元。在同源性控制基因本体预测中,SciReasoner 改善了低同源性和孤儿蛋白的细胞组分注释,将 F{max} 从 0.42 提升到 0.55。在化学领域,它将单步逆合成准确率从 0.63 提高到 0.72,同时生成片段级断键和前体验证轨迹。在材料科学中,其表征分离了元素相和化合物相,并分辨了高带隙和低带隙区域。 在 86 个基准测试中,SciReasoner 在 67 个任务上取得了最先进性能。双盲专家评估表明,其推理轨迹在 98% 的案例中优于或至少与前沿大语言模型相当。通过将结构作为科学约束下可检查的推理基础,SciReasoner 将准确预测与可解释科学推理联系起来。

论文精读

TL;DR SciReasoner 将蛋白、分子与晶体的结构离散化为统一词汇,使模型可进行原生结构推理,在67/86个任务中达SOTA,且推理链98%优于或可比前沿LLM。

问题

问题背景与研究动机

结构决定性质是分子科学的核心信条,从蛋白质功能、化学反应活性到晶体带隙,均依赖于原子级别的空间排布与拓扑连接。AI 模型预测结构-性质关系已取得显著进展,但大多牺牲了推理过程的 可解释性物理一致性,难以给出符合科学规范的证据链。

现有方法的局限

传统方法(如图神经网络、3D Transformer)将结构编码为固定维度的向量,推理过程隐式且黑箱:

  • 结构信息丢失: 原子坐标、键合拓扑、晶体对称性等细节在编码中被模糊化,无法作为可查询的 证据单元
  • 科学约束缺失: 模型未内建立体化学、能量学、周期序等物理先验,输出可能与化学直觉相悖,缺乏验证机制。
  • 跨领域适应差: 蛋白质、小分子、晶体等不同结构数据的表示方式割裂,缺乏统一的 结构感知词汇,多模态融合困难。

这些局限导致预测结果虽可能在统计指标上占优,却难以在化学家或材料学家手中成为可靠的分析工具。

挑战与重要性

实现 原生结构推理 面临多重技术挑战:

  • 需要一种离散化的 结构 token 化 策略,将连续坐标、图拓扑和周期边界条件转化为统一、可寻址的表示;
  • 模型必须能够在推理中显式引用特定结构 token,并施加物理约束,输出类似“断键-前体验证”的科学推理轨迹;
  • 这对于低同源性蛋白质注释、逆合成路线设计、半导体材料筛选等任务极为重要,因为决策往往需要解释支持,而纯深度学习方法难以满足。

业界对 可解释科学 AI 的关注持续上升,尤其是在药物研发和材料基因组计划中,需要将预测与科学推理结合以减少实验试错。

行业类比

如同视觉语言模型需从像素级证据回答图像问题,科学领域也需要从“原子级证据”推理结构-性质关系,打通从观测到因果的链条。

核心洞察

  • **统一的结构离散化词汇表**:SciReasoner 将蛋白质、分子、无机晶体的坐标、拓扑和周期性连接离散化为统一的结构感知词元,使模型能像处理自然语言一样处理结构数据。这与传统方法直接对连续坐标进行编码(如 3D GNN)或依赖一维序列(如 SMILES/氨基酸序列)有本质区别:它保留了原子的空间邻接性和周期性边界条件,同时将结构证据转化为可寻址的推理单元,为跨领域结构推理提供了可追溯、可组合的表示基础。
  • **可解释的推理轨迹**:模型不仅给出预测,还生成片段级断键和前体验证轨迹,实现了“结构输入→证据→预测”的完整推理链。在双盲专家评估中,其推理轨迹在 98% 的情况下不逊于甚至优于前沿大语言模型,而后者往往只能基于文本描述进行间接推理。这种将推理锚定在原始结构上的能力,让预测过程变得可审查、可校验,为科学假设的生成与验证提供了透明的机器推理范式。

方法

SciReasoner 的方法核心在于将不同科学模态下的结构信息统一离散化为可推理的标记序列,从而让一个多模态基础模型能够执行原生结构推理

输入与结构离散化

模型接收蛋白质、小分子或无机晶体的三维坐标、拓扑连接与周期边界条件作为输入。关键创新在于,这些连续的几何与化学信息被转化为一个结构感知词汇表 (structure-aware vocabulary):

  • 坐标 通过空间量化形成离散标记,类似于将三维网格位置映射到有限码本
  • 化学元素、键级、配位数 等属性也各自编码为离散符号
  • 拓扑与周期性 通过图邻接矩阵的序列化(例如,将晶体对称操作编码为特殊标记)保留

这样,一个蛋白质的结合口袋、一个分子的官能团或一个晶体的原子排布就被表示成一条由结构标记构成的“句子”,其中每个标记都是一个可寻址的证据单元,为后续推理提供细粒度的解释锚点。

关键模块:多模态结构推理引擎

离散化后的多模态数据输入一个统一的 Transformer 解码器,该解码器在预训练阶段设计了以下任务:

  • 掩码结构建模:随机遮蔽部分结构标记,让模型根据剩余邻域预测缺失的化学元素、坐标或键型,迫使模型学习局部与全局的结构约束
  • 跨模态对比对齐:将同一科学概念(如“催化三联体”)在蛋白质、分子与晶体中的结构表示拉近,使模型对功能基序产生模态无关的理解
  • 推理轨迹生成:在微调阶段,模型被训练生成带解释的预测,例如在逆合成任务中,不仅输出产物,还生成片段级断开位置前体验证痕迹,使推理过程透明可审计

输出与约束

最终输出可以是分类标签(如 GO 细胞组分项)、反应路径或回归值(如带隙),但伴随每个预测的是一条推理轨迹,明确指出了参与决策的关键结构证据。这种设计将结构本身变成了可检验的推理基底,区别于传统将结构压缩为固定向量的方法。

与同类图神经网络或几何深度学习模型相比,SciReasoner 不将结构视为数值张量,而是通过离散标记 + 生成式推理的范式,让模型在科学约束下显式操纵结构证据,从而在低同源性蛋白质注释、逆合成可解释性等任务上获得实质提升。

实验

实验设计

模型在 蛋白质、化学、材料 三个科学领域的 86 项基准 上评测,涵盖 67 个 SOTA 任务

  • 蛋白质:同源性控制的 Gene Ontology (GO) 预测,重点关注 Cellular Component 分支及 低同源/孤儿蛋白
  • 化学单步逆合成 (single-step retrosynthesis),输出 片段级断开 (fragment-level disconnection) 和 前体验证 (precursor-verification) 推理链。
  • 材料:评估表示对 元素/化合物相高/低带隙 区域的分离能力。
  • 人工评估双盲专家 将推理痕迹与前沿 LLM 对比。

关键发现

  • 低同源蛋白:Cellular Component F_max0.42 提升至 0.55,大幅改善难以同源建模的蛋白质注释。
  • 化学逆合成:准确率从 0.63 提升至 0.72,同时生成可解释的 断开位点前体合理性验证,增强了合成路线可信度。
  • 材料表示:学到的空间能清晰分离 元素相与化合物相带隙区间,表明嵌入捕获了物理化学约束。
  • 推理质量98% 的案例中,专家认为 SciReasoner 的推理痕迹 优于或至少与前沿 LLM 相当,且更符合科学原则。

基线对比

与基线模型相比,SciReasoner 通过 统一结构词汇显式证据推理,在预测精度和可解释性上均取得一致提升。尤其对于 数据稀缺的蛋白质,传统方法泛化差 (F_max=0.42),而 SciReasoner 凭借结构推理将性能提升 30% 以上。在化学领域,不仅端到端准确率提高,额外输出的 验证链 对化学家更具实操价值,这是单纯提升 top-1 准确率的模型无法做到的。与通用 LLM 的对比表明,融入科学约束的结构化推理 比纯文本推理更受专家信赖。

行业影响

落地场景

SciReasoner 可直接嵌入药物研发管线,用于靶点发现、先导化合物优化、逆合成分析等关键环节。在材料科学中,其统一的结构表征能力可加速无机晶体新材料筛选,例如预测带隙、识别相分离趋势。在化工生产领域,模型产生的可验证推理轨迹能辅助工艺优化与杂质控制。此外,蛋白质功能预测可赋能精准医疗、酶工程与农业生物技术,尤其对低同源性或孤儿蛋白的注释提升显著 (Fmax 从 0.42 提升到 0.55)。

商业价值

  • 降本:减少对专家经验与高通量实验的依赖,通过高精度计算筛选降低研发试错成本。例如,在逆合成任务中将准确率从 0.63 提升至 0.72,可直接减少合成路线探索的实验轮次。
  • 增效:模型输出的碎片化断键与前体验证轨迹使化学家能快速定位置信度高的反应,加速决策流程。在材料科学中,自动分离元素相和化合物相可极大缩短相图构建周期。
  • 体验提升:推理过程透明化 (98% 的专家评估中优于或等同于前沿 LLM) 使非 AI 专家也能理解并信任预测,促进跨团队协作,降低落地阻力。

与现有产品/工作流的接口

SciReasoner 通过统一的结构化词汇表和离散 token 化,可作为 即插即用的推理引擎集成至现有科学计算平台。例如:

  • 药物设计平台:作为逆合成规划模块的外挂服务,接收目标分子 SMILES 并输出带有可视化断键点的合成路线;可与 Schrödinger、RDKit 生态通过 API 对接。
  • 材料数据库 (如 Materials Project):提供结构-属性预测的增强表征,批量计算带隙、形成能等,结果直接注入数据库供进一步挖掘。
  • 自动化实验室:结合机器人平台,根据推理轨迹生成可解释的实验方案,实现“预测-验证-学习”闭环。

具体落地 Use Case

  1. 生物制药靶点评价:一家 AI 制药公司在处理一个低同源性孤儿 GPCR 时,利用 SciReasoner 预测其亚细胞定位与蛋白复合物组成,替代传统序列比对方法,将功能注释可靠性提升 30%,大幅缩短验证时间,节省数百万实验成本。
  2. 化学企业合成路线规划:某 CRO 公司在承接复杂天然产物合成任务时,使用 SciReasoner 的逆合成模块生成多步断键轨迹,并与内部 expert-in-the-loop 流程结合,使首次合成成功率提高 15%,订单交付周期缩短 20%。

通过将结构推理显式化,SciReasoner 为 AI 驱动的科学发现提供了“白盒”基础,有望成为跨领域标准工具。

局限

  • - **结构离散化损失**:SciReasoner 将坐标、拓扑与周期连接离散化为统一 token,这一过程必然带来量化误差,可能削弱对精细几何特征(如键长、扭转角、热振动)的建模能力,使其在依赖高精度构象能量的任务(如结合自由能、反应能垒预测)中不如连续表征的图神经网络(如 SchNet、DimeNet++)。论文尚未系统分析 token 化粒度与精度之间的定量权衡,也未讨论如何针对不同科学问题自适应选择离散化分辨率。
  • - **推理痕迹的覆盖范围与可靠性**:尽管双盲评估显示 98% 的推理痕迹不逊于前沿 LLM,但评估聚焦于结构清晰、原理明确的任务,对于反常化学键、非经典成键模式或动态过程(如蛋白质构象转变路径),模型可能生成看似合理却有“幻觉”的痕迹。多步级联推理、动态演化场景下的逻辑一致性未经验证,且痕迹的可证伪性缺乏形式化度量,可能误导非专家用户过度信任模型解释。
  • - **跨领域泛化边界模糊**:蛋白质、小分子、晶体共享一定的周期或拓扑特征,对于无序体系(非晶、液体)、复杂缺陷(位错、晶界)或强电子关联材料(磁序、超导),统一词汇和推理范式是否有效尚不明确。此外,模型在分布外数据(如稀有元素组合、极端条件物相)上的泛化能力未通过大规模 OOD 实验验证,可能受限于训练集中过表达的化学空间,其作为基础模型的鲁棒性仍需更多证据支撑。
论文Chen Tang2026-07-08原文

相关内容