论文

Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark

Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark

当前生成式分子设计依赖于药物性质的简单代理基准和在大规模制药数据集上预训练的模型,这种方法虽在指标上表现出色,但限制了向与药物发现结构差异巨大领域的迁移。为克服这一局限并推动面向真实科学目标的发现,我们提出了纳米技术分子优化(NMO)基准,它连接了机器学习与量子材料科学。 NMO同时作为机器学习社区的严格测试平台和纳米技术研究的发现引擎。该基准用量子模拟替代代理预言,并引入严格协议,优先考虑科学效用而非排行榜过拟合。基于物理的NMO任务施加了硬结构约束和崎岖的适应度景观,对生成模型提出了根本性新要求。值得注意的是,先进分子优化方法在NMO任务上的表现远不如简单方法。 我们开发了一种新的基线方法,识别了解NMO任务的关键组件: 1. 一种用于建模结构约束的新表示; 2. 一种消除制药数据集偏差的领域无关预训练策略。 我们的结果超越了最先进的物理性质,揭示了以前未知的结构基序,为纳米技术界提供了新见解,并证明了机器学习可以驱动真正的科学发现。

论文精读

TL;DR NMO 基准引入基于量子模拟的分子优化任务,用物理约束替代药物代理指标,暴露生成模型的域偏移缺陷,并通过领域无关预训练实现纳米材料的科学发现。

问题

领域背景

生成式分子设计(Generative Molecular Design)长期以药物样性质(drug-like properties) 为优化目标,依赖简单代理模型(如 QED、SA score)和在大规模药物数据集(例如 ChEMBL)上预训练的模型。这种做法在药物发现场景下已能产出高基准指标,但掩盖了一个关键问题:模型是否真的能迁移到化学空间差异巨大的领域?

现有方法局限

当前主流方法的核心局限在于:

  • 代理指标与真实物理模拟脱节:药物基准中常用的打分函数(如 logP、分子量)是经验性的快速估计,与纳米技术关注的量子输运、热电优值、光机械耦合等物理性质有本质差异,后者必须通过含时密度泛函(TD-DFT)或非平衡格林函数(NEGF) 等昂贵模拟才能获得。
  • 预训练引入分布偏差:模型在药物种化合物上学习到的结构先验(如杂环骨架、旋转键模式)强烈偏向有机小分子药物空间,在面对大π共轭体系、有机金属片段、锚定基团等纳米构件时,生成能力大幅退化。
  • 忽视硬性结构约束:纳米分子设计往往要求精确的拓扑模式(如“Donor-π-Acceptor”结构、特定端基锚定),现有序列/图生成模型难以保证输出严格满足这些约束,导致大量无效分子。

技术挑战与重要性

NMO 基准揭示的难点在于:

  1. 崎岖的适应度景观(rugged fitness landscape):量子模拟得到的性质对分子结构极为敏感,微小的键长、取代基变化可能导致性能剧变,需要模型同时具备全局探索局部优化能力。
  2. 多目标权衡:任务如单分子热电效率要求同时优化电导(G)、塞贝克系数(S)与热导(κ),三者常通过 Wiedemann-Franz 定律耦合,难以兼得。
  3. 科学实用性:NMO 并非又一个“分数游戏”,其设计目标直接对应实际纳米器件(单分子结、等离激元腔) 的物理实现,业界关注度正随分子电子学、量子材料的兴起而走高。

行业类比

这一挑战类似于从自然语言生成(NLG)的流畅度优化,转向为机器人任务生成满足刚体动力学约束的运动轨迹——后者不仅要输出看起来合理的序列,还必须通过物理仿真器的精确验证,且探索空间受限于真实世界的硬性规则。

核心洞察

  • NMO 基准通过量子物理模拟取代代理指标,暴露了现有分子优化方法在药物领域外的显著不足。过去大多数分子优化基准使用简单的代理模型(如 QED、SAscore)来评估药物相似性,导致模型过度拟合到平滑的指标曲面,而无法迁移到纳米技术等结构截然不同的领域。NMO 直接采用第一性原理计算作为 oracle,并施加严格的硬性结构约束,形成崎岖的适应度景观。先进 GFlowNets 等方法在 NMO 任务上表现不如简单遗传算法,颠覆了基准排行榜的固有观念,促使研究者反思生成式模型在真实物理问题上的适用性。
  • Graph Group SELFIES 表示和领域无关的预训练策略是使 ML 推动真实科学发现的关键使能技术。针对纳米材料中常见的复杂结构约束,作者提出将分子编码为片段组的新型字符串表示,在生成过程中自动满足基序共存要求,弥补了传统 SMILES/SELFIES 无法处理此类约束的不足。同时在无制药关联的合成数据集上预训练,消除药物分布偏差,使模型获得普适的化学先验。结合遗传-GFlowNet 混合框架,该方法在三个纳米物理任务上超越了已知物理性质,发现全新结构基序,证明了 AI 不仅能优化指标,更能引领科学探索。

方法

方法概要:Genetic GFN 与 Graph Group SELFIES 的集成设计

输入与表示

  • 分子结构: 使用基于 SELFIES 的扩展表示 —— Graph Group SELFIES,将分子按官能团或结构基元聚合为可操作组(group),在执行交叉、变异等遗传操作时保持价键约束,天然避免无效分子生成。
  • 预训练数据: 采用领域无关的合成数据集,故意排除药物分子库,消除对药理性质的结构性偏好。

关键模块:遗传搜索驱动的 GFlowNet (Genetic GFN)

  1. GFlowNet 生成策略
    将分子生成建模为轨迹流,通过前向策略采样分子片段序列,学习生成高奖励结构。奖励信号来自量子力学模拟(如热输运、热电效率、光力学响应),而非药物类代理指标。

  2. 遗传算法组件

    • 种群初始化: 用 GFlowNet 生成的分子作为初始种群。
    • 遗传操作: 在 Graph Group SELFIES 编码上执行交叉、变异,确保结构合法性。
    • 适应性超参数: 动态调整 GFlowNet 的探索-利用平衡(如温度参数),防止在崎岖适应度地貌中过早收敛。
  3. 化学直觉注入
    将量子化学描述符(如 HOMO-LUMO 能隙、振动频率)作为辅助特征输入策略网络,加速收敛并提升物理可解释性。

输出与评估

生成候选分子经过严格物理模拟评估,最终输出满足苛刻阈值(如热导率、ZT 值)的高性能分子。还通过消融实验验证各组件贡献,确保方法复现性。

与同类方法的差异

传统分子优化方法(如基于 REINFORCE 或 Bayesian Optimization)依赖药物预训练表征,无法处理 NMO 任务中硬性的价键约束和极度非凸的物理奖励景观。本方法通过 领域无关预训练 + 约束感知遗传操作 + GFlowNet 多样性采样,首次在纳米技术分子设计任务上超越简单基线,并发现新的结构基元。

实验

实验设计:NMO 基准包含三个量子物理驱动的分子优化任务,分别针对单分子热传输、分子热电效率以及基于自组装单分子层的太赫兹探测。奖励信号来自量子模拟,而非代理模型,并施加严格的片段组合约束。测试了多种生成模型(如 BOSS、JT-VAE、GFlowNet 等)以及提出的 Genetic GFN 框架,该框架引入图分组 SELFIES 表示和领域无关预训练。

关键发现:传统面向药物发现的深度生成模型在 NMO 任务上表现不佳,难以应对硬结构约束和高维 rugged 适应度景观;简单方法如遗传算法反而更具竞争力。Genetic GFN 通过片段库引导的生成和自适应稳定性机制,成功发现了一批具有优异物理性质的新型分子结构,其中部分结构基元是过往文献中未报道的。

与基线对比:Genetic GFN 在所有三个任务上均显著优于现有最先进分子优化方法,尤其在热传输和热电任务中提升明显,说明消除药物数据集偏差和显式建模结构约束是关键。而基于 SMILES 或图的传统生成模型由于缺乏对约束的编码,搜索效率低,验证了 NMO 基准对生成模型提出的新要求。

行业影响

落地场景

NMO 基准为纳米技术分子优化提供基于量子模拟的逼真任务,涵盖单分子热输运热电效率太赫兹检测,直接对接半导体散热材料、柔性热电设备、纳米光子传感器等领域的研发需求。材料科学团队、晶圆代工企业、新能源公司均可借此驱动生成式模型,定向搜索高导热分子、高 ZT 值有机热电材料或强光-机耦合分子。

商业价值

传统材料发现依赖“试错合成-测试”循环,周期长、成本高。NMO 将真实量子模拟作为 oracle,使in-silico 筛选替代大部分实验迭代,可将候选分子评估周期从数月压缩至数天。物理严格性削弱“指标作弊”现象,提升有效专利产出。率先部署此类能力的组织可通过专利布局与新器件设计抢占细分市场。

与现有产品/工作流的接口

NMO 提供标准化任务协议与Graph Group SELFIES 表示,可无缝插入高通量虚拟筛选管线。输入分子结构,经外部 DFT 或量子输运求解器(如 Quantum ESPRESSO、GPAW)返回物性,适应现有 HPC 集群。配套开源的Genetic GFN 基线及领域无关预训练策略,允许团队快速复现基线,或作为模块嵌入自研材料设计平台(如 Schrödinger Materials Suite 或定制的 ML-driven 材料发现框架)。

具体用例

  1. 芯片热管理:某全球逻辑芯片制造商利用 NMO 热输运任务优化热界面材料(TIM)分子,生成模型筛选出具有超低界面热阻的候选分子,经 DFT 验证后合成测试,有望降低高密度封装芯片热点温度 5-10°C,提升服务器能效。
  2. 自供能 IoT 传感器:新能源初创团队应用 NMO 热电效率任务,通过生成模型搜索高功率因子的有机热电分子,用于低功耗温湿度传感器能量采集,取代纽扣电池,降低维护成本。

局限

  • **量子模拟的计算成本较高**,NMO 基准依赖精确的量子传输模拟(如密度泛函理论、非平衡格林函数)生成奖励信号,导致单次评估开销显著,限制了大规模在线迭代和超参数搜索的可行性。目前仅覆盖三个任务,扩展到更复杂的纳米器件场景时,计算瓶颈可能进一步加剧,从而降低基准的实用性和可及性。
  • **所设计分子的可合成性与稳定性未充分验证**:基准中的分子在结构上受 hard constraints 约束,但并未纳入合成可行性或热力学稳定性评估。由此产生的 top-performing 分子虽然在物理性质上表现优异,但可能在实验中难以制备或易于分解,削弱了从基准指标到真实的实验室发现的转化潜力。
  • **基线方法的泛化性尚未在其他任务或领域验证**:提出的 Genetic GFN 框架和 Graph Group SELFIES 表示针对 NMO 任务中的刚性结构约束设计,但其在药物发现等传统分子优化场景或其他材料体系(如光电器件、催化)上的表现尚不清楚。若在新领域需重新设计表示和预训练策略,将增加方法迁移的成本。
论文Matthias Blaschke2026-06-29原文

相关内容