论文

优化优化器:语言模型发现更快的分子弛豫

优化优化器:语言模型发现更快的分子弛豫

几何优化 是许多量子化学工作流中的主要开销:每走一步都需要一次力评估,而在密度泛函层面,该评估主导了整体墙钟时间。该领域已积累了大量优化方法,本文追问:语言模型能否通过 autoresearch 超越其中最好的方法? 一个 agent 直接改写优化器本身,以最小化 力调用次数 为目标,并受两道准入门的约束:拒绝过早停止,以及拒绝无法泛化到未见分子的改进。搜索从目前最快的开源优化器 Sella 出发,最终得到 AutoSella,这是一个包含两个优化器的家族。 在留出的分子基准以及搜索中未使用的势能面上,AutoSella 相对 Sella 均能稳定减少力调用次数。最突出的是,在 r2SCAN-3c DFT 级别下,最佳变体只需 Sella 40.2%–77.2% 的力调用,即可达到相同的能量下降——而 agent 全程未使用任何 DFT 梯度。

论文精读

TL;DR 语言模型自主重写分子优化器,从 Sella 出发得到 AutoSella,在 r2SCAN-3c DFT 级将力调用降至原来的 40.2–77.2%,并泛化到未见分子与势能。

问题

问题背景

几何优化(分子弛豫)是量子化学与材料计算流程中的基础步骤,每个优化步需要一次力计算;在 DFT 级别,力评估占据绝大部分墙钟时间。业界长期关注如何减少力调用次数以加速高通量筛选。

现有方法局限

  • 现有优化器(Sella / geomeTRIC / ASE BFGS / LBFGS / FIRE 等)多为手工设计的启发式算法,依赖特定坐标系统、Hessian 更新与步长控制策略。
  • 这些方法在势能面上的表现依赖经验调参,难以系统探索算法组合空间;面对复杂势能面(如柔性分子、弱相互作用)常常需要更多力计算。
  • 已有自动研究尝试主要调整超参数或局部组件,很少直接重写优化器控制流和核心逻辑,导致性能提升趋于饱和。

为什么这个问题难且重要

  • 优化器算法空间是离散、高维且具有强条件依赖的,搜索必须在保证数值收敛与结构一致性的前提下进行;力评估昂贵,样本效率极为关键。
  • 更少的力调用直接转化为 DFT 级别模拟的成本下降,对材料发现和药物设计的虚拟筛选影响显著。
  • 代理需要平衡探索与泛化,防止过拟合特定分子集;论文中的双准入门(拒绝过早停止与不泛化改进)正是应对这一挑战的核心机制。

行业类比

这与 LLM 在 AI 编译器中自动生成优化 pass 以降低推理延迟或内存占用的思路类似,只是优化目标从延迟变为力调用次数。

核心洞察

  • **优化器本身成为可编辑代码的搜索空间**,而非仅调超参数。该工作让 LLM agent 直接重写 Sella 优化器源码,并用两个 admission gates 严格约束:拒绝过早停止、拒绝不泛化到未见分子的改进。与神经架构搜索或 AutoML 的超参调优相比,代码级重写能引入新的控制逻辑(如分段 Hessian 更新、碰撞处理),而双重 gate 解决了生成式搜索常见的过拟合基准与提前收敛问题,使自动发现的优化器具备跨体系的可靠性与可部署性。
  • **低成本代理势上搜索、高成本 DFT 上零样本迁移**,大幅降低自动优化器设计成本。agent 仅在 GFN2-xTB 等廉价势能面上训练与评估,却在 r2SCAN-3c DFT 下将力调用次数降至 Sella 的 40.2–77.2%,且全程未使用任何 DFT 梯度。这证明优化器的核心策略(坐标变换、Hessian 更新、步长控制等)不依赖特定势能面,与通常需在目标计算精度上调优的做法形成差异,为多精度物理模拟场景下的元优化提供了可复制范式。

方法

输入与任务定义

输入为开源优化器 Sella(已知最快的分子弛豫优化器之一)、一组分子结构、势能面(初始为 GFN2-xTB,后续迁移到 r2SCAN-3c DFT)以及收敛准则。优化目标是最小化达到相同能量下降所需的力调用次数(force-call count),每个力调用对应一次昂贵的量子化学计算。

关键模块:autoresearch 循环与双门控

核心是一个由语言模型驱动的 autoresearch loop。该循环中,语言模型 agent 直接修改优化器的源代码,生成候选变体。每次修改后,候选优化器在隔离环境中对分子集进行弛豫测试,收集每分子的力调用次数与最终能量。两个 admission gates 决定候选是否进入下一轮:

  • 早停拒绝门控:拒绝那些过早终止、未达到参考能量下降标准的候选,防止“节省”力调用但牺牲精度的作弊行为。
  • 泛化门控:候选必须在未见过的分子和未参与搜索的势能面上验证,确保改进不是对特定训练案例的过拟合。

循环支持并行评估:agent 环境与评估进程隔离,通过远程 worker 分发计算任务,避免代码修改影响评估可靠性。agent 的记忆保留历史成功/失败案例,引导后续修改。

输出:AutoSella 家族

搜索产出两个优化器变体:AutoSella-F 和 AutoSella-A。前者基于 Sella 的块结构重组,包括几何初始化、片段处理、模型 Hessian 与坐标变换、Hessian 更新、步长控制等模块;后者引入了额外的校准、碰撞处理和高斯过程模块。在 r2SCAN-3c DFT 级别,最佳变体仅需 Sella 40.2%–77.2% 的力调用即可达到相同能量降低,且 agent 在搜索过程中未接触 DFT 梯度。

与同类方法的差异

与传统优化器手工设计或基于梯度的超参数搜索不同,该方法让语言模型直接重写优化器算法本身,并通过双门控自动筛选出兼具效率与泛化性的变体,实现了算法层面的自动化探索。

实验

实验设计

搜索从 Sella 出发,分子集为 held-out 基准,势能面包括 GFN2-xTB 与 r2SCAN-3c DFT。运行 autoresearch loop,代理重写 optimizer 代码,以最小化力调用次数为目标。两个 admission gates:拒绝 premature stopping、拒绝无法泛化到 unseen molecules 的改进。评估时对比 Sella 和其他经典优化器。

关键发现

产出 AutoSella 家族两优化器。在 held-out 分子基准和 unseen potentials 上一致减少力调用。在 r2SCAN-3c DFT 级别,最佳变体仅需 Sella 的 40.2–77.2% 力调用次数,达到相同能量下降;且搜索过程中未使用任何 DFT 梯度。

与基线对比解读

相对 Sella 的力调用降幅最高约 60%,在 DFT 级别直接节省 wall time。其泛化性验证了代理并非过拟合特定势能面,而是学到了 optimizer 内部逻辑改进。两个 admission gates 是关键,防止在训练集上提前截断或在 unseen molecules 上退化。该框架可迁移到其他量子化学工作流中的优化器自动改进。

行业影响

落地场景

分子模拟与药物发现 是核心应用:制药企业、CRO 和 AI 药物设计公司的先导化合物优化、构象搜索与反应路径计算均可直接受益。材料科学与催化剂设计 领域,新能源、半导体、化工材料的几何优化同样需要大量 DFT 计算。此外,提供量子化学计算服务的云计算平台(如 AWS、Google Cloud HPC、材料计算 SaaS)可将 AutoSella 作为默认优化器集成。

商业价值

  • 降本:在 r2SCAN-3c 水平,AutoSella 仅需 Sella 的 40.2%–77.2% 力调用次数,直接降低 DFT 机时费用。
  • 增效:优化时间缩短,提升高通量虚拟筛选吞吐量,加速药物发现与材料研发周期。
  • 产品差异化:云服务商或药物研发平台若内置 AutoSella,可吸引对成本和速度敏感的客户,形成竞争优势。

与现有产品 / 工作流的接口

AutoSella 基于 Sella 重写,接口兼容,可通过 Python 包装替换现有几何优化器(如 PyBerny、geomeTRIC)。在 ASE、pysisyphus 等框架中可直接插入;对于 Schrödinger、Gaussian 等商业软件,可经脚本或插件方式调用。同时,论文展示的 LLM agent 自研究循环(重写优化器 + 双门验证)可作为一种算法自动进化范式,未来或应用于神经网络训练优化器、运筹求解器等领域的效率提升。

具体用例:某 AI 制药创业公司每天运行 10 万级分子构象优化,切换 AutoSella 后 DFT 计算成本下降约 40%,节省的算力可用于扩大筛选库或更多靶点验证。某云原生材料计算平台将 AutoSella 设为默认优化器,在相同计算资源下服务更多客户,提升毛利率。

局限

  • **搜索成本未被量化**:autoresearch loop 依赖大量评估迭代,虽然作者在 GFN2-xTB 廉价势上训练智能体以减少力调用,但整个搜索过程的计算开销(GPU/CPU 时、远程 worker 通信等)并未详细报告。对于更大的分子体系或需要更高精度势函数的场景,搜索本身可能消耗远超收益的资源,限制了该方法在计算资源受限环境下的可复用性。
  • **泛化边界受限**:论文在特定的分子基准集和 r2SCAN-3c / GFN2-xTB 势上验证了 AutoSella,但未测试过渡态优化、激发态几何、周期性体系或大规模生物分子等更广泛任务。智能体在训练过程中可能过拟合于所见的分子分布,对分布外体系(如强关联体系、非共价相互作用主导的团簇)的力调用减少效果存疑,需更多外部验证。
  • **缺乏可解释性**:AutoSella 是语言模型生成的黑箱代码修改,论文并未详细解释具体哪些优化器组件(如 Hessian 更新、步长控制)被改进,以及为什么这些修改能减少力调用。这削弱了对优化器设计原则的深入理解,也限制了研究者基于该成果进行手动优化或迁移到其他优化算法的可能性。
论文Artem Tsypin2026-10-05原文

相关内容