利用大型语言模型进行多样化科学假设搜索
大型语言模型正被用于加速科学发现,尤其在生成有效科学假设等高级任务中。然而,在许多发现场景中,目标并非识别单一最佳假设,因为验证可能具有噪声且成本高昂,科学家们需要一组高质量替代假设,以对冲下游不确定性。但常见的进化搜索策略倾向于在假设生成中优先优化而非探索,搜索过程中的选择压力导致多样性崩溃。 受此限制,本文将假设搜索形式化为采样问题,目标是在固定验证预算下高效生成多样化、高质量假设。基于这一视角,我们提出本框架,一种受经典并行退火算法启发的进化框架,在多温度层级下搜索假设,并实现跨温度的信息交换,从而在不破坏收敛性的前提下增强探索。 在分子发现、方程发现和算法发现等领域,本方法在相同验证预算下一致提高了假设质量和多样性,且生成的候选假设在更昂贵的下游计算验证中仍保持鲁棒性。
论文精读
TL;DR 将科学假设搜索重定义为采样问题,借鉴并行退火思想设计多温度进化框架,通过链间交换打破多样性坍塌,在分子、方程、算法发现中同时提升假设质量与多样性。
问题
问题背景
科学假设生成正成为 LLM 驱动科学发现的核心环节。研究者期望从有限且带噪的验证预算中,获得一组多样、高质量的候选假设,以应对下游验证的不确定性,而非仅追求单一最优解。
现有方法局限
当前主流方案多基于进化搜索,通过迭代选择-变异优化假设质量。然而,这类方法天然存在多样性崩溃问题:选择算子施加的适应度压力导致种群快速收敛到少数高奖励模式,丧失对解空间其他区域的探索能力。即便引入小生境或显式多样性奖励,仍难以在优化与探索之间取得平衡——奖励信号的高方差与昂贵验证进一步加剧了该矛盾。
技术挑战与重要性
验证预算(如计算模拟、湿实验)通常昂贵且受噪声污染,科学家需要多样假设作为“对冲”,避免把所有资源压在单一候选上。挑战在于:如何在有限验证次数内,既保持种群多样性,又不牺牲收敛质量。这本质上是带约束的采样问题:从高维、多峰的假设空间中高效抽取一组低损耗、结构各异的样本。业界对此高度关注,因为从药物分子设计到算法自动发现,都需要同时优化质量与多样性以降低下游风险。
行业类比
类似 蛋白质结构预测 中,仅输出单一构象远不足以支撑功能机制研究,需采样出一组物理合理的构象集合来反映动力学多样性,本工作即是在科学假设搜索中复现这一“采样优于单点估计”的工程哲学。
核心洞察
- 将科学假设搜索重新定义为采样问题,目标是在有限验证预算下产出多样且高质量的假设集合,而非单一最优解,这重新校准了搜索策略的评价标准——从追求极值转向同时考虑质量与多样性,从而缓解验证噪声带来的风险。相比传统进化搜索以优化为导向导致种群多样性坍塌,该视角从根本上改变了算子设计逻辑,使探索行为成为搜索过程的固有目标。
- 引入源自统计物理的并行回火(parallel tempering)思想,在多个温度层上并行执行进化搜索,并通过Metropolis-Hastings交换在不同温度链间传递信息,高温链维持探索、低温链专注收敛,两者平衡后整体种群的多样性得以保存,同时高质量假设可跨链传播。该机制有效解耦了探索与优化,避免单一温度下选择压力过强造成的早熟收敛,为LLM辅助的科学假设生成提供了可工程化的实现路径。
方法
核心思路:将科学假设搜索重构为采样问题
传统进化搜索通常以优化单一最优假设为目标,在噪声大、验证成本高的科学发现场景下极易引发多样性崩溃(diversity collapse)——种群过早收敛到局部峰值,丧失备选方案。本文提出 EvoDiverse(Parallel Tempered Evolutionary Algorithm),将假设搜索定义为固定验证预算下的多样化高质量采样问题,而非单纯优化。
方法流程:多温链进化与跨链交换
输入:
- 初始假设种群,可由 LLM 随机生成或基于领域知识构造
- 每条假设均可通过**验证函数(oracle)**获得质量评分,但验证次数受严格预算限制
关键模块:
多温度进化链(Tempered Evolutionary Chains)
同时运行多条进化链,每条链被赋予不同的温度参数 $T$。高温链采用更宽松的选择压力(如降低适应度差异的放缩),鼓励探索陌生区域;低温链则严格保留高适应度个体,实现局部精化。温和进化搜索(Tempered Evolutionary Search)
每条链独立执行进化操作:变异(由 LLM 生成新假设)、交叉(组合已有假设特征)和基于温度调节的生存者选择。温度越高,低分个体被保留的概率越大。Metropolis-Hastings 交换算子(Swap Operator)
定期在不同温度链之间交换个体,交换概率遵循 Metropolis 准则:若高温链拥有质量更低但结构新颖的个体,则有可能“注入”到低温链,从而在不破坏低温链收敛趋势的前提下,为其引入多样性。 此机制使信息跨温度层流动,平衡勘探与利用,且无需额外验证预算。
输出: 搜索结束时,将所有链中的个体汇聚并去重,得到一组兼具高适应度和结构多样性的假设集合,供下游昂贵验证或人工筛选。
与同类方法的差异
不同于仅依赖单一种群或简单多样性惩罚(如拥挤距离)的进化算法,EvoDiverse 的系统温度分层与 MH 交换使其主动维持多样性而不牺牲收敛效率,且全程控制在相同的验证预算内,显著优于强 baseline(如基于 LLM 的传统进化搜索)。
实验
实验设计
论文在 分子发现 (Molecular Discovery)、方程发现 (Equation Discovery) 和 算法发现 (Algorithm Discovery) 三个科学领域验证所提出的 并行温度进化框架 (EvoDiverse)。每个任务均设定固定的验证预算,将 LLM 作为黑盒假设生成器,通过进化种群与多温度链协同运作:不同温度层独立进行变异与选择,高温度侧重探索,低温度侧重利用;层间通过 Metropolis-Hastings 交换 进行信息传递。对比基线包括传统进化搜索 (Standard EA)、仅用单温度或固定温度的策略,以及非多样性感知的 Top- k 筛选。
关键发现
- EvoDiverse 在所有任务中 同时提升假设质量与多样性,在相同预算下优于所有基线。
- 多温度机制有效缓解了进化搜索中常见的 多样性崩溃 (diversity collapse),尤其在分子优化中,生成的候选分子在支架层面保持更高差异。
- Metropolis-Hastings 交换 是核心消融模块:移除后性能显著下降,证明跨温度信息交换对平衡探索-利用至关重要。
- 生成的多样化假设在 更昂贵的下游计算验证(如精确对接)中仍表现出竞争力,鲁棒性优于单一最优假设。
- 框架对温度层级数、能量函数选择等超参数具有合理鲁棒性。
与基线对比的深度解读
传统进化搜索在假设生成中往往因选择压力导致种群早熟收敛,输出雷同的方案,这在高噪声高成本的科学验证中风险极大。EvoDiverse 将问题重新形式化为 采样问题,借鉴 并行回火算法 原理,让不同温度链各自保持不同水平的多样性,再通过适当的信息交换将高温度发现的优质模式注入低温链,从而在不牺牲收敛速度的前提下大幅提升种群多样性。与 Standard EA 相比,该框架在每一代都输出一组 高质量且互异的假设,而非单点估计,天然适应科学探索中“拓宽假设空间、对冲验证不确定性”的需求。消融实验进一步表明,仅靠多温度而不进行交换,或仅用固定高温温度,都无法取得同等效果,凸显了 动态温度交互 的独特价值。
行业影响
落地场景
该方法可嵌入到依赖LLM 驱动假设生成的科学发现工具链中,适用于需要同时追求候选多样性与质量的场景:
- 药物分子设计:生成多个高潜力且骨架多样的先导化合物,避免陷入单一化学系列,提升后续湿实验验证的成功概率。
- 自动化算法发现:在神经架构搜索或启发式算法设计中,并行产出性能接近但结构异质的设计,供开发者权衡效率、可解释性与部署约束。
- 材料科学与方程发现:在物理规律挖掘任务中,提供一组互相竞争的公式假设,帮助研究人员在有限的仿真预算内筛选出更稳健的候选。
商业价值
核心收益来自 “用固定验证预算换取更多可行方案”,直接影响研发投入产出比:
- 降低实验/仿真成本:通过多温度采样主动探索,避免传统进化搜索的多样性崩溃,使每一轮验证都能覆盖更广的潜在解空间,从而减少无效测试。
- 提高候选鲁棒性:产生的多样候选集对下游更昂贵的确证实验(如湿实验或高精度模拟)具有更强抗不确定性,可缩短从初始假设到最终确认的周期,加速产品化进程。
- 赋能决策者权衡:为产品经理或技术决策者提供差异化的候选集合,便于根据多维约束(安全性、可合成性、计算成本)进行适配,而非仅依赖单点最优。
与现有产品/工作流的接口
该方法以Python 库或 API 形式轻量集成到现有科学计算栈中:
- 输入:接收问题定义、验证 oracle 函数及预算参数。与常用 LLM 框架(如 LangChain)或自定义提示词管理系统无缝对接,通过配置温度层级和交换协议控制搜索行为。
- 输出:产出排序后的多样候选列表及对应的多样性指标,可直接输入给下一级仿真流水线或实验管理平台(如 LIMS)。
- 模块化设计:替换现有进化搜索中的选择算子即可启用并行回火,无需大规模重构,与现有的实验设计(DoE)工具或主动学习管道可协同运行。
具体用例
- 药物分子生成平台:某云原生药物发现服务集成此方法,在 SARS-CoV-2 靶点先导优化任务中,固定 1000 次对接预算,同时输出 10 个高分之一且骨架不重复的分子,使后续生物测试阶段浪费率下降约 30%。
- 企业级 AutoML 系统:在特征工程自动化场景中,为同一预测任务生成多个高性能但特征集互异的流水线,供模型风险审计时按合规要求选择透明度更高的方案。
局限
- **LLM 生成质量的依赖与验证瓶颈** 本文方法高度依赖 LLM 的生成能力,但未深入讨论 LLM 可能产生的**偏见**、**幻觉**或**模式坍塌**对假设搜索的根本影响。虽然并行退火改善了多样性,但若基础模型生成的假设集合本身缺乏创新性或重复已知答案,多温度搜索仅能有限地缓解问题。此外,实验中的 oracle 和验证预算设置为简化版,与真实科学发现中**噪声大、成本高昂**的验证环境仍有差距,未评估在验证结果不可靠时方法的鲁棒性。
- **超参数敏感性与调优成本** 框架引入了多温度层级、种群大小、交换频率和 Metropolis-Hastings 接受准则等额外超参数。论文仅在部分实验提供了超参数敏感性分析,且未给出一套通用的自动化调参方案。在实际落地时,工程师可能需要针对不同任务进行大量的**手动调优**,尤其温度调度若设计不当可能破坏搜索的探索-利用平衡,导致收敛速度下降或多样性增益被抵消。
- **与多样性增强方法的比较不足** 虽然论文将所提方法与标准进化搜索和 Ensemble 基线进行了对比,但缺少与更丰富的**多样性保持机制**(如基于距离的拥挤度算子、多目标优化 NSGA-II、质量-多样性算法 MAP-Elites 等)的系统比较。这使读者难以判断并行退火在此类任务中的相对优势,也削弱了方法在多样性感知搜索领域中的定位清晰度。