Large Discovery Models:基于实证的模型驱动开放搜索
科学发现通常需要在庞大、结构化且开放端的假设空间(如分子、蛋白质序列和计算机程序)中优化评估成本高昂的目标。生成模型(如大型语言模型)为此类空间提供了富有表现力的先验,但其似然度和自我评估作为目标与校准不确定性代理并不可靠,尤其对于分布外的新颖候选。 我们提出 Large Discovery Model (LDM),一种基于实证的循环架构,将生成模型与贝叶斯非参数奖励代理模型耦合。生成模型负责提出并改进候选设计,代理模型预测其性能并量化不确定性,从而产生不确定性感知值来指导候选的生成、改进与筛选。发现记忆与代理模型随每次新实验观测而持续更新。 我们在三个不同设计模态与目标场景中评估 LDM:神经网络训练、抗体设计和分子优化。与仅用 LLM 反思或传统统计搜索相比,LDM 在验证集 BPB 上取得 2.4 倍更大幅度的降低,结合能相对下降 18.2%,分子多目标性能相对提升超过 60%。 这些结果表明,LDM 可作为一种通用发现引擎,在开放端假设空间中实现高效搜索。
论文精读
TL;DR Large Discovery Model (LDM) 将生成模型与贝叶斯非参数奖励代理模型耦合,用不确定性感知的 acquisition 函数驱动开放域搜索,在抗体设计和分子优化中显著超越纯 LLM 与传统统计搜索。
问题
科学发现中的开放空间搜索 在分子设计、蛋白质工程、程序合成等领域,核心任务是在巨大、结构化、开放假设空间上优化昂贵评估目标。这类问题通常只有少量实验反馈可获取,要求搜索策略同时具备强先验、全局探索能力和可靠的不确定性估计。
现有方法局限
- 单纯 LLM 反思(如直接让模型生成候选并自我评估)缺乏与真实实验反馈的闭环。LLM 的似然值或自我评分往往与任务目标不对齐,并且在分布外候选上过度自信,没有校准的认知不确定性。
- 传统统计搜索(如高斯过程贝叶斯优化)在高维、离散、序列化的组合空间中扩展性差,需要手工设计核函数或特征表示,难以有效利用生成模型携带的丰富结构先验。
- 两类方法之间缺少耦合:LLM 提供表达先验,但不接地;统计搜索提供不确定性,但难以驱动开放式生成。
为什么这个问题难且重要
- 技术挑战在于构建一个统一的循环架构,让生成模型提出的候选能被实时的代理模型评估不确定性,并用该反馈持续改进生成策略。
- 工业界高度关注药物发现、抗体设计与神经架构搜索等场景,这些场景的评估成本极高,一次实验可能耗费数周或高额资源,因此提高搜索样本效率具有直接经济价值。
行业类比 类似 AutoML 中结合元学习先验与在线试错反馈进行神经架构搜索,但扩展到更广阔的分子与蛋白设计空间。
核心洞察
- LDM 的核心在于将生成模型与贝叶斯非参数奖励代理模型耦合,通过代理模型的不确定性感知价值函数指导候选生成、精炼与选择。这区别于纯 LLM 反思或固定代理的统计搜索:LLM 的似然与自我评估在分布外候选上不可靠,而传统代理模型缺乏生成模型的表达性先验。LDM 用经验数据校准不确定性,使搜索在开放域空间中既保持探索广度又具备评估准确性。
- LDM 维护一个随实验反馈持续更新的发现记忆和代理模型,形成数据驱动的闭环搜索。不同于传统贝叶斯优化中代理模型的批量或离线更新,LDM 将每次新观测即时并入循环生成过程,使代理模型能够追踪分布漂移,并逐步优化对未知区域的预测能力。这种在线更新机制让搜索策略动态适应不断积累的实验证据,而不是静态地依赖初始先验。
- LDM 通过微调将 acquisition-tilted 分布蒸馏进生成模型权重,而非简单的 reward 引导。Reward 引导容易过拟合历史高分样本、丧失探索性;而 acquisition 引导保留了不确定性驱动的探索倾向。蒸馏后,生成模型自身内化了搜索经验,在后续任务中无需额外代理评估即可高效提议候选,实现了跨任务的知识迁移与样本效率提升。
方法
输入:一个开放式设计空间(如分子序列、蛋白质序列、程序代码)和一个昂贵的黑盒目标函数。
关键模块
- 生成基础模型:通常是大型语言模型(LLM),作为候选设计的先验分布,负责提出和迭代改进候选。
- 贝叶斯非参代理模型:如高斯过程(GP),对奖励函数进行经验建模,输出预测均值和校准后的不确定性。
- 基于模型的采集函数:结合代理预测与不确定性,生成采集价值(acquisition value),如期望改进(EI) 或置信上界(UCB),指导搜索偏向高价值且需探索的区域。
- 发现记忆:存储历史实验观测(候选、目标值、元数据),每次新观测后更新代理模型。
推理与训练流程
- 推理时,通过采集倾斜搜索分布(acquisition-tilted search distribution)从生成模型中采样候选,优先选择采集价值高的设计。
- 训练时,通过采集引导的策略学习(acquisition-guided policy learning)而非奖励引导,将采集价值蒸馏进生成模型权重;收集采集重加权数据,并加入推理增强,使模型内化有用的发现经验。
输出:经验验证后的候选设计(如优化后的分子结构或抗体序列),同时更新发现记忆和代理模型。
与同类方法差异:与单纯 LLM 反思或传统统计搜索不同,LDM 将生成先验与贝叶斯非参的不确定性估计 结合,避免依赖不可靠的 LLM 似然作为代理,实现真正不确定性感知的开放式搜索。
实验
实验设计概述
LDM 在三个典型场景上评估:AutoResearch(自主研究循环,涉及神经网络训练)、抗体 CDRH3 设计、小分子药物发现。这些场景均具有昂贵评估、大规模结构化、开放假设空间的特点。LDM 将生成模型与贝叶斯非参数奖励代理模型耦合,通过采集倾斜搜索分布(acquisition-tilted search distribution)引导候选生成、细化和选择。实验对比了仅 LLM 反思和传统统计搜索两类基线。
关键发现
- 在神经网络训练验证 BPB 上,LDM 相较基线实现 2.4 倍更大降低。
- 在抗体 CDRH3 设计上,LDM 将结合能相对降低 18.2%。
- 在分子多目标优化中,LDM 取得 >60% 的相对性能提升。
- 消融研究表明测试时搜索扩展与采集函数选择对性能有显著影响;微调将采集价值蒸馏到模型权重,提升分布外泛化。
基线对比深度解读
仅 LLM 反思依赖模型似然度和自我评估作为目标代理,在分布外候选上不可靠。传统统计搜索缺乏生成先验,难以在结构化空间中高效探索。LDM 用经验接地的代理模型提供校准的不确定性估计,实现采集倾斜的搜索,从而更有效地平衡探索与利用。微调进一步将搜索经验固化,使模型无需昂贵在线搜索即可复用发现策略。该架构为实际工程提供启示:利用非参数代理模型校准不确定性,指导生成模型迭代,有望作为通用发现引擎用于昂贵评估的开放空间搜索。
行业影响
落地场景
LDM 适用于评估成本高、候选空间结构化且开放的优化问题,典型场景包括:
- 药物分子设计:多目标优化分子活性、合成可及性;
- 抗体 / 蛋白工程:结合能、稳定性等实验优化;
- AutoML / 神经网络架构搜索:训练成本高,需不确定性引导;
- 工业配方 / 材料设计:合金、电解质等。
商业价值
- 降本:减少物理实验或高成本仿真调用次数,以更少实验达到更优结果;
- 增收:加速研发周期,更快推出新药、新材料或更优模型;
- 决策可靠性:不确定性量化降低试错风险,提升研发 ROI。
与现有产品 / 工作流的接口
LDM 可作为决策层模块嵌入现有实验设计与主动学习管道:
- 生成模型负责 proposal,现有模拟器或湿实验平台作为 oracle 评价;
- 替代传统贝叶斯优化中的 GP 代理,同时引入 LLM 先验与 acquisition-tilted search;
- 支持将 acquisition value 蒸馏到生成模型权重,便于低延迟采样部署;
- 封装为 model-based optimizer 服务,输入候选池与目标函数评价 API。
具体落地 use case
- 药物发现 SaaS 平台:将 LDM 作为分子生成与活性预测的联合引擎,药企上传靶点后,系统迭代推荐小批量化合物进行合成与测试,相较于随机筛选或纯语言反思,可显著减少湿实验轮次。
- 云厂商 AutoML 服务:用 LDM 搜索神经网络架构、超参数和训练策略,替代传统贝叶斯优化,对昂贵训练任务提供不确定性感知的候选建议,并通过 fine-tune 复用历史搜索经验,形成跨项目学习。
与纯 LLM 反思或传统统计搜索相比,LDM 通过非参数贝叶斯代理量化认知不确定性,在 test-time 执行 acquisition-tilted search,更适合真实实验反馈循环。
局限
- - **实验反馈依赖与成本限制**:LDM 的核心循环要求每个新候选都经过真实评估(如湿实验或完整训练),这在抗体设计与分子优化中周期长、成本高;论文中的神经架构搜索等模拟任务虽能快速反馈,但与实际科学发现的噪声和延迟存在差距,限制了在线迭代效率与规模化应用。 - **代理模型在高维离散空间的扩展性存疑**:方法采用贝叶斯非参数 reward surrogate(如高斯过程),对高维字符串或图结构候选的核函数设计与后验计算可能面临瓶颈;作者虽提到 dynamic support,但未在超大规模候选库(如全蛋白质序列或百亿级分子)上展示计算效率与精度,这影响其作为通用发现引擎的可行性。 - **与同类混合方法的差异尚需更充分验证**:LDM 的创新主要体现在 acquisition-tilted 微调和发现记忆整合,整体框架仍高度依赖生成模型先验质量;与近期基于扩散模型、遗传算法或更先进的 BO 基线对比有限,三个案例任务规模偏小,跨任务和分布外泛化证据主要来自内部消融,缺乏大规模开放基准测试。