HypoEvolve:遗传算法赋能多智能体 LLM 发现科学假设
科学智能体通过综合证据、评估提案与提出新解释来推动假设发现。近期系统将科学智能体与演化搜索相结合,借助批判、比较与修订来迭代假设。然而,不同形式的智能体协作如何影响假设质量 仍是未解问题。要回答它,就必须把智能体自身的科学能力与协作带来的效应分离开来,因此框架需保留智能体的科学角色,并支持假设的组合、修订与保留规则。 基于这一视角,我们提出 HypoEvolve,通过逐代更新假设种群使协作过程显式化。具体而言,我们设计了一种 代际遗传算法,协调专门化的 LLM 智能体:它们分别整合机制论证、重新审视前提假设,并评估证据与可检验性。每一代都明确规定科学判断与新提案如何重塑种群,使协作对假设质量的影响可直接检验。 评估围绕具有科学意义的假设展开,即解释某项干预为何可能起效。药物重定位将这类解释与靶点层面的生物学主张相连,并依据外部证据加以评判。我们将 DepMap 与 Open Targets 改造为互补的外部指标,扎根于实验、遗传与临床证据。在 34 种癌症类型上,HypoEvolve 在两项指标上均取得最高分,超越六个基线:DepMap 选择性达 0.171,而最强基线仅为 0.115;相较单次生成的增益也能泛化到留出的癌症类型。 HypoEvolve 推进了一种自主科学的愿景:AI 研究团队能够获得超越单个模型的发现能力。
论文精读
TL;DR HypoEvolve 用遗传算法协调多智能体 LLM 迭代假设种群,在药物重定位任务上以 DepMap 选择性 0.171 超越最强基线 0.115,首次显式分离智能体能力与协作效果对假设质量的影响。
问题
问题背景
AI for Science 领域正探索用 LLM 驱动的科学 agent 辅助假设发现,如药物重定位中生成“某药为何可能有效”的机制解释。
现有方法局限
已有系统将科学 agent 与进化搜索结合,通过批判、比较、修订来迭代假设,但核心局限在于:协作形式对假设质量的影响未被清晰分离。多数框架将 agent 的个体科学能力(如生成机制论证、评估证据)与群体协作机制(如如何交叉、保留、淘汰假设)耦合在一起,难以判断质量提升来自更强的单模型还是更优的协作规则。此外,进化搜索中的种群更新规则往往隐式且固定,无法直接测试不同组合/修订/保留策略;评估也常依赖 LLM 自评或有限人工判断,缺乏外部实验证据支撑,导致“看起来更合理”却不代表真实生物学有效。
为什么难/重要
难点在于:科学假设质量本身难以量化,需要锚定可验证的外部信号(如 DepMap、Open Targets 中的实验/遗传/临床证据);多 agent 协作设计空间巨大——角色分工、信息传递、选择压力、变异算子等都会影响最终假设,但搜索成本高,且缺乏理论指导。业界对 AI 辅助药物发现期望很高,若协作仅增加算力开销而不能稳定超越单模型生成,则多 agent 架构意义有限。因此,需要一个显式、可配置、可对比的协作框架来系统地回答“何种协作有效”。
行业类比
类似代码生成中的 multi-agent review 流程:多个 LLM 分别生成、审查、修改代码,但必须证明这种协作相比单模型 pass@k 或简单重采样能带来可测量的正确率提升,否则只是昂贵的花架子。
核心洞察
- HypoEvolve 将多智能体协作显式建模为 hypothesis population 上的 generational genetic algorithm,使协作策略成为可配置、可消融的实验变量。以往科学 Agent 系统(如基于 critique-revision 循环的方法)将协作隐式嵌入单线程迭代中,难以区分模型自身的科学能力与协作机制带来的增益;HypoEvolve 通过种群初始化、选择、交叉、变异等算子,让不同协作规则(例如如何组合、修订、保留假设)对假设质量的贡献可以直接测试,从而首次系统性地回答了“何种协作形式更能提升假设质量”这一开放问题。
- HypoEvolve 采用外部实验证据(DepMap 与 Open Targets)作为适应度函数,而非仅依赖 LLM 自评或文本相似度,为科学假设发现提供了客观、可复现的评价基准。药物重定位任务将假设的机制解释映射到靶点级生物学声明,使评估锚定在真实的实验、遗传和临床数据上;这种设计避免了“自说自话”的验证陷阱,并且能够检测出单次生成在 held-out 癌症类型上的泛化局限。HypoEvolve 在 34 种癌症类型上 DepMap selectivity 达到 0.171,显著高于最强 baseline 的 0.115,证明了基于外部证据的遗传算法协作确实能产生更高质量的假设。
方法
HypoEvolve 将科学假设发现建模为一个受控遗传算法过程,核心是把多个专用 LLM agent 嵌入到“假设种群”的迭代更新中。
输入
- 给定一个药物重定位任务,输入包含目标疾病上下文、候选药物约束(如已知可干预靶点或化学空间)以及可供检索的外部证据语料。
- 初始种群由单次生成 agent 产生,每个假设包含“药物-靶点-机制解释”三元组。
关键模块
- 生成与审查 agent:从一个假设出发,整合机制论证、证据强度与可测试性,生成新的候选假设或修订现有假设。
- 成对比较 agent:对种群内假设进行两两对比,输出相对适应度评分,替代手工设计的固定 fitness 函数,有效利用 LLM 的语义判断。
- 进化 agent:执行显式的遗传算子——选择、交叉、变异——例如将两个父代假设的机制论证与靶点声明重组,或对假设的某一维度引入扰动,生成下一代种群。
- 种群更新规则:每一代由比较分数驱动保留 Top-k 个体,再由进化 agent 填充新个体,保证种群在多样性中持续改进。
输出
输出为经过多轮协作演化后的假设种群,每个假设附带可验证的生物学机制解释。对于药物重定位,这些解释被转化为靶点级声明,用 DepMap(基因依赖性)和 Open Targets(遗传与临床证据)两个外部指标进行评分。
与同类进化式科学 agent 系统的差异在于:HypoEvolve 将 agent 协作形式显式编码为可配置的种群更新规则,使得“科学能力”与“协作策略”的效果可以分离并直接检验。
实验
实验设计
- 在 34 种癌症类型 上评估 HypoEvolve 与 六个基线 的性能。
- 采用两个互补外部指标:DepMap 基于实验与遗传证据,Open Targets 整合临床证据。
- 验证进化式多智能体协作是否提升假设质量,并通过留出癌种测试泛化能力。
关键发现
- HypoEvolve 在两个指标上均取得最高分。
- DepMap selectivity 达到
0.171,最强基线为0.115,相对提升约 48%。 - 相比单次生成(single-pass generation),进化搜索的优势在留出癌症类型上依然保持。
与基线对比解读
论文未列出六个基线具体名称,但摘要强调协作规则的可测试性。
HypoEvolve 通过遗传算法将假设种群更新显式化,每一代结合科学判断与新提案。与单次生成或非进化协作相比,它同时保留了科学角色分工,并将组合、修订、保留策略作为调节变量。结果表明,结构化迭代搜索显著优于静态生成,且优势跨癌种稳定,说明进化机制本身(而非特定领域知识)贡献了增益。该框架为后续设计可复用的科学发现智能体团队提供了可参考的协作范式。
行业影响
落地场景
HypoEvolve 的多智能体遗传搜索框架可直接应用于药物研发企业的 靶点发现与药物重定位 工作流:将文献证据、基因扰动数据、临床试验信号编码为 LLM 可操作的假设种群,通过生成、比较、修订的迭代过程产出机制明确、可验证的候选干预方案。此外,企业级科研知识管理平台(如科学文献智能分析、内部实验假设生成)也可复用该框架,用遗传算法替代单次 LLM 推理,提升假设的多样性与证据一致性。
商业价值
核心价值在于 降低探索成本 与 缩短研发周期。传统药物重定位依赖人工综述与湿实验筛选,耗时耗资;HypoEvolve 通过外部证据驱动的适应度函数(DepMap 选择性、Open Targets 关联分数)自动筛选假设,可显著减少无效实验设计。在金融、内容推荐等需快速产生并验证策略假设的场景中,该框架能将策略搜索从人工枚举变为有导向的进化过程,减少试错开销,间接提升决策质量与收入转化率。
与现有产品/工作流的接口
可作为 假设生成引擎 集成到现有 AI 研发栈:
- 通过 LangChain / AutoGen 等 agent 编排框架调用,替换单次 LLM 生成模块,嵌入数据管道;
- 将
HypoEvolve输出的假设种群对接企业内部 知识图谱 或实验管理系统(如 Benchling、Labguru),自动生成验证优先级列表; - 对外部证据源(如 DepMap、Open Targets)建立标准化适配器,使适应度评估可插拔,支持切换至专有数据。
具体 use case:一家跨国药企使用该框架对肿瘤适应症进行药物重定位扫描,将初始候选列表从数百个化合物压缩至十个高证据假设,直接对接湿实验团队;一个企业服务 AI 平台将其用于自动生成 A/B 测试的策略假设,每个假设附带机制解释与支持证据,帮助产品团队快速决策。
局限
- **任务领域单一**:所有实验均围绕药物重定位展开,并使用 **DepMap** 和 **Open Targets** 作为外部证据来源。这两类数据集高度聚焦于癌症细胞系与已知靶点关联,虽然能提供量化验证,但无法代表科学假设生成的广泛场景(如材料科学、神经科学或社会科学)。作者在摘要中仅提及 drug repurposing 作为验证平台,未展示跨领域的迁移能力。若将该框架推广到其他科学问题,可能需要重新设计 agent 的 prompt、外部证据接口以及 fitness 计算方式,增加了适配成本。
- **计算开销与超参数敏感性**:遗传算法需要多代运行,每代涉及多个 LLM agent 的调用(生成、比较、修改),累计 token 消耗和 API 延迟远高于单次生成。论文设有专门讨论 computational cost 的章节,说明作者意识到该问题,但未给出低成本的替代方案或分布式优化策略。此外,种群大小、代数、变异率、选择压力等超参数对最终结果影响显著,且缺少自动调参机制,实际应用中需要反复实验才能找到合适配置。
- **评估指标可能偏向已知关联**:使用 DepMap selectivity 和 Open Targets 评分作为 fitness,本质上是衡量生成假设与现有知识库的吻合程度。这可能导致系统倾向于产出与已知靶点相近的“安全”假设,而难以发现真正新颖但尚未被数据库收录的机制。虽然作者强调假设需具备机制解释性,但外部指标并未直接评估机制的新颖性或可证伪性。与一些基于人类专家评审或湿实验验证的方法相比,当前评估方式对科学突破的预测效度有限。