论文

Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station

Can AI Agents Make Open-Ended Scientific Discovery? Evidence from Station

近期 AI 系统在指标明确的科学发现任务上进展迅速,但能否自主开展开放式科学发现仍不清楚。本文研究 AI 在 Station 中完成开放式任务的能力——Station 是一个由多个 agent 模拟科学生态的开源世界环境。 为应对开放式任务的挑战,作者为 Station 增加了两项机制:Supervisor 机制与周期性 Meta Reflection,即使缺乏中间指标也能鼓励持续探索。实验任务取自 ICLR 的三篇近期 oral 论文:只向 agent 提供论文的核心研究问题,隐藏论文结果并禁用网络访问,再将原始发现拆分为若干评估条目,统计 agent 重新发现的比例。 结果显示,Station 平均重新发现 62.7% 的条目,而 Codex Multiagent-v2 为 15.4%,AI Scientist-v2 为 14.4–20.6%。消融与行为分析表明,两项机制结合可提升研究覆盖度与连续性。此外,在两个没有对照论文的开放式任务上,agent 的部分发现与知识截止日期之后研究者发表的成果高度吻合。 总体而言,合适的环境能够使 agent 在开放式科学发现中自主取得有意义的进展。

论文精读

TL;DR Station 是一个多智能体开放世界环境,通过 Supervisor 与 Meta Reflection 机制促进无明确指标下的持续探索,在三个 ICLR 论文的再发现任务中平均找回 62.7% 的发现标准,远超现有基线(约 15%),证明 AI 能自主进行开放科学发现。

问题

问题背景

当前 AI 在科学发现中的进展主要集中在 定义明确的指标 上,例如蛋白质结构预测、材料性质优化等封闭或半开放任务。但科研最核心的形态是 开放式问题 ——没有现成奖励函数,研究路径与成功标准未知。

现有方法局限

  • 现有 AI Scientist 类系统依赖预定义搜索空间与可量化指标,缺乏在没有中间信号时持续探索的能力,容易在早期阶段停滞。
  • 单代理框架无法模拟科研社区中的协作、批判与知识积累,难以处理假设空间的组合爆炸。
  • 缺少 长期研究连续性 机制:当一个方向暂时没有产出时,系统会放弃而非进行元层面反思调整策略。

为什么这个问题难/重要

开放式科学发现要求智能体在巨大假设空间中进行 无监督探索、自我评估研究价值、并动态调整长期策略,这是通用人工智能的关键能力。业界对 AI 自动化科研的需求强烈,但现有系统尚不能自主产生新知识,只能辅助人类完成有明确步骤的任务。

行业类比

这一挑战类似于从 有奖励的强化学习(如游戏通关)跃迁到 无奖励的自主探索(如真实机器人开放环境操作),需要环境与机制的设计来引导探索行为。

核心洞察

  • 开放世界模拟与监督/元反思机制结合,将开放式探索转化为可持续的科研过程。 与 Codex Multiagent-v2 和 AI Scientist-v2 主要依赖单一任务指标或线性管线不同,Station 在缺少中间奖励的阶段通过 Supervisor 持续指派子目标、Meta Reflection 周期整合发现,避免过早收敛。这解释了为什么其重发现率(62.7%)远高于其他系统(15.4% / 14.4-20.6%)。工程启示:构建长期自主研究智能体时,应优先设计外部监督和反思回路,而非仅提升模型推理能力。
  • 以真实 ICLR oral 论文的发现为基准,将结果拆分为可判定的 criteria 并禁网评估。 这种评估方式比传统自动化指标或人类偏好更客观、可复现,同时能量化系统与人类研究者的差距(62.7% vs 100%)。它提供了一个可迭代的科研智能体 benchmark,未来可扩展至更多领域。

方法

Station 环境接受开放式科学研究问题作为输入,问题取自 ICLR 口头论文,并禁用网络访问且不提供论文结果。

关键模块

  • 多智能体生态:多个研究代理在 Station 中并行探索,模拟科学社区的分工与协作。
  • Supervisor 机制:监督者在缺少可量化的中间指标时介入,评估代理当前进度并注入新的探索方向,避免代理因缺乏反馈而停滞或重复低效路径。
  • 周期性 Meta Reflection:定期触发反思流程,代理回顾自身研究历史,提炼阶段性洞见并修正后续计划,增强长期目标一致性。
  • Consolidation Agent:整合不同代理的发现,去重并归纳为候选科学结论,用于后续与人工标注标准的比对。

输出

代理最终产出一组科学发现,评估时将其与原始论文拆解出的细粒度 criteria 逐一匹配,计算重新发现率。

与同类自动化发现系统(如 AI Scientist)的差异在于:Station 通过 Supervisor 和 Meta Reflection 显式处理开放任务中常见的目标漂移与反馈稀疏问题,不依赖预先定义的优化指标即可维持持续探索。

实验

实验设计

Station 是一个 开放世界科学研究环境,多个 agent 模拟科学社区。研究者选取三篇 ICLR 口头报告论文作为重新发现任务,只提供研究问题,隐藏结果并禁用网络。评估时,将原始论文发现拆解为细粒度标准,由盲评专家判断 agent 是否重新发现。对比基线包括 Codex Multiagent-v2 与 AI Scientist-v2。此外,Station 引入两项机制:Supervisor 与周期性 Meta Reflection,以鼓励缺乏中间指标时的持续探索。

关键发现

Station 平均重新发现 62.7% 的原始标准,远高于 Codex Multiagent-v2 的 15.4% 和 AI Scientist-v2 的 14.4–20.6%。消融实验表明,同时加入 Supervisor 与 Meta Reflection 可提升研究覆盖度与连续性。在两个无 oracle 论文的探索任务(Subliminal Learning、VLM Hallucination)中,agent 的部分发现与知识截止后研究者报告的结果吻合。

与基线对比解读

基线系统在缺乏明确奖励信号时容易过早收敛或停滞,而 Station 通过层级监督与阶段性元反思维持探索动力。这提示工程上:开放式科研 agent 需要结构化环境与自我评估循环,而非单纯依赖 LLM 能力。但 62.7% 仍意味着大量标准未被发现,说明距离全自主科学发现仍有显著差距。

行业影响

落地场景

Station 提供了在无明确奖励信号下进行开放式探索的工程范式,适用于药物发现、材料筛选、复杂系统根因分析等长周期研发场景。可将多智能体模拟生态嵌入内部科研平台,让 Agent 自主生成假设、设计实验并积累知识。例如,在靶点发现中,Supervisor 维持研究主线,Meta Reflection 定期整合阶段成果,避免陷入局部死胡同。

商业价值

  • 降本:减少大量无效试错,将研究员从重复的文献调研与实验设计中解放;Station 在开放式任务中平均取得 62.7% 的发现重现率,对比 AI Scientist-v2 等系统提升显著,有望成为研发效率倍增器。
  • 增收:更早识别潜在新靶点、新材料或新算法路径,加速专利申请与产品迭代,形成技术护城河。
  • 体验提升:研究员可实时获得探索进展与结构化总结,降低沟通成本。

与现有工作流集成

  • 可封装为 LLM 工具,接入现有自动化科研流水线,如调用 MLflow 记录实验、Semantic Scholar 获取文献。
  • Supervisor 机制可作为独立 Agent 角色加入现有 multi-agent 框架(如 AutoGen、CrewAI),负责目标拆解与任务分配。
  • Meta Reflection 输出可注入实验管理平台的运行描述中,形成周期性洞察摘要,支持人工审阅。
  • 通过 API 与计算资源调度器(如 Kubernetes)联动,自动分配模拟实验所需的 GPU/CPU。

具体落地 use case

  1. 药企靶点发现平台:部署 Station 型 Agent 集群,输入“探索与铁死亡相关的新型调节因子”,代理自动搜索文献、设计验证实验、分析公共组学数据;Supervisor 确保聚焦,Meta Reflection 每 50 步生成假设摘要,研究员仅需审核高置信发现。预计可将靶点初筛周期从数月缩短至数周。
  2. 自动驾驶 corner case 研究:针对“为什么模型在雨天夜间误检率升高”的开放式问题,多个 Agent 分别探索数据分布、传感器噪声、标注偏差等维度,无预设指标,通过长期探索发现非直觉的关联因素,指导数据采集与模型改进。

局限

  • 评估协议依赖 oracle 论文可能导致过拟合。三个 rediscovery 任务均源自 ICLR oral 论文,将原始发现细分为 criteria 作为评估目标。尽管论文提到了盲评,但任务构造本身可能隐含先验:智能体在环境中接触到的线索(如研究问题、实验提示)可能足以引导至特定方向。此外,底层 LLM 的训练数据可能包含这些论文的部分信息(虽然禁用 web,但模型参数中记忆不会被擦除),使得 62.7% 的 rediscovery 率被高估。相比之下,AI Scientist-v2 等对照方法使用同一 LLM 基础,若信息泄露存在,对比结果可能失真。该局限削弱了对“真正开放发现能力”的结论支持。
  • Station 环境与真实科学发现仍有较大差距。环境中的“科学”任务仅限于机器学习领域的特定子问题(RL 中的涌现规划、LLM 输出的低秩结构、RNN 中的时间表征),实验通过模拟操作完成,与现实世界中的实验设计、设备操作、数据获取等环节无法对应。Supervisor 和 Meta Reflection 机制依赖预定义角色和周期性元反思,这些机制可能过度适配当前任务设置,迁移到其他学科(如生物学、材料科学)时效果未知。此外,多智能体生态的模拟简化了科研合作与竞争的真实动态。
  • 可复现性与计算成本问题。尽管论文公开了 GitHub 仓库,但 star 数极少(1 star),且论文未详细报告各任务的 LLM token 消耗和总成本,长周期多智能体运行的资源开销可能成为实际应用的障碍。探索性任务(无 oracle 论文)的评估依赖于主观判断(如“部分发现与 cutoff 后研究匹配”),缺乏统一的定量指标,削弱了结论的客观性。此外,基准的评估标准划分可能不够细粒度,导致 criteria 之间存在重叠,进一步影响评分可靠性。
论文Wenyu Du2026-10-06原文

相关内容