ScienceBuddy:面向交互式科学智能体的递归中递归自我改进
我们介绍并发布 ScienceBuddy,一个交互式科研工作空间,将持续自我改进的科学智能体 带入研究者的日常工作流。ScienceBuddy 支持研究者完成科学任务,同时把他们的请求、反馈与执行证据转化为用于持续学习的任务与评估标准(rubric)。 其核心是 递归中递归自我改进(recursive-in-recursive self-improvement),一种把 harness 演化与模型强化学习耦合起来的范式: - 内层递归 在模型固定的前提下改进 harness; - 外层递归 在改进后的 harness 下训练模型。 harness 演化塑造训练经验,模型学习又为 harness 适配创造新的机会。我们给出了研究者交互、harness 精炼与模型学习的案例研究,基准案例覆盖四类科学任务族。 通过将 ScienceBuddy 作为研究产品发布,我们让这一范式可为科学界所用,并向发现智能(discovery intelligence)迈出一步:即通过与研究者的持续协作而进步、并与其所支持的研究共同演化的科学 AI。网站:http://science-buddy.io
论文精读
TL;DR ScienceBuddy 发布交互式科研工作空间,其递归嵌套自改进(recursive-in-recursive self-improvement)耦合 harness 演化与模型强化学习,让科学智能体在与研究者协作中持续提升。
问题
问题背景
交互式科学代理(scientific agents)正从静态问答走向融入研究者日常工作流,核心诉求是让代理在执行科研任务时持续进化,而非一次性工具。
现有方法局限
- 大多数代理系统采用固定 harness 和静态评价基准,无法把研究者的实时请求、反馈和执行证据转化为新的训练任务与 rubrics。
- 模型强化学习通常与工具/环境改进割裂:要么只改模型、要么只改工具,缺少内外循环协调,导致学到的策略很快过时,难以应对开放科学任务的分布漂移。
- 自动构造的 rubrics 往往过于简化或与真实科学目标脱节,造成奖励 hacking,学不到可迁移的科学推理能力。
为什么难/重要
科学任务具有长上下文、多模态证据和稀疏反馈,代理需要一边探索实验一边理解研究者意图。递归式自我改进要求 harness 与模型训练稳定嵌套,技术上需要解决跨周期经验复用、任务自适应奖励以及避免遗忘。这不仅是 agent 产品化的关键,也关系到能否形成“发现智能”(discovery intelligence)——让 AI 在持续协作中真正辅助科研。
行业类比
类似 LLM 代码助手从用户反馈与执行结果中同时改进工具链和模型权重,但科学场景的开放性和证据复杂性更高。
核心洞察
- 从研究交互中自动生成任务和评估标准(rubrics),将模糊科学目标转化为持续学习信号。传统科学智能体依赖静态基准或人工构建数据集,而 ScienceBuddy 将研究者每次请求、反馈和执行证据都转化为可训练任务与对应指标,形成闭环数据引擎。这解决了科学领域数据稀缺、评估主观的难题,使模型能就地取材地适应真实研究需求,而非在固定测试集上过拟合。
- 双层递归自我改进——内层固定模型优化 harness,外层在改进后 harness 下训练模型,迭代耦合。单一层的自我改进(如仅模型 RL 或仅工具进化)容易陷入分布偏移或奖励 hacking。ScienceBuddy 通过交替优化 harness 与模型,让环境演化塑造训练经验,模型学习又为环境提出新需求,形成互相促进的飞轮。这是对“环境-智能体”共进化思路在科研场景的具体落地,工程上可借鉴到其他复杂任务系统。
方法
输入与转化
ScienceBuddy 以研究者在交互式科研工作区中的 请求、反馈与执行证据 作为持续学习输入。系统通过 interaction formulation 将协作痕迹转化为两类产物:任务 与 评估 rubric,并归入 Harbor tasks 作为后续后训练数据。输入还包含多模态证据与长上下文 agentic reasoning 的界面操作。
内层递归:固定模型下的 Harness 改进
内层递归在模型参数冻结时进行。
- 反馈引导诊断 根据任务失败与研究者反馈定位 harness 缺陷;
- Harness 修订 调整工具调用、执行环境或任务生成策略;
- 评估与递归细化 用更新后的 rubric 验证改进,必要时再迭代。
输出为演化后的 harness,重塑后续训练经验。
外层递归:改进 Harness 下的模型强化学习
外层递归在更新 harness 上执行 continual model RL:
- 环境增强 由演化 harness 动态生成新的 rollout 场景;
- 任务自适应 rubric 奖励 每个任务使用其对应 rubric 计算奖励;
group-relative policy objective在 fresh rollout groups 上做组内相对优化,抑制奖励尺度漂移;- 更新模型后,重新触发内层递归,形成 nested update schedule 与跨周期经验复用。
输出:同时改进的模型与 harness,进入下一轮协作。
与同类方法差异:区别于固定 harness 下的模型自我改进或静态环境 agent 训练,ScienceBuddy 将 harness 演化与模型 RL 作为相互嵌套的双层递归,使工具环境与研究者的反馈共同塑造训练分布。
实验
实验设计
论文在 ScienceBuddy 交互式科研工作空间中开展案例研究,覆盖四个科学任务族(benchmark cases)。实验分为三组:
- 研究员交互案例:记录真实研究者如何通过请求、反馈和执行证据驱动任务重构。
- 两周期递归自改进动态:观察内外循环协同,内循环固定模型改进 harness(反馈引导诊断、harness 修订、评估递归优化),外循环在演化后的 harness 下强化学习模型。
- 消融式对比:固定模型仅适配 harness(4.3)与固定 harness 仅训练模型(4.4),分别验证单一循环的作用边界。
关键发现
递归嵌套改进 能持续将交互信号转化为任务规范和评估 rubrics,使训练任务与真实科研需求对齐。
- 内循环产出的修订后 harness 显著改变训练经验分布,为外循环提供更具挑战性的 rollout 环境。
- 外循环模型学习又暴露出新的 harness 适配机会,形成互惠迭代。
- 固定模型下的 harness 演化可独立提升任务完成质量;固定 harness 下的模型强化学习可扩大问题覆盖率,但仅靠单边优化无法达到联合收敛。
与基线对比的深度解读
相比传统 单一自改进范式(固定 harness 训模型,或固定模型改 harness),论文提出的 recursive-in-recursive 结构将两者嵌套在统一调度中:内层循环以模型为常量优化工具与评估逻辑,外层循环以 harness 为常量优化策略。该设计的关键差异在于:并非一次性生成 rubrics,而是将 rubrics 的演化也纳入学习闭环,使评估标准能够随模型能力增长动态调整。这更接近人类科研中"方法改进"与"能力提升"相互促进的认知模式。不过,由于论文未报告具体数值指标,当前结论仍基于定性案例,后续需要公开 benchmark 上的量化对比来验证可扩展性。
行业影响
落地场景
- 企业研发效能平台:将 ScienceBuddy 范式嵌入内部 AI 助手,支持药物发现、材料模拟等科研任务,研究者通过反馈不断改进工具链(harness)与模型策略。
- MLOps 与数据科学工作台:自动把分析师查询、执行日志转化为训练任务与评估 rubrics,优化 Notebook agent 的推理和工具调用能力。
- 垂直行业智能 agent:电商运营优化、金融风控策略迭代等需要专家反馈闭环的场景,可复用其递归自改进机制。
商业价值
- 降本:减少人工调优 harness 和模型的人力成本,自动生成评估 rubrics 并沉淀专家经验。
- 增收:加速从科研洞察到产品化的周期,提升 agent 在高难度任务上的成功率。
- 体验:研究者专注高层判断,降低重复交互负担;系统随使用持续进化,粘性增强。
与现有产品/工作流的接口
- 可作为插件嵌入 JupyterLab / VSCode / 内部数据平台,通过适配器连接现有工具执行环境。
- Harness 演进输出环境配置与评估指标,模型 RL 阶段对接标准训练框架(如 TRL、RLHF 工具链)。
- 生成的任务与 rubrics 可对接数据标注/评测平台,形成持续学习数据闭环。
具体落地用例
- 电商智能选品助手:运营人员提出选品需求并反馈结果,agent 的 harness(商品数据库、销售预测工具)被递归改进,模型策略随之优化,形成“运营反馈→工具/模型双迭代”闭环,减少选品试错成本。
- 医疗影像分析平台:放射科医生对 AI 初步报告进行修改,系统将修改记录与执行证据转化为任务和评分规则,驱动 agent 的检索与报告生成能力持续提升,提高诊断辅助可靠性。
局限
- **实验验证有限**:论文主要基于案例研究和两周期递归动态展示,未报告大规模基准测试或统计显著性检验。其公开 GitHub repository 目前仅 18 stars,说明尚未经过社区广泛检验。虽然覆盖四个科学任务族,但每个任务族的具体实例数量、成功率和方差未充分披露。与 SWE-bench 等成熟的软件工程 agent 评测相比,科学任务缺少标准化评测集,导致性能可比性较弱,难以判断方法在真实科研场景中的泛化能力。
- **方法复杂性与反馈依赖**:递归-in-递归 双层优化引入了内外循环调度、经验回放、环境增广等多个超参数,调参成本显著。Harness 进化依赖研究者反馈和自动构造的评估 rubrics,若反馈稀疏、主观或存在噪声,可能误导 harness 更新和模型训练。此外,从交互记录自动生成任务和 rubrics 的可靠性未做充分消融,其产生低质量样本的风险没有量化。
- **缺少与同类工作的直接对比**:与 Reflexion、Voyager、AutoGen 等现有 self-improving agent 框架相比,ScienceBuddy 强调 harness evolution 与模型 RL 的耦合,但论文未在相同科学任务或通用 agent 基准上进行对比实验,无法体现相对优势。其当前验证集中在生物医学类任务(如 JAK1、ARL4C 等),跨领域(物理、化学、材料等)的可迁移性尚未证明。