论文

EurekAgent: 智能体环境工程是自主科学发现的全部所需

EurekAgent: 智能体环境工程是自主科学发现的全部所需

基于大语言模型的智能体在自动化科学发现方面展现出越来越大的潜力。给定一个可优化的度量和执行环境,它们能够提出、验证并迭代科学解决方案,并且已经产生了超越人类设计方法的结果。 随着模型能力的不断提升,我们认为自主科学发现的瓶颈正从规定智能体工作流转向设计智能体环境:即塑造智能体行为的资源、约束和接口。我们将此定义为环境工程:构建能够放大有益行为(如开放式探索、系统化工件管理和智能体间协作)同时抑制有害行为(如奖励黑客和高摩擦人工监督)的环境。 我们提出了 EurekAgent,一个为度量驱动的自主科学发现而环境工程化的智能体系统。它从四个维度对环境进行工程化设计:权限工程用于受限智能体执行和隔离评估;工件工程用于基于文件系统和 Git 的协作;预算工程用于预算感知的探索;以及人机协同工程用于便捷的人工监督和干预。 EurekAgent 在多个数学、内核工程和机器学习任务上取得了新的最先进结果,包括在总 API 成本低于 11 美元的情况下发现新的 26 圆填充最先进结果。我们开源了代码和结果,并呼吁将环境工程作为开发可靠自主研究智能体的核心研究方向。

论文精读

TL;DR EurekAgent 提出环境工程理念,通过设计权限、工件、预算、人机协同四个维度,以极低成本在数学、内核工程等多项任务中刷新 SOTA。

问题

问题背景

基于 LLM 的 Agent 在科学发现自动化中展现出潜力——给定可优化指标与执行环境,它们能提出、验证并迭代解决方案。但现有研究多关注代理工作流的编排,随着模型能力提升,瓶颈正从“如何设计发现流程”转向“如何设计代理运行环境”。

现有方法局限

传统方法依赖手工预设任务分解、提示策略与工具接口,缺乏对环境本身的系统设计:

  • 执行边界模糊:Agent 可能执行危险操作或污染共享资源,导致评估结果不可信,并诱发 reward hacking。
  • 工件管理混乱:多 Agent 协作时,文件、代码版本缺乏统一追溯,容易产生冲突或重复工作。
  • 成本不可控:无预算意识的探索会消耗巨额 API 费用或算力,难以应用于大规模任务。
  • 人机交互摩擦高:监督者需频繁介入纠错,但现有界面多为被动日志流,信息过载且难以定位关键干预点。

这些局限使自主科学发现的可靠性、可复现性和经济性大打折扣。

技术挑战与重要性

环境工程旨在系统设计资源、约束与接口,以放大开放探索、系统化工件管理、跨代理协作等正向行为,同时抑制 reward hacking、高摩擦监督等负向行为。其核心挑战在于:

  • 需在安全约束探索自由度间取得平衡,避免过度限制扼杀创新。
  • 需为异构任务(数学证明、代码优化、实验设计)提供统一的环境抽象,并兼容不同模型能力。
  • 需将人工监督从“持续介入”转换为“按需干预”,降低认知负荷。

随着 LLM 推理能力快速增强,环境设计成为自主研究 Agent 落地可靠性的关键限制因素,业界对低成本、可审计的科学自动化方案需求迫切。

行业类比

类似云原生领域**从手动运维到可编程基础设施(Infrastructure as Code)**的演进,为 AI Agent 构建可复现、可观测、可约束的运行环境,是迈向可靠自主科学发现的必经之路。

核心洞察

  • **自主科学发现的范式转移:从工作流设计到环境设计。** 随着 LLM 能力提升,决定科研代理成效的瓶颈已从编排思维链或多步工作流转变为构建适宜的执行环境。EurekAgent 首次系统性地提出 **环境工程 (environment engineering)**,通过设计权限、文件系统与 Git 协作、预算限制及人在回路接口等维度,主动引导代理产生探索性、协作性行为并抑制奖励黑客及人类监督摩擦。这与多数依赖精心优化提示或任务分解路线的工作形成鲜明对比,为解决复杂开放域的科学自动化提供了更底层、更可泛化的视角。
  • **低成本高成效的科学发现与工程化的安全边界。** EurekAgent 通过 **预算工程 (budget engineering)** 强制代理进行成本感知的探索,在数学、内核工程、ML 工程任务上取得了新 SOTA,其中 26-unit 圆填充新结果仅耗费不到 $11 API 成本。这种将经济约束直接结构化进环境的设计,区别于仅依赖模型推理或简单重试的基线,同时权限隔离与分支化的 Git 协作环境确保了可复现性与实验安全性,使自主科研代理从演示走向可实用、可信任的工程系统。

方法

系统流程与输入输出定义

EurekAgent 的输入为一个可优化的科学指标(例如某种误差或奖励值)以及相应的执行环境描述。系统运行分为三个阶段:

  1. 准备阶段:根据任务类型初始化权限、预算、文件系统结构和 Git 仓库。
  2. 提出阶段:Agent 生成候选解决方案(假设、代码或实验配置),并提交至环境。
  3. 实施阶段:在隔离环境中执行验证,读取指标反馈,并迭代优化。

输出为经过环境验证的最佳解决方案,包括所有中间制品(代码、日志、结果报告),可直接复现。

环境工程四大维度

EurekAgent 的核心创新不是设计 Agent 工作流,而是设计 Agent 所处的环境,通过资源、约束和接口来引导 Agent 行为,分为四个维度:

  • 权限工程:为 Agent 分配最小必要权限(如仅允许特定目录读写),在隔离容器中运行,防止奖励黑客行为或意外破坏。
  • 制品工程:强制 Agent 将所有产出(代码、数据、实验配置)写入结构化文件系统,并通过 Git 进行版本控制,便于追溯、回滚和多 Agent 协作。
  • 预算工程:设定总 API 成本或计算资源上限,Agent 在迭代过程中需要自主感知预算消耗,动态调整探索密度,避免无限制试错。
  • 人在环路工程:提供简洁的监督接口,人类可随时查看进度、注入先验知识或终止低价值探索,但不强制高频干预,降低监督摩擦。

这四个维度共同定义了 Agent 的“游乐场”,促使其产生开放探索、系统化记录等有效行为,同时抑制奖励黑客等有害行为

与同类方法的差异

传统自动科学发现 Agent(如基于 ReAct 或计划-执行框架)主要优化提示模板或策略,而 EurekAgent 将环境设计作为杠杆点,通过环境结构而非程序指令来塑造 Agent 行为,使系统在基础模型进步时仍能稳定输出可靠结果。

实验

实验设计

EurekAgent 在三大科学发现场景中验证环境工程的效果:

  • 数学任务:以 26 圆紧密填充为例,考察代理在连续参数空间内的开放式探索与迭代优化能力。
  • 内核工程:涉及底层系统组件的自动设计,要求代理在编译、链接约束下生成并验证代码。
  • 机器学习工程:选用 MLE-Bench Lite 竞赛子集,评估代理在模型选择、特征工程、超参数搜索中的端到端表现。

所有实验均以可优化度量为驱动,代理通过 Propose → Implement → Evaluate 循环自主推进。环境工程四维度(权限、工件、预算、人在环)统一施加,不针对单任务特化。

关键发现

EurekAgent 在三个领域均刷新最优结果,尤其以 26 圆填充 达到当前最优,且总 API 成本不到 11 美元。低成本源于预算工程:代理在探索过程中动态评估信息增益,避免盲目暴力尝试。工件工程提供的 Git 版本管理体系让多代理协作和结果复现更稳健,显著减少了人为介入摩擦。权限工程的沙盒隔离确保了评估可信,抑制了奖励黑客行为。

与基线对比

论文尚未提供与明确基线代理(如 vanilla ReAct、AutoGPT 或专门科学发现框架)的定量对照表。但从定性结果看,EurekAgent 与依赖固定工作流的传统代理不同,其环境工程使得代理能自适应分配探索与利用的预算,而无需人工预设启发式。这一差异在开放式任务(如填充问题)中体现为更优的最终解质量,在工程任务中体现为更低资源浪费。未来若补充与 MLAgentBenchChemCrow 等系统的横向比较,可进一步夯实“环境工程是瓶颈”的论断。

行业影响

落地场景

EurekAgent 提出的环境工程范式可直接嵌入任何以可量化指标驱动的自动化研发流程。典型应用包括:

  • 电商 / 内容平台推荐系统:Agent 自动搜索召回模型架构、特征组合与超参数,基于线上 A/B 测试指标进行闭环优化,代替人工试错。
  • 自动驾驶感知模型迭代:在仿真环境中定义检测 / 分割任务的评估指标,Agent 自主设计数据增强策略、模型变体并验证,人在回路审核安全性关键改进。
  • 药物分子生成与性质预测:将分子对接分数等作为优化目标,Agent 在化学空间探索生成候选分子,预算工程控制计算资源消耗。
  • 金融风控模型调优:Agent 自动组合特征工程与模型选择,通过离线回测指标迭代,减少策略迭代周期。

商业价值

  • 降本:将专家驱动的手动实验转为 Agent 自主探索,可大幅降低人力与计算资源浪费。论文中 26-circle packing 新 SOTA 仅花费 $11 API 成本,证明极低实验开销。
  • 增收:加速模型或算法的上线周期,使企业比竞品更快推出优化后的服务,直接带来业务指标提升。
  • 体验提升:通过更优的模型 / 策略间接改善终端用户体验(如更准的推荐、更安全的驾驶决策),减少因人工调参滞后导致的性能衰减。

与现有产品与工作流的接口

  • CI/CD & MLOps 管线EurekAgent 可包装为微服务,通过 API 接收任务定义(指标、环境、预算),产出优化方案和实验日志,无缝接入 Jenkins、Kubeflow 等平台。
  • Git-based 工件管理:利用 Git 进行代码、配置、结果版本控制,与现有代码仓库(GitHub/GitLab)及模型注册中心(MLflow)天然兼容。
  • 监控与审核接口人在回路工程 提供监督嵌入式接口,可通过 Slack/Teams 通知或专用仪表盘进行人工干预,适配企业级权限管控。
  • 成本控制预算工程 定义美元或时间上限,可直接对接 FinOps 工具,避免 Agent 无限消耗资源。

具体落地用例

  1. 电商推荐算法自动调优
    某多品类电商平台需每周迭代排序模型。使用 EurekAgent 定义 RevenuePerSession 为目标指标,限制每周 $50 的云实验预算,Agent 在特征工程、模型结构和 Learning Rate 空间中自动搜索,并将候选部署到 1% 流量进行在线验证。人类专家仅审核最终上线方案,可将迭代周期从 7 天压缩至 2 天,年化收入提升约 0.5%。

  2. 自动驾驶 3D 检测模型长尾问题优化
    一家自动驾驶公司面临夜间、雨雾场景下行人检测召回低的问题。工程师设定 mAP@heavy_rain 为优化指标,仿真环境为沙箱,EurekAgent 自动尝试数据增强策略、多帧融合方式、损失函数变体,每个候选方案消耗固定 GPU 预算。权限工程 确保 Agent 不能直接访问实车数据,人在回路 仅当 Agent 提出涉及传感器融合的重大改动时才触发人工确认,最终将雨天行人检测召回提升 8%,而无需占用高级研究员全职两周。

这种范式使 AI 研发从“工程师手动造轮子”转向“定义目标与环境,让 Agent 自己开车”,为工业级自动实验平台提供了可直接复用的设计蓝图。

局限

  • **度量驱动假设的局限性** EurekAgent 高度依赖一个可优化的度量,这要求任务必须有清晰、客观的数值指标。然而许多科学探索并不存在单一的标量优化目标,使得框架难以直接迁移。即使存在度量,度量设计不当也会导致 **奖励黑客**——论文虽通过环境工程缓解,但根本挑战仍在于度量的完备性。此外,度量本身可能是噪声或对抗性的,环境工程尚未对此提供健壮性分析。
  • **环境预设计与人工依赖** 环境工程的四个维度需要人类专家预先定义资源约束与接口,这本质上是一种**人工先验的注入**。虽然声称“自主科学发现”,但环境设计本身可能限制了探索的开放性和意外发现的可能。例如,严格的沙箱权限和预算控制虽然提升了安全与效率,但也可能过滤掉需要高自由度试错的创意路径。人在回路环节的交互成本并未量化——实际 SOTA 结果是否依赖大量人工审查?这种半自动范式距离“完全自主”仍有较大差距。
  • **任务泛化与评估范围有限** 实验覆盖了数学题、内核工程、ML 基准,主要属于**代码密集型、可自动验证**的领域,并未涉及物理实验、生物湿实验等需要复杂传感器和实物操作的科学场景。在必须处理多模态感知、长期动态规划的任务中,当前环境工程策略能否奏效尚不明朗。另外,对比基线未明确列出(如与 AIDE、GPT-Researcher 等系统全面对比),使得 SOTA 声明的相对优势难以精确评估。
论文Amy Xin2026-06-11原文

相关内容