论文

ExplorationBench: 衡量 AI 系统在可验证 Alien Worlds 中的探索能力

ExplorationBench: 衡量 AI 系统在可验证 Alien Worlds 中的探索能力

科学发现始于已知问题的边界之外。在那里,AI 系统必须进行探索:提出假设、设计实验并迭代结果。但评估这种能力十分困难:一是如何验证一个真正新的假设是否成立,二是如何判断系统是通过探索发现它,还是仅从预训练数据中回忆了相关知识。 为此,我们提出 ExplorationBench ,把科学探索评估这一棘手问题转化为具体可处理的框架,其基础是可验证的 Alien Worlds :它们的规则可执行,因此每个答案都能被精确检验;它们的规则与熟悉知识相冲突,因此仅靠记忆无法解题。基准包含两个沙盒: AlienCode (31 个发现目标、70 个任务)与 AlienLogic (24 个发现目标、70 个任务)。每个沙盒提供一个有缺陷的手册、任务特定的环境反馈以及专用的 tool-call schema,系统借此探索沙盒,再求解留出的 held-out 任务。 我们评估了 10 个 AI 系统,发现最强的系统能够习得并应用不熟悉的规则,但性能在不同轨迹间差异很大,持续探索可能停滞甚至逆转此前的收益。ExplorationBench 是迈向「能在未知环境中通过探索获取并应用全新知识」的 AI 系统的一步。

论文精读

TL;DR ExplorationBench 用可执行的“异世界”沙盒,将科学探索评估转化为可验证的规则发现任务,有效区分探索与回忆,并揭示当前 AI 获取和应用新知识时的潜力与不稳定。

问题

问题背景

AI 系统在科学发现中的角色正从已知问题求解转向未知领域探索。业界关注如何评估模型提出假设、设计实验并从反馈中迭代的能力。

现有方法局限

现有基准多聚焦静态知识问答或固定任务求解,无法验证“新知识”的正确性;或依赖人类专家标注,成本高且不可扩展。更关键的是,系统可能通过预训练数据中已有的相关规则回忆出答案,而非真正通过探索发现。传统评估无法区分“探索获得”与“记忆调用”,评估结果可能高估模型在未知环境中的适应能力。

为什么这个问题难/重要

科学探索本质是开放问题,假设空间无限,验证新假设需要可执行的环境。同时,要保证任务对于预训练模型是未知的,避免数据污染。这要求构建规则可执行、与常见知识冲突的沙盒环境,使得仅靠 recall 不能解决。ExplorationBench 通过 AlienCode 和 AlienLogic 两个沙盒提供有缺陷的手册、环境反馈和工具调用协议,并利用留出任务(held-out tasks)测量探索后的应用能力。该能力对于构建能在未知环境中自主获取知识的 AI agent 至关重要,也是迈向通用科学发现的关键一步。

行业类比

类似强化学习智能体在开放世界环境中通过交互发现规则而非依赖预置知识库,比如 AI 智能体在未知 API 或工具环境中自主探索其使用方式。

核心洞察

  • ExplorationBench 通过构造“规则可执行但与预训练知识冲突”的 Alien Worlds,同时解决了探索评估中“如何验证新假设”和“如何排除回忆干扰”这两个核心难题。它不像传统 benchmark 依赖静态 QA 或已知科学问题,而是让 AI 在未知规则环境中通过 flawed manual、环境反馈和工具调用进行主动探索,再测试其泛化到 held-out 任务的能力,从而真正测量“获取新知识”而非“检索旧知识”。这种设计将科学探索评估从开放难题转化为可自动验证的框架。
  • 论文发现“发现规则”与“应用规则”之间存在非线性关系:即使系统在探索中表现出对某规则的理解,后续应用也可能不稳定,且持续探索可能导致性能停滞甚至逆转。这揭示了对 AI 探索能力的评估不能只看最终准确率或单一轨迹,必须追踪探索动态和预算分配。与多数只报告最终得分的 benchmark 不同,ExplorationBench 显式测量 Best@n、rule reports 和 dynamics,为工程上设计自适应停止策略或资源分配提供了实证依据。
  • ExplorationBench 引入 flawed manual 作为先验知识,模拟真实科学发现中手册或文献可能包含错误,迫使系统不能盲目信任先验,而必须通过实验验证和修正。这不同于以往假设环境规则完整正确的交互式学习任务,更贴近科研实际,也测试了系统对不可靠来源的批判性使用能力。

方法

方法概览

ExplorationBench 将科学探索评估转化为可验证的交互式任务。输入包括两个沙盒环境 AlienCode 与 AlienLogic,每个沙盒提供一份有缺陷的手册、任务相关的环境反馈以及专用工具调用协议。系统首先在种子阶段获得少量带解示例,随后进入探索阶段:通过调用工具执行实验、观察结果、形成假设并迭代修正。最终输出分为两部分:对 held-out 任务的答案,以及一份规则报告(rule reports)描述系统推断出的环境规则。

关键模块

  1. 外星世界沙盒:AlienCode 包含 31 个发现目标、70 个任务;AlienLogic 包含 24 个发现目标、70 个任务。规则可执行,因此每个答案都能被精确验证;同时规则故意与常见知识冲突,迫使系统依赖探索而非预训练记忆。
  2. 有缺陷的手册:提供不完整或误导性的初始说明,模拟真实科研中不完善的先验知识。
  3. 工具调用与反馈:定义了正式的 tool-call schema,系统通过调用沙盒内操作获取反馈,作为探索的原始数据。
  4. 评估指标:核心指标包括 held-out accuracy(留出任务正确率)、model score(结合答案与规则报告的综合评分)、探索动态(trajectory dynamics)和交互预算(interaction budget)。

流程与输出

整体流程遵循“假设-实验-迭代”循环:系统在探索预算内不断提出假设、设计工具调用进行验证、根据反馈调整规则模型。最终系统在 unseen 任务上作答,并提交对规则的显式描述。

与现有交互式推理基准(如 ScienceWorld、WebArena)不同,ExplorationBench 通过可执行但反常识的规则设计,明确分离了“探索获得新知识”与“回忆预训练知识”,从而直接评测系统在未知环境中的科学发现能力。

实验

实验设计

构建 ExplorationBench,包含两个可验证异世界沙盒 AlienCode(31 发现目标,70 任务)和 AlienLogic(24 发现目标,70 任务)。规则可执行且与人类常识冲突,确保无法通过预训练记忆直接回答。系统需利用有缺陷手册、环境反馈和工具调用进行探索,再解决 held-out 任务。评估 10 个前沿 AI 系统,指标包括 held-out accuracy、model score、规则报告和探索动态。

关键发现

最强系统能获取并应用不熟悉规则;但性能在不同轨迹间波动显著,继续探索可能停滞或逆转先前收益,表明探索可靠性仍是瓶颈。

对比解读

与仅依赖回忆的评估相比,该基准通过可执行规则和冲突知识设计,有效区分“真探索”和“记忆召回”。相比其他交互式评估,它提供了自动验证和明确的探索目标,使科学探索能力可量化。结果提示当前模型在开放式探索中缺乏稳定策略,需要在轨迹级鲁棒性上改进。项目主页

行业影响

落地场景

ExplorationBench 评估的探索能力可应用于需要快速适应未知规则的 AI 产品:

  • AI Agent 自适应系统:在电商推荐或内容平台中,用户行为与内容分布持续漂移,agent 需通过环境反馈探索新关联规则,而非仅依赖预训练知识。
  • 自动化运维与根因分析:复杂分布式系统故障模式不断演变,agent 可借助工具调用和反馈学习未知故障特征。
  • 科学研发辅助:药物发现、材料设计中的假设生成与实验迭代,需要验证全新假设并排除记忆干扰。

商业价值

  • 降低人工规则维护成本:agent 自主发现新规则,减少专家介入,缩短规则更新周期。
  • 提升长尾场景收益:通过探索发现 niche 规则,提高个性化推荐或风控模型对冷启动品类的准确率,直接增加转化与收入。
  • 加速产品冷启动:在新领域数据稀缺时,利用探索能力快速建立可用规则集,减少冷启动时间。

与现有产品/工作流的接口

  • 评估环节:将 ExplorationBench 作为部署前 AI 系统的探索能力基准,集成到 MLOps 流水线,与传统 benchmark(如 MMLU)互补,筛选具备真实探索能力的模型。
  • 训练数据生成:利用 benchmark 中的轨迹数据(包含 flawed manual、工具调用、环境反馈)微调 agent 的探索策略,提升 ReAct 或 Tool-use agent 在未知环境中的表现。
  • 工具调用协议标准化:benchmark 定义的工具调用 schema 可作为企业 agent 平台测试新工具适应能力的基准接口。

具体落地 use case:某电商平台部署 AI agent 动态调整推荐策略,新品类上线时,agent 通过探索用户点击反馈和环境信号,快速学习该品类的关联规则,无需重新训练推荐模型;某内容平台使用 agent 自动发现新型审核规则,应对不断变化的内容形式,减少人工审核策略迭代周期。

局限

  • **外部效度局限**:Alien Worlds 的规则由人工构造且完全可执行,与真实科学发现中的噪声、测量误差和不可验证性存在本质区别。真实环境中的假设验证往往无法获得二元精确反馈,但本基准提供确定性反馈,可能高估系统在真实探索中的表现。此外,任务规模(AlienCode 31 个发现目标、70 个任务;AlienLogic 24 个发现目标、70 个任务)相对较小,覆盖的科学探索场景有限,难以全面反映探索能力的多样性。
  • **评估方差控制不足**:论文指出性能在不同轨迹间差异显著,持续探索甚至可能停滞或倒退。这说明单次轨迹的结果不稳定,评估协议对初始条件、采样策略和探索路径高度敏感。尽管引入了 Best@n 等指标,但在实际使用中,要获得可靠评估需要多次独立运行并聚合结果,带来较高计算成本。与固定测试集的传统基准相比,交互式评估的方差控制和可重复性仍是未完全解决的问题。
论文Ming Zhang2026-09-24原文

相关内容