ASI-Bench:人工智能超级智能的黎明
人工智能超级智能(ASI)要求AI超越对现有知识的掌握,转向探索未知、创造新知识,并将新想法转化为可验证的结果。然而,当前AI系统的能力仍主要建立在学习、压缩和应用人类已有知识之上。相应地,现有基准主要测试AI能否基于习得知识给出正确答案,或能否在大量人工指导下完成任务。 为此,我们提出 ASI-Bench —— 首个在通用研究领域中联合评估AI系统 创新探索、自主科学执行 能力的基准,也是首个在相同研究项目内逐步撤除人工方法指导、以测试AI能独立推进多远的基准。它由40余位专家构建,耗费31,000+小时人工,包含覆盖11个科学领域的60项项目级研究任务,并逐步减少方法指导,以测试AI能否自主选择方法、开展研究并产出可验证的结果。所有任务均经过专家评审、AI辅助审计、沙盒执行与评分验证。 在18种最先进的智能体-模型配置上,平均得分从完整方法指导下的50.91降至仅指定方法的29.10,再降至必须自行确定方法时的26.62。这一显著下滑表明,当前系统仍高度依赖人类指导,远未达到自主开展端到端、项目级科学研究的水平。 ASI-Bench 向全球开放,我们邀请各界研究者与构建者贡献新任务、挑战当前AI的极限,共同加速人类通往人工智能超级智能的集体进程,详见 https://asibench.apexin.ai/submit。
论文精读
TL;DR 首个 ASI 基准 ASI-Bench,用 60 个跨 11 领域的项目级任务逐步撤销方法指导评测 AI 自主科研;18 个前沿模型得分从 50.91 骤降至 26.62,暴露其高度依赖人类指导。
问题
问题背景
当前 AI 领域高度关注通用智能与科学自动化,期望构建能像人类科学家一样探索未知、产生新知识并验证结果的系统。
现有方法局限
现有基准主要分为两类:
- 知识问答型,如 MMLU、GPQA,仅测试模型对已有知识的记忆与推理,不涉及新知识的创造;
- 任务执行型,如 SWE-bench、ScienceAgentBench,依赖人类提供详细步骤或方法指导,模型只需在给定范式下完成局部子任务。
这导致两个盲区:无法评估创新探索能力(提出新假设、设计实验)和无法刻画自主性梯度(从全流程指导到完全自主)。更关键的是,同一研究项目内逐步撤回人类方法论指导的评估范式缺失,使我们对“模型究竟能独立走多远”缺乏量化认知。
为什么这个问题难/重要
技术挑战在于:创新性与自主性难以用静态指标衡量,需要设计项目级、跨领域、可验证的任务并严格审核;同时,高自主性场景下模型易产生幻觉或低效探索,计算成本不可控。业界关注度极高,因为通往 Artificial Superintelligence (ASI) 的核心瓶颈正是从“应用现有知识”到“生成可验证新知识”的跃迁,一个可靠的度量是加速该进程的关键基础设施。
行业类比
如同自动驾驶用 L0–L5 定义自动等级,ASI-Bench 试图为科学研究的自主性建立分级标尺,让团队能明确当前系统所处的阶段。
核心洞察
- ASI-Bench 通过在同一研究项目内设置 B1-B4 四级方法论指导梯度来量化 AI 的自主研究能力,这是首个将人类指导减少作为核心评估变量的基准。与以往固定指导水平或仅测试答案正确性的基准不同,该设计能够分离模型按指令执行与自主决策的能力,实验显示平均得分从完全指导的 50.91 骤降至自主选择方法的 26.62,直观暴露了当前系统对详细方法学指导的严重依赖。
- ASI-Bench 将评估单位从单题或单步任务提升到项目级科学研究,要求 AI 在 11 个科学领域中完成从方法选择、实验执行到可验证结果产出的全过程,并通过沙箱执行和专家评分器双重验证。这填补了现有基准在知识问答与真实科研之间的空白,因为当前多数基准只检查模型是否知道正确答案,而 ASI-Bench 检查模型能否在无人类逐步指导下产生新知识或有效实验证据,更贴近 ASI 的定义。
方法
基准设计方法论
输入:每个项目级研究任务包含原始研究问题、领域约束,以及由 B1 到 B4 四个层级构成的方法学指导梯度。B1 提供完整方法论步骤(含具体算法与实验流程),B2 仅指定方法名称,B3 只给出领域提示,B4 无任何方法线索。
关键模块:
- 任务构建与验证:由超过 40 名领域专家编写 60 个跨 11 个科学领域的研究任务,每个任务经过专家评审、AI 辅助审计、沙箱可执行性检查和评分器验证,确保可复现与可自动评估。
- 信息梯度控制:对于同一任务,不同配置的智能体接收到不同级别的指导,从而测度其对人类方法学支持的依赖程度。
- 执行与评估协议:智能体需在项目范围内自主完成选方法、设计实验、生成结果,最终由预定义评分器(结合客观指标与人类校验)给出 0–1 分数。实验测试了 18 种 agent–model 组合(如不同模型与 harness 搭配)。
输出:一个可量化的自主研究能力得分,以及关于模型在无 / 少指导条件下性能衰减的对比数据。主结果显示平均分从 B1 的 50.91 降至 B2 的 29.10、B3 的 26.62,表明当前系统仍高度依赖显式方法指导。
与同类工作差异:现有科学智能体基准(如 ScienceAgentBench、MLAgentBench)通常固定提供人类拆解好的子目标或完整管线,而 ASI-Bench 首次在同一研究项目内逐步撤销方法学指导,并联合评估创新探索与自主执行的全流程能力。
实验
实验设计
ASI-Bench 包含 60 个项目级研究任务,覆盖 11 个科学领域。实验针对 18 种最先进的 agent–model 配置,在三个指导层次下评估:完整方法指导、仅指定方法、完全自主确定方法。所有任务经过专家审核、AI 辅助审计、沙盒执行和评分器验证。指标为平均得分,衡量从选题、方法设计到结果验证的端到端研究能力。
关键发现
- 平均得分从完整指导的 50.91 骤降至仅指定方法的 29.10,再降至自主确定方法的 26.62。
- 这表明当前系统高度依赖人类方法论指导,不能独立完成项目级科学研究。
- 不同 harness 对模型能力影响显著,计算成本与性能无必然正相关。
对比解读
与现有基准主要测试知识问答或强指导下的任务完成相比,ASI-Bench 首次在同一项目内渐进撤回人类指导,揭示了模型在自主探索和创新执行上的巨大短板。即使是最先进配置,在失去详细步骤后得分近乎腰斩,说明当前 AI 仍处于“执行者”而非“研究者”阶段。这为工程实践指明了方向:在构建科学智能体时,应将自主规划、方法选择和验证闭环作为核心优化目标,而非仅追求单点任务精度。
行业影响
落地场景
- ASI-Bench 可直接用于科研智能体(如 AutoGPT、ChemCrow)的能力分级验收。具体 use case:制药公司 在分子生成管线中,用
B1~`B4` 梯度任务筛选能独立完成“提出假设→实验验证”的 agent,替代人工初筛;内容平台 用其评估 AI 自动设计 A/B 测试并解读结果的能力,定位可自动化的数据科学环节。 - 产品层面,AI 编程助手或科研工作台可集成 ASI-Bench 作为回归测试集,监控自主研究能力退化。
商业价值
- 降本:当前模型自主分数(26.62)远低于指导分数(50.91),说明 AI 尚不能独立承担高价值项目,但可用于生成候选方法,降低专家试错成本。
- 增收:提供 AI 科研服务的厂商可通过 ASI-Bench 认证形成差异化定价;内部研发可将其作为早期筛选工具,避免在低自主性系统上浪费算力。
- 体验提升:渐进指导梯度(B1–B4)帮助产品设计“从全托管到仅目标”的自动化等级,让用户逐步建立信任。
与现有工作流的接口
- 沙箱执行与 scorer 验证易于接入 CI/CD。集成步骤:
- 用官方 API 拉取任务 JSON,按
difficulty_level抽样部署到评测集群。 - 同时运行
B1与B4配置,监控分数差;若差值缩小,说明框架自主性提升。 - 将结果写入模型卡,供下游决策。
- 用官方 API 拉取任务 JSON,按
- 与 SWE-bench、GPQA 等只测最终答案的基准不同,ASI-Bench 强调过程自主性,适合作为元能力测试 嵌入 AI 治理流程,或作为科研智能体 发布前的合规门槛。
局限
- - **任务规模与领域覆盖有限**:仅包含 60 个任务、11 个领域,平均每领域 5-6 个任务,难以捕捉各学科内部的长尾复杂性和跨领域协同要求。科学研究的开放性与多样性决定了少量任务可能无法充分代表 ASI 所需的综合创新能力。实际任务类型可能偏重文本/代码可执行的领域(如数学、计算机),对实验科学(湿实验室、物理装置)覆盖不足,导致基准结论的普适性受限。
- - **评估有效性受限于模拟环境与评分主观性**:所有任务在沙箱中执行,主要依赖文本/代码输出和自动化评分,缺乏真实实验环境(物理操作、长期数据采集)的验证。尽管经过专家审核与 AI 辅助审计,但评分准则由人工设计,对“创新性”“可验证结果”等维度的判断仍存在主观分歧,尤其在开放探索任务中,不同评审可能给出不同反馈,影响基准的稳定性和可重复性。
- - **人类指导的撤回方式由人工构建,可能引入偏差**:信息梯度 B1-B4 由任务贡献者设计,不同任务中“方法指定”的粒度可能不一致,导致跨任务比较不公平。同时,实验仅覆盖 18 种 agent-model 配置,未系统探索不同提示策略、工具调用方式或模型微调对自主性的影响,因此观察到的性能骤降可能部分源于配置选择而非模型本身能力,需要更全面的消融研究。