论文

Apodex Discovery: 用于评估与构建发现型人工智能的现实基准与环境

Apodex Discovery: 用于评估与构建发现型人工智能的现实基准与环境

阿波罗登月并非仅因其工程师能解难题,而是将远大抱负化为包含明确目标、模拟、验证与反复修正的任务架构。AI 如今面临类似转变:前沿模型虽能在问题、工具与成功标准明确后解决困难任务,但重大现实挑战很少以可执行或可验证的形式出现。 我们提出 Apodex Discovery,一个通过 重型求解器(heavy-duty solver)构建与评估发现型 AI 的框架。该求解器由基础模型、harness、工具与控制策略组成,可开展持续的、有状态的、可验证的探究。其三大核心组件: 1. 问题探测(problem-scouting)流程调查了 16 个行业中的 561 个行业,汇集 423 个高价值现实问题,并为初始发布筛选出 20 个。 2. 环境-任务-片段(environment-task-episode)抽象统一提供数据、工具、约束、反馈、轨迹记录,以及对中间产物与最终提交的验证。 3. HDS6 独立于最终任务成功,从工具、修复、替代方案、连贯性、证据与范围六个维度进行评估。 在 AAV 衣壳设计 中,Apodex 在可行性、趋向性、结构预测与生成设计上超越已发表的最先进水平 7%。在药物重定位与改良中,一个任务专属生物医学环境将 GPT-5.5 与 GPT-5.6-sol 的平均归一化预测分数分别提升 2.5 与 7.6 分(相较于同一闭卷主干)。受控消融实验表明,固定的 TRACES 片段接口可将性能差异归因于特定求解器组件。Apodex Discovery 将 AI 评估从预定义基准推向以真正发现为目标的可验证探究。

论文精读

TL;DR Apodex Discovery 将真实世界高价值问题转化为可验证的长期调查环境,通过 heavy-duty solver 和过程评估(HDS6)推动发现式 AI,已在 AAV 衣壳设计与药物重定位上超越已有方法。

问题

问题背景

当前 AI 领域正从解决可执行、明确定义的基准任务(如数学、代码)转向面向真实世界的发现型任务,例如药物设计、材料发现和科学假设生成。

现有方法局限

现有基准大多由静态、预定义且可自动评分的样本组成,只关注最终答案正确性,无法衡量模型在长期多步调查中的工具使用、假设修正、证据链构建等过程能力。同时,缺乏统一的现实环境与验证机制,不同 agent 或模型的工作结果难以公平比较。此外,仅依赖最终结果监督会导致 specification gaming:模型可能通过投机取巧或表面优化来获得高分,而非真正解决底层问题。

为什么难/重要

现实世界的高价值问题通常以非结构化形式出现,没有现成的执行接口或客观验证器。解决这类问题需要有状态、可验证的长程调查,包括中间产物验证、修复循环和多步推理。业界对自主科学发现的需求迫切,但缺少可复现、可量化的评估框架来指导模型改进。Apodex Discovery 通过引入 heavy-duty solver(整合基础模型、harness、工具和控制策略)与 HDS6 过程评分体系,试图弥补这一空白。在 AAV capsid 设计上超越已发表 SOTA 7%,在药物重定位任务中改善 GPT-5.5/5.6 的预测分数,展示了框架的潜力。

行业类比

这一转变类似于自动驾驶从封闭赛道仿真转向真实城市路测:需要高保真环境、中间状态记录和可追溯的过程评估,才能建立对 AI 在复杂现实任务中可靠性的信任。

核心洞察

  • Apodex Discovery 将 AI 评估从“静态基准上的最终答案准确率”转向“面向真实问题的可验证持续调查”,强调中间产物验证、修复循环与环境约束。与现有 agentic benchmarks(如 GAIA、SWE-bench)不同,后者多关注单步或多步任务完成,Apodex 通过 environment-task-episode 抽象记录完整轨迹,并要求对中间 artifacts 验证,使评估更贴近科研与工程实践中的发现过程。
  • HDS6 独立于最终任务成功的过程评分维度(Tools, Repair, Alternatives, Coherence, Evidence, Scope)提供了对 solver 组件的细粒度归因能力。传统 eval 只看最终得分,无法区分是模型能力、工具设计还是修复策略的贡献。Apodex 的 TRACES episode 接口允许通过消融实验定位性能差异来源,为系统迭代提供可操作反馈,而非黑盒分数。
  • problem-scouting 从 561 个行业收集 423 个真实问题并筛选 20 个,确保基准的“现实相关性”而非人工构造。相比大多数据集由研究者闭门设计,该方法纳入行业实际需求与约束,降低 specification gaming 与数据污染风险,同时为发现型 AI 提供高价值验证场景。

方法

输入:来自真实世界的高价值问题

Apodex Discovery 的输入是来自 16 个行业、561 个产业的高价值真实问题,经 问题侦察(problem-scouting) 筛选后保留 423 个候选,初始发布 20 个。这些问题被封装为统一抽象:环境(environment) 提供数据、工具、约束与反馈;任务(task) 定义目标、验证器与基线;片段(episode) 记录完整轨迹(状态、动作、中间产物、分数)。

关键模块:重型求解器(Heavy-Duty Solver)

核心是 重型求解器(HDS),由 基础模型(foundation model)、harness、工具(tools) 和 控制策略(control policies) 组成,执行有状态、可验证的长期调查。HDS 在环境中迭代:调用工具、生成候选、接收反馈、触发修复,直至产出最终提交。

验证与评估

验证分两层:结果验证(outcome verification) 针对中间产物和最终提交,使用任务分解、代理指标和反作弊设计,并对基线归一化;过程验证(process verification) 采用 HDS6 子评估标准,独立评分 Tools、Repair、Alternatives、Coherence、Evidence、Scope 六个维度,不依赖最终任务成功。修复循环由验证器驱动,支持结构化反馈。

输出与归因

输出包括最终提交、完整片段记录和 HDS6 过程分数。通过固定的 TRACES 片段接口,可控消融可将性能差异归因到具体求解器组件(模型 vs harness vs 工具)。

与同类方法不同:Apodex Discovery 将评估从静态基准转向面向真实发现的可验证调查,强调过程质量与组件级归因,而非仅看最终准确率。

行业影响

落地场景

Apodex Discovery 的 heavy-duty solver 将模糊研发问题转化为可验证的多步调查,适用于药物发现、材料设计、工业仿真优化、金融风控等长周期探索场景。例如药企可复现 AAV 衣壳设计 环境优化基因治疗载体;材料公司可构建合金配方探索环境,让模型在约束下迭代生成与验证。

商业价值

核心收益来自缩短研发周期、降低实验成本。通过状态化验证与修复循环,模型在过程中持续修正错误,减少无效实验。论文中药物重定位任务使 GPT-5.5 提升 2.5 分、GPT-5.6-sol 提升 7.6 分,表明封闭模型结合环境反馈能显著提高预测精度。对企业而言,这意味着更少的湿实验迭代、更快的候选物筛选,以及更可靠的数据驱动决策。

与现有产品/工作流接口

框架提供统一的 environment-task-episode 抽象,企业可将内部数据、仿真器、验证器封装为环境,对接现有 MLOps 或 agent 编排平台。HDS6 过程评分可作为质量门禁,TRACES 轨迹记录便于审计与归因。例如在药物发现管线中,将分子对接、ADMET 预测工具封装为可调用组件;在工业优化中,将 CFD/有限元仿真作为验证器形成闭环。

具体 use case:

  • 生物制药公司:部署 Apodex 环境用于药物重定位,输入疾病靶点与化合物库,solver 生成候选并调用分子模拟工具验证,输出经过多轮修复的候选列表,减少筛选时间。
  • 先进材料企业:构建合金成分优化环境,模型探索成分空间,调用热力学计算软件进行相图验证,自动调整配方,加速新材料研发。

局限

  • 初始基准规模有限,仅包含 20 个精选问题,虽然从 423 个候选问题中筛选,但领域覆盖和任务多样性不足以全面评估发现性 AI 的泛化能力。相比之下,许多通用 agent benchmark 包含数百个任务。此外,每个问题都需要定制领域环境、工具和验证机制,构建成本高,限制了快速扩展到新领域的能力,也可能导致过拟合于当前问题集合。
  • HDS6 过程评估依赖于人工设计的 subrubric 和逐步评分,可能引入主观性和标注者偏差。论文虽然报告了与 outcome 分数的校准,但未提供跨任务、跨评注者的一致性分析。对于复杂科学发现过程,中间步骤的“正确性”往往模糊,尤其当求解器采取非标准路径时,过程评分可能不公平地惩罚创新探索。
  • 论文未完全解决基准污染和测试时信息泄露问题。虽然提到 anti-gaming 作为验证器一部分,但未明确说明问题来源是否保持私密或如何持续更新以防止模型记忆。在大型语言模型时代,从公开文献中提取的真实世界问题很可能出现在预训练语料中,导致结果高估。此外,论文未报告不同模型在该基准上的广泛对比,仅少量 backbone 和 ablations,限制了外部可复现性。
论文Brian Wang2026-08-11原文

相关内容