PACE:用于智能体能力评估的代理基准
评估 LLM 智能体在 SWE-Bench、GAIA 等智能体基准上的性能通常昂贵且耗时,单次评估可能耗费数千美元并持续数天。相比之下,测试单一能力(如推理、代码生成)的非智能体基准运行快速且成本低廉。本文研究能否通过少量精心选择的原子评估实例的性能准确预测昂贵智能体基准的性能。 提出 PACE 框架,通过从现有非智能体评估中选择实例构建代理基准,这些实例的聚合得分最可靠地预测模型在智能体基准上的性能。PACE 从涵盖原子能力的候选实例池中,采用两种互补的选择策略——目标相关局部选择(target-relevance local selection)和全局信息全局选择(globally informative global selection),并拟合回归模型将模型在紧凑源实例子集上的得分映射到目标智能体基准得分。 在 14 个模型、4 个智能体基准和 19 个非智能体基准上实验,PACE-Bench 预测的留一交叉验证(LOOCV)平均绝对误差(MAE)低于 4%,Spearman 相关系数超过 0.80,成对模型排序准确率约 85%,而成本不足完整智能体评估的 1%。进一步分析所选代理实例,揭示每个智能体基准独特需求的能力。 PACE 使从业者能够在模型开发、选择和路由过程中获得可靠的智能体性能估计,而无需完全执行智能体评估的开销。
论文精读
TL;DR PACE 用少量原子能力评估实例构建代理基准的性能预测,通过回归选点子集,在 SWE-Bench 等4个代理基准上以<1%成本实现 MAE<4%、Spearman>0.80 的精准预测,极大降低了代理 LLM 评估门槛。
问题
问题背景
随着大语言模型(LLM)逐步走向交互式、工具使用和自主决策,评估重心正从静态问答转向agentic benchmarks (如 SWE-Bench, GAIA)。这类基准测试能更真实地衡量模型作为智能代理的复杂任务完成能力,已成为业界衡量前沿模型的关键标尺。
现有方法局限
直接运行完整 agentic 评估成本极高: 一次完整的 SWE-Bench 评测可能耗费数千美元、持续数天,且需要复杂的沙箱环境与工具集成。相比之下,大量非 agentic 原子能力基准(如推理、代码生成) 虽快捷廉价,但其分数并不能直接揭示 agentic 综合表现。以往尝试通过简单加权或专家挑选的非 agentic 指标来预测 agentic 得分,常因忽略能力间的非线性关系和任务特定性而预测偏差大, 排序一致性低。
为什么这个问题难/重要
关键在于 agentic 能力是多种原子技能的复杂耦合 (规划、工具调用、记忆、纠错等),不同 agentic 基准对这些技能的依赖权重各不相同。手工挑选或单一回归极易过拟合有限模型样本,导致泛化性差。而一旦能构建一个高保真的代理评估框架,开发者在模型迭代、选型和路由时即可在分钟级、几乎零成本下获得可靠的 agentic 能力预估,显著加速研发周期。这正是工业界和学术界共同关注的痛点。
行业类比
这类似于用一组精心设计的短跑、耐力与力量测试来预测马拉松完赛成绩,而无需每次让运动员跑完全程,极大节约资源的同时保持高预测精度。
核心洞察
- **低成本代理评估范式**:PACE 将昂贵的 agentic 评估转换为少数原子能力实例的回归预测,在 SWE-Bench、GAIA 等基准上仅需不到 1% 的成本即可实现 MAE <4%、Spearman 相关 >0.8 的预测精度。这打破了“评估 agent 必须完整运行复杂交互环境”的壁垒,使得模型迭代早期就能快速筛选候选模型,极大降低实验开销和评估时间,尤其适合大规模模型库中的初步路由与择优。
- **互补的双重实例选择策略**:PACE 同时采用目标相关性局部选择和全局信息全局选择来构建代理基准。局部选择确保所选实例与目标 agentic 基准的实际需求高度相关,避免无关噪声;全局选择则利用 SVD 从海量源实例中提取正交的、不冗余的能力信号,防止回归过拟合。这一组合优于仅基于相关性的过滤或简单均匀采样,其预测模型在留一交叉验证中表现出稳健的泛化性,对新增模型仍能保持高排名准确率(~85%)。
- **原子能力可解释性**:通过分析 PACE 在 19 个非 agentic 基准中挑选出的代理实例,能够逆向解析每个 agentic 基准最依赖的底层技能(如代码生成、指令遵循、规划等)。这不仅为“agent 能力到底测什么”提供了量化依据,也指导后续模型有针对性地增强薄弱环节,或设计更精炼的评估体系。对于希望理解且优化 agent 行为的研究者和工程师,这套代理基准同时是诊断工具和性能预测器。
方法
PACE 方法:用原子能力实例预测 Agentic 基准性能
输入:一个 源实例池,由多个非 agentic 基准(如推理、代码生成、指令遵循等)的所有评估实例构成,每个实例都有一个或多个模型的得分。目标:针对指定的 目标 agentic 基准(如 SWE-Bench、GAIA),输出一个紧凑的代理基准(PACE-Bench)和与之配套的回归模型,以极低成本预测模型在该目标基准上的得分。
关键模块与流程
回归目标定义
- Goal A(性能预测):用源实例得分线性回归预测目标基准的绝对分数。
- Goal B(成对偏好预测):预测两模型在目标基准上的相对优劣,建模为 Bradley-Terry 风格的概率。
- Bootstrap:若目标基准已有少量已评估模型,可利用这些得分作为额外回归目标,增强预测稳定性。
实例选择策略
通过 解耦选择与回归 的方式避免过拟合:先将源实例得分矩阵做 SVD 分解,在正交特征空间中独立进行实例选择与回归系数学习。选择由两种互补策略组合:- 目标关联局部选择:挑选与目标基准得分高度相关的实例,直接捕获任务特有信号。
- 全局信息全局选择:挑选能区分模型整体能力差异的实例,即使与特定目标基准不完全对齐,也可提供稳健的跨模型表征。
最终子集大小为预设预算 $K$,通过加权融合两种策略的分数确定入选实例。
输出:一个固定的小型代理基准(PACE-Bench,通常仅几十个实例)及对应的回归模型,运行时只需评估这组原子实例,即可通过线性映射得到目标 agentic 基准的预测分。
与同类方法的差异
不同于简单相关性筛选或标准 Lasso/Ridge 回归(作者实验显示这些基线严重过拟合),PACE 通过 SVD 解耦 与 双重选择标准 在极小样本下实现高泛化,且既能预测绝对分数又能预测模型间相对排序,而以往代理评估方法多聚焦于单一回归目标或仅依赖单一相关性度量。
实验
实验设计
- 模型与基准:选取 14 个 LLM 在 4 个目标 agentic 基准(含 SWE-Bench、GAIA)上的得分,以及 19 个非 agentic 原子基准(覆盖推理、代码生成、指令遵循等)的实例级成绩。
- PACE 框架:对每个目标基准,通过 目标相关局部选择 与 全局信息选择 两种互补策略从原子基准中挑出少量实例,拟合回归模型以预测 agent 得分。
- 评估方法:采用 leave-one-out cross-validation (LOOCV),每次留出一个模型,用其余模型拟合回归并预测留出模型的目标得分,衡量 MAE、Spearman 相关性 和 成对排名准确率。
关键发现
- 高精度预测:LOOCV 下 MAE <4%**,Spearman 相关性 **>0.80,模型成对排名准确率约 85%,证明少量原子实例能可靠逼近昂贵 agent 评估结果。
- 极低成本:生成的代理基准 PACE-Bench 执行总成本不到完整 agent 评估的 1%(例如 SWE-Bench 单次评估可花费数千美元)。
- 可解释的技能映射:PACE 选择的实例揭示了 agentic 基准的差异化能力需求——SWE-Bench 重度依赖代码生成与调试,GAIA 则更侧重多步推理与工具调用。
与基线对比
- 简单回归基线(Lasso / Ridge)在留出模型上严重过拟合,MAE 远高于 PACE。
- PACE 将 实例选择与回归解耦(基于 SVD 分解),避免过度依赖训练模型分布,使得跨模型预测稳健。
- 这一设计不仅提升预测精度,还提供了 agent 基准能力构成的透视,优于仅追求拟合的传统代理指标。
行业影响
落地场景
PACE 框架为 LLM 代理(agent)评估提供了轻量代理基准,可直接嵌入 模型开发、选型与路由 流程。典型应用包括:
- 模型实验管理平台(如 Weights & Biases、MLflow)在微调或 RLHF 过程中,快速预估代理能力趋势,无需等待完整 SWE-Bench 或 GAIA 运行。
- 模型网关与路由服务(如 LiteLLM、自建路由层)根据实时代理性能评估,将不同复杂度任务分配给最合适的模型,兼顾成本与质量。
- 模型市场与评测榜单(如 Hugging Face Open LLM Leaderboard)扩展至代理维度,以极低成本提供动态代理能力评分。
商业价值
- 降本:完整代理评估单次耗费数千美元、数天时间,PACE-Bench 可将成本降至 1% 以下,LoocV 平均绝对误差(MAE)低于 4%,Spearman 相关高于 0.80,模型排序准确率约 85%。对频繁评估的研发团队,年节省可达百万美元级。
- 加速迭代:分钟级反馈环路替代天级等待,缩短模型选型与调优周期,提升产品上线速度。
- 智能路由降本增效:在生产环境中,将简单查询分配给廉价的弱模型,复杂任务分配给强模型,PACE 提供可靠代理力估计,确保路由策略准确,避免因误判代理性能导致的用户体验下降。
与现有工作流的接口
PACE 作为轻量级 Python 库,输出为 Helm 或 lm-evaluation-harness 兼容的少量实例列表和回归权重。集成方式:
- 将源基准实例(来自 IFEval、HumanEval、GSM8K 等非代理基准)预先注册于评测框架。
- 运行
pace-bench子集获取模型分数。 - 通过内置回归模型计算目标代理基准(如 SWE-Bench Verified)得分。 它可以无缝插入现有 CI/CD 流水线,作为模型质量门禁,也可集成到 Gradio 或 Streamlit 仪表盘中,供非技术干系人实时查阅代理力评估。
具体落地 use case
- 企业级 AI 平台(如云计算厂商的模型服务):客户请求部署新模型时,平台自动运行 PACE-Bench 快速预估模型在 SWE-Bench 上的性能,并以此为依据推荐硬件配置与定价策略,避免盲目分配 GPU 资源。若预估分高于阈值,触发完整代理评估 for 营销素材,否则低成本过滤。
- 电商智能客服代理:假日流量高峰时,需动态选择回复生成、订单查询、退款处理等代理模型。PACE 可实时估算候选模型在 GAIA 类长程任务上的成功率,让路由系统优先调用高成功率的模型,降低人工介入率,同时通过减少完整评估频次节省推理成本。
局限
- **代理基准覆盖有限**:PACE 仅在 SWE-Bench、GAIA 等 4 个代理基准上进行训练与评估,这些基准主要聚焦软件开发与问答任务,尚不能代表更广泛的代理场景(如长期自主规划、多模态交互或现实工具使用)。因此,PACE-Bench 的预测能力能否泛化到新领域或未来代理基准仍属未知,直接迁移可能导致较大误差。
- **线性回归假设过强**:框架采用线性回归将原子能力得分映射到代理得分,但实际代理表现可能与非代理测试结果之间存在高度非线性关系(例如,代码生成与调试协同作用时的涌现效应)。这种简化可能丢失关键交互信息,尤其在模型能力接近或存在跷跷板现象时预测精度会下降。
- **模型多样性不足带来的过拟合风险**:实验仅基于 14 个模型进行留一法交叉验证,尽管报告 MAE 低于 4%,但有限的模型池容易使子集选择和回归权重过度适应现有模型族(如 LLaMA 系列),当出现全新架构或训练范式的模型时,代理得分预测的可靠性可能显著下降。此外,源基准本身若存在偏差,会引入隐蔽的不均衡。