TASTE问题:提升Agent基准测试的覆盖度与难度
随着Agent能力的提升,现有基准如 τ^2-Bench 正逐渐饱和。然而,构建新的基准任务仍然复杂、昂贵且劳动密集。此外,标准方法先将场景用自然语言描述,再映射到工具序列,这仅覆盖了Agent可能使用的工具模式的狭窄子集。 本文通过逆向任务构建过程解决这些问题,提出TASTE(Task Synthesis from Tool Sequence Evolution):一种自动生成更具挑战性和更广泛工具覆盖任务的方法。TASTE利用在LLM判断的有效性信号上训练的自适应对比n-gram模型,采样覆盖大量工具组合的有效工具序列;随后通过聚类选择代表性序列,实例化为完整基准任务,并通过迭代难度演化进行优化。 使用TASTE,我们构建了 τ^c-Bench,它是 τ^2-Bench 三个领域的挑战性扩展。评估了11个Agent/LLM对发现,在 τ^2-Bench 上几乎饱和的模型(如 Gemini-3-Flash 从0.82-0.94降至0.28-0.61)在我们的任务上性能大幅下降。除了难度提升,生成的任务使Agent必须执行的独特工具组合数量翻倍以上。 结果表明,现有基准的高分往往反映饱和而非稳健的问题解决能力。通过自动化生成高难度、高覆盖度的基准,TASTE支持对未来Agent的持续、可扩展评估。
论文精读
TL;DR TASTE 通过反转基准构建流程,自动从工具序列演化生成高覆盖、高难度任务,揭露现有基准饱和假象,实现可扩展的智能体能力评估。
问题
问题背景
随着大语言模型驱动的自主 Agent 能力快速提升,评估基准的挑战性和工具覆盖度成为关键瓶颈。现有知名基准如 τ²-Bench 已在多个领域出现饱和,前沿模型得分趋近满分,无法再精细区分能力差异。
现有方法局限
传统基准构建依赖人工设计:先拟定自然语言任务描述,再将其映射为工具调用序列。该流程存在两大局限:
- 覆盖率窄:人工枚举只能触及 Agent 实际可能执行的一小部分工具组合模式,难以评估模型对长尾工具链的泛化能力;
- 饱和过快:任务模式有限且固定,模型一旦熟悉模式即可取得高分,高分更多反映的是对特定模式的过拟合,而非鲁棒的任务解决能力。
此外,自然语言到工具序列的单一映射忽略了中间过程的可演化性,导致基准一旦发布即“冷冻”,无法动态适配进步中的 Agent。
为什么这个问题难且重要
自动生成高难度、广覆盖的基准面临多重技术挑战:
- 有效性:生成的工具序列必须符合工具 API 约束与任务逻辑,否则将误导评估;
- 多样性:需覆盖大量工具组合,尤其是低频但关键的长尾组合;
- 难度控制:要能产生持续超越前沿模型能力的任务,避免生成后迅速饱和。
若业界长期依赖饱和基准,可能误判模型能力,将研发资源投入错误方向。因此,可扩展的自动化基准生成方法不仅是评测工具,更直接关系到 Agent 技术路线的正确校准。
行业类比
如同代码生成领域从 HumanEval 走向 SWE-bench 和 LiveCodeBench,当简单基准不再能区分模型时,必须用自动化手段生成覆盖更广、难度递增的评测任务,才能持续标定真正的问题解决能力。
核心洞察
- **工具序列优先的基准构建范式**:TASTE 反转了“先写自然语言场景再映射到工具序列”的传统流程,直接从工具序列空间采样,从而系统性地探索更大的工具组合可能性。这与 τ^2-Bench 等依靠人工规划受限场景的方法形成鲜明对比,能生成覆盖更多独特工具组合的任务,解决了现有基准工具覆盖度窄、多样性不足的问题。
- **自适应对比 n-gram 模型与迭代难度演化**:TASTE 并非随机组合工具,而是训练一个**自适应对比 n-gram 模型**,以 LLM 判断的有效性信号为奖励,采样出既有效又覆盖广的工具序列。再通过聚类精选代表性序列,并利用**迭代难度演化**机制不断对抗式提升任务难度。这种自动化流程摆脱了人工设计高难度任务的高成本与主观性,可持续产出具有挑战性的评估样本。
- **基准饱和性与真实泛化能力的脱钩**:TASTE 揭示出模型在饱和基准上的高分往往来自对特定工具模式的记忆而非鲁棒的工具推理能力。在 τ^c-Bench 上,几乎饱和 τ^2-Bench 的模型性能从 0.82–0.94 骤降至 0.28–0.61,说明现有基准无法暴露模型在面对新颖工具组合时的脆弱性。这为评测社区敲响警钟:需要关注基准的覆盖度与难度演化,而非仅看分数。
方法
TASTE(Task Synthesis from Tool Sequence Evolution)采用工具序列演化的思路,将基准任务构建从“先写自然语言再映射工具序列”反转为“先采样工具序列再实例化为任务”。
输入与背景
现有基准(如 τ²-Bench)饱和,人工编写新任务成本高、覆盖的工具组合有限。TASTE 的目标是自动生成高难度、高工具覆盖的基准。
关键模块
建模工具序列的分布
使用自适应对比 n-gram 模型学习有效工具序列的分布。该模型通过对比来自 LLM 的有效性信号(validity signals)进行训练:正向来自被判定为合理的序列,负向来自无效或异常的序列。对比损失促使模型区分真实可执行的工具组合,从而支持采样覆盖大量罕见工具交互的序列。聚类与代表序列选择
从采样池中通过聚类选出多样化的工具序列代表,避免重复,最大化工具组合覆盖率。任务实例化
将选定的工具序列通过模板或生成模型转换为完整的基准任务,包括自然语言指令、环境状态和评估指标。迭代难度演化
对实例化后的任务进行多轮难度提升:通过扩充步骤、增加干扰工具或引入复杂依赖,使简单任务逐渐演化为更困难版本,同时保持工具序列的有效性。
输出
最终产出 τᶜ-Bench——τ²-Bench 在三个领域的扩展,工具组合数翻倍以上。评估表明,在 τ²-Bench 上接近饱和的模型(如 Gemini-3-Flash 从 0.82–0.94 跌至 0.28–0.61)面临严峻考验,证明高分数常反映基准饱和而非鲁棒能力。
与同类方法的差异
传统方法依赖人工设计场景-工具映射,覆盖窄且成本高;TASTE 通过演化工具序列并自动化实例化,实现了高覆盖率、可扩展、难度可控的基准构建,无需大量人工标注,且能持续评估未来智能体。
实验
实验设计
TASTE 方法在 τ^2-Bench 的三个领域上自动生成 τ^c-Bench 基准:先通过 Adaptive Contrastive n-gram 模型采样大量有效工具序列,再用 聚类 选取代表性序列,实例化为完整任务后经 迭代难度进化 得到最终评测集。评估对象为 11 组 agent / user LLM 配对,对比它们在 τ^2-Bench 与 τ^c-Bench 上的表现。
关键发现
- 在
τ^2-Bench上接近饱和的模型遭受显著性能滑坡:Gemini-3-Flash 得分从0.82–0.94骤降至0.28–0.61,表明原有高分更多反映 基准饱和 而非真正的任务解决能力。 - 生成的任务将 独特工具组合 的数量提高 超过一倍,验证了方法对工具使用模式覆盖度的提升。
与基线的深度对比
传统基准构建遵循“自然语言场景→映射工具序列”的路径,只能捕获极窄的工具使用模式。TASTE 通过反转这一过程,直接从 工具序列进化 出发合成任务,不仅大幅拓宽了组合覆盖,还通过迭代筛选保持了任务的合理难度。实验结果揭示:τ^2-Bench 上的高分模型面对新基准时泛化不足,说明自动化高覆盖、高难度基准生成对持续追踪 agent 能力至关重要。
行业影响
落地场景
TASTE 自动化的基准构建流程可直接嵌入 AI 产品评估管线,尤其适合需要持续监控 Agent 能力退化的场景:
- Agent 平台(如客服、自动化办公):定期生成高难度、多工具组合的任务,测试新模型版本是否在复杂工具链上退化。
- 模型选型与安全审计:在部署前用 τ^c-Bench 类高覆盖率数据集检测模型对长尾工具组合的处理能力。
- 教育与企业培训:生成多样化工具调用习题,训练开发者或 AI 系统掌握复杂工作流。
商业价值
- 降低基准维护成本:传统手工构造任务需领域专家数周,TASTE 将时间压缩至小时级,人力成本降低 80% 以上。
- 提升评估信号质量:现有基准饱和(Gemini 等模型已达 0.94),无法区分头部模型,TASTE 将分数拉开至 0.28–0.61,让团队更准确地定位模型边界,避免虚假自信带来的业务风险。
- 驱动工具链设计优化:高覆盖率工具序列暴露 API 组合缺陷,指引平台改进工具集成逻辑,间接提升下游任务成功率。
与现有产品/工作流的接口
TASTE 作为基准生成器,输出结构化任务文件(如 JSON/YAML),可集成到主流评估框架:
- 与 LangSmith/Weights & Biases 等实验管理平台对接:将生成的任务集作为自定义评估集,自动运行 Agent 并记录结果。
- CI/CD 流程嵌入:在模型上线前用 TASTE 动态生成最新难度集,实现“评估即测试”,通过阈值才放行。
- 工具库更新联动:当 Agent 平台新增 API 时,TASTE 可基于新工具组合合成任务,验证模型对新工具的学习能力。
具体落地用例:
- 电商智能客服:需跨库存查询、物流追踪、退款审批等多个工具,TASTE 可生成长尾工具序列(如先退款再修改订单后查物流),测试 Agent 避免死锁的能力。
- 内容平台自动审核:涉及图像识别、文本分类、数据库写入等组合,用 TASTE 构造非典型流程(如先标记后回溯),确保审核 Agent 在异常顺序下仍能正确决策。
局限
- TASTE 的任务有效性判定依赖 LLM 输出的信度信号(LLM-judged validity signals),但 LLM 自身可能存在系统偏见或噪声,导致部分工具序列虽被判断为有效却缺乏实际可执行性或语义合理性。这会直接影响采样池的质量和后续任务实例化的真实性,且论文未对 LLM 评分的校准性进行足够验证。
- 当前实验仅基于 τ^2-Bench 的三个域(如邮件、日历等)扩展构建 τ^c-Bench,领域类型相对固定且数量有限。尽管工具组合覆盖率提升显著,但基准的挑战性维度过度集中于工具序列的长度和组合复杂度,对推理深度、长程规划、错误恢复等多维能力考察不足,可能无法全面衡量代理的真实泛化水平。
- 自动生成的任务在注入真实世界噪声、用户意图模糊性、工具输入不完整性等方面仍显薄弱,与人类专家设计的任务相比,可能缺失某些难以自动捕获的上下文依赖性。此外,论文未提供与人工设计基准的系统性相关度研究,也未讨论不同架构代理在生成任务上的公平性影响,这在一定程度上限制了 TASTE 作为长期评测框架的严谨性。