论文

EDGEGEN: 借助合成边缘用例生成,让工具调用 Agent 超越 Happy Path

EDGEGEN: 借助合成边缘用例生成,让工具调用 Agent 超越 Happy Path

工具调用型 LLM Agent 正越来越多地部署于企业应用。然而,有效的评估与优化需要高质量、多样化的任务数据集,而这类数据常因隐私等限制难以获取。现有合成任务生成方法往往产出泛化任务,忽视 Agent 底层的状态或数据库,也无法体现真实使用场景的多样性。 我们提出 EdgeGen,一个合成任务生成框架:它从 Agent 的规格说明中抽取合规规则,并据此生成以数据库为依据、旨在违反这些规则的边缘用例任务。与现有合成数据生成技术结合后,EdgeGen 可通过 finetuning 与 harness 优化 来提升 Agent 表现。整个流程构成一个无需人工标注的全自动闭环系统。 在 tau2bench airline 域上,使用 EdgeGen 生成的数据进行 finetuning 可带来 2% 到 42% 的平均进展提升,而其他基线方法对部分模型甚至出现性能退化。在 harness 优化方面,对 Gemma-4-e4b 模型,我们的方法相较人工整理与基础 harness 分别取得 10% 与 30% 的平均进展提升。

论文精读

TL;DR EdgeGen 从 agent 规范中提取合规规则,自动生成数据库锚定的边缘案例任务,通过微调和 harness 优化提升工具调用 agent 在非 happy path 场景下的表现,全程无需人工标注。

问题

问题背景

工具调用型 LLM agent 正被广泛用于企业级应用(如客服、电商、金融),但可靠评估与持续优化依赖高质量、多样的任务数据集,而真实任务数据常因隐私与合规约束难以获取。

现有方法局限

当前多数合成任务生成方法存在两个核心缺陷:一是生成任务过于通用,脱离 agent 实际依赖的工具 schema、数据库状态与业务上下文,导致样本多为 happy path,无法覆盖真实部署中常见的边缘场景;二是方法往往需要人工编写规则或标注,难以规模化。例如,一些方法仅基于 API 描述生成简单调用序列,没有注入违反业务规则(如退款金额超出订单总额、越权访问)的负样本,导致 agent 在异常条件下表现未被有效测试。此外,部分合成数据存在幻觉,生成的参数或路径与实际工具定义不一致,进一步降低训练价值。

为什么这个问题难/重要

技术挑战在于:合成任务必须同时满足 database-grounded(与底层数据库状态一致)、rule-violating(故意违反合规规则)和 path-aware(覆盖工具调用图上的多种路径)三重约束,这需要从 agent 规格说明中自动提取规则,并保证生成样本的可执行性与可验证性。业界关注度持续上升,因为 tool-calling agent 一旦在支付、权限管理等高风险场景误操作,后果严重;缺乏边缘案例的评估集会使模型在长尾场景下退化或产生有害行为,而人工构建这类数据成本极高。

行业类比

类似自动驾驶测试中需要生成对抗性极端场景(如恶劣天气、罕见路障)来发现模型盲区,工具调用 agent 同样需要合成“故意违反合规规则”的任务来暴露可靠性与安全边界。

核心洞察

  • EdgeGen 将 agent 规范中的合规规则显式转化为测试生成目标,从而合成数据库接地的 edge case 任务。与现有合成任务生成方法不同,后者往往忽略 agent 的底层状态或数据库、生成通用 happy path 任务,EdgeGen 直接抽取规范中隐含的约束,构造针对这些规则的违规场景,使生成任务天然对准 agent 的真实弱点。这避免了随机采样导致的低效或无关数据,提升微调和 harness 优化的数据效率,尤其适合企业数据隐私受限的场景。
  • EdgeGen 建立了从规则抽取到任务生成、验证、模型优化的全自动闭环,无需人工标注即可改进工具调用 agent。同类工作如 TaskBench、FuncBenchGen 生成的任务可能包含幻觉样本或缺乏数据库接地,而 EdgeGen 通过数据库采样和验证步骤保证任务可执行,且直接关联合规规则。在 tau2bench 航空域微调中,EdgeGen 带来 2%-42% 的一致提升,而其他 baseline 对部分模型出现退化;对 harness 优化,该方法相对 human-curated 和 base harness 分别提升 10% 和 30%,说明闭环生成的 edge case 数据能稳定提升模型鲁棒性。

方法

EdgeGen 的输入包括 agent specification(工具 schema、业务规则、合规约束)以及底层数据库的 schema 与数据。系统首先用 LLM 从 specification 中提取合规规则(compliance rules),这些规则定义了 agent 在执行过程中不应违反的约束,例如航空领域的退改签政策、身份验证要求、库存限制等。

核心流水线分为五个关键模块:

  1. 工具图构建与路径采样:根据工具间的依赖关系构建工具图,采样各种可能的执行路径,重点覆盖偏离 happy path 的分支。
  2. 违规场景生成:针对提取出的每一条合规规则,LLM 生成一个意图违反该规则的场景描述(例如“用户试图在起飞后退票”“使用过期凭证访问接口”),确保场景明确指向规则边界。
  3. 场景感知数据库采样:根据违规场景,从真实数据库中抽取或生成匹配的数据库状态(如订单、用户、航班记录),使任务接地于实际数据分布,避免通用架空数据。
  4. 测试用例生成:将违规场景与数据库上下文合成为完整的用户查询(task query)以及对应工具调用序列,形成可执行的测试用例。
  5. 验证:通过执行或语义检查确保生成的任务具备可行性、确实触碰目标规则、且存在可判定的预期结果,过滤幻觉样本。

此外,EdgeGen 引入复杂度感知生成(complexity-aware generation),根据任务所需的工具调用步数和分支数调节难度分布,避免生成过于简单或过于复杂无人能解的任务。输出是一组合成 edge-case 任务(query + 数据库状态 + 预期行为),可与现有 happy path 合成数据混合,用于微调 agent 模型或优化 agent harness(如系统提示、工具 docstring)。整个过程无需人工标注,形成评估-生成-优化-再评估的自动闭环。

差异点:EdgeGen 不同于一般的 happy-path 合成方法,它显式利用 agent 的合规规则和数据库状态,系统性地生成违反规则的边界场景,从而在保持基础能力的同时提升 agent 在真实企业环境中的鲁棒性,避免只在正常路径上过拟合。

实验

实验设计

EdgeGen 从 agent 规范中提取合规规则,生成数据库锚定的边缘案例任务,用于微调和 harness 优化。实验覆盖 τ²-bench Airline、τ²-bench Retail 和 ToolSandbox 三个工具调用基准,对比现有合成数据生成基线(如 TaskBench、FuncBenchGen)以及人工 curated harness。

关键发现

  • 在 τ²-bench Airline 上,使用 EdgeGen 数据微调带来平均进度提升 2% ~ 42%,且在不同模型上表现一致;而基线方法在某些模型上出现性能退化。
  • harness 优化中,EdgeGen 相比人工 curated harness 提升 +10%,相比 base harness 提升 +30%(Gemma-4-e4b 模型)。
  • 复杂度消融和数据扩展实验验证了边缘案例覆盖的重要性。

与基线对比解读

现有合成方法生成通用任务,忽略底层数据库状态与合规约束,导致任务无法触发真实失败模式,甚至引入噪声。EdgeGen 通过“违反规则”的生成逻辑,确保任务与数据库实体、工具路径强相关,从而提升数据多样性和训练价值。闭环设计无需人工标注,适合企业场景。

行业影响

落地场景

EdgeGen 瞄准部署了 tool-calling LLM agents 的企业应用,尤其是必须严格遵守业务规则与合规要求的场景。典型产品包括:

  • 电商客服 agent:处理退货、优惠券叠加、库存扣减等边界条件,防止错误操作导致资损。
  • 金融交易与合规 agent:执行交易限额、反洗钱检查、数据访问权限控制,减少违规风险。
  • 企业服务 agent:如内部审批流程、权限管理、SLA 监控,需要应对各种非常规操作。

商业价值

核心价值在于降本增效与风险控制。

  • 自动化生成边缘案例,显著降低人工构造测试集与标注成本。
  • 论文实验显示,通过 EdgeGen 数据微调,在 tau2bench 航空领域可带来 2% 至 42% 的进度提升;harness 优化在 Gemma-4-e4b 上较人工 harness 和基础 harness 分别提升 10% 和 30%。
  • 减少 agent 在真实生产环境中因边缘案例失败而导致的业务中断、合规处罚和客户流失。

与现有工作流的接口

EdgeGen 可作为数据生成模块无缝插入现有 agent 开发栈:

  1. 输入:agent 规范(API 定义、合规规则)与数据库 schema。
  2. 输出:数据库接地、违反规则的任务数据集,可直接用于 SFT 微调 或 harness 配置优化。
  3. 与现有 happy-path 合成数据方法结合,扩展数据分布,形成全自动化闭环,无需人工标注。

具体落地 use case

  • 电商场景:某全球电商平台的智能客服 agent 需处理“优惠券不能叠加”规则。EdgeGen 可自动生成同时使用两张互斥优惠券的订单任务,用于微调 agent 正确拒绝操作,避免营销资损。
  • 金融场景:跨国银行的内部交易查询 agent 必须遵守数据访问权限。EdgeGen 可生成越权查询任务,训练 agent 识别并拒绝,满足审计与合规要求。

局限

  • - **合规规则覆盖范围有限**:EdgeGen 从 agent 规范中提取 compliance rules,仅针对可形式化、可验证的规则(如权限、数据范围、流程约束)生成边缘案例。对于模糊的、隐性的业务约束,或跨工具组合产生的复杂交互逻辑,规则提取可能无法充分捕获。若原始规范本身不完整、滞后或未明确列出所有违规情形,生成任务会偏向已知违规类型,难以模拟真实世界中多样化的失败模式,从而限制数据集的全面性。
  • - **生成质量高度依赖 LLM 与验证器**:pipeline 中规则提取、违规场景构建、SQL agent 和验证步骤均依赖 LLM,存在幻觉风险。虽然论文设计了验证阶段过滤无效任务,但验证器本身也是基于 LLM 或启发式,可能漏判错误任务或错误拒绝有效边缘案例。全自动闭环若缺乏人工抽检,错误生成的数据可能通过微调被模型学习,反而放大模型在特定错误模式上的偏差,导致评估与优化结果失真。
  • - **实验域有限,泛化性待验证**:实验主要在 `tau2bench` 的 airline/retail 域以及 `ToolSandbox` 上进行,这些场景具有结构化工具调用和 SQL 数据库特征。对于更通用的 tool-calling agent(如 API 多样性高、非结构化数据、长流程多步推理),EdgeGen 的规则提取和数据库锚定方法是否同样有效尚不明确。此外,与同类工作的对比基线数量有限,未能覆盖所有最新合成任务生成方法,因此其相对优势的稳健性仍需更多基准验证。
论文Harshavardhan Abichandani2026-09-21原文

相关内容