AgentJudgeBench: 评测 LLM 裁判在智能体工具调用上的多难度基准
LLM 裁判 被广泛用于评估智能体工具调用系统,但其在结构化、依赖驱动的工作流上的可靠性尚未得到充分研究。我们提出 AgentJudgeBench,这是首个系统性地研究 LLM-as-a-judge 在基于 工作流 DAG 的智能体工具调用上可靠性的基准,区别于一般的长文本或偏好评估任务。 该基准包含 3,808 个实例,覆盖 6 种 DAG 拓扑 与 3 档难度,并使用 5 种生成器(3B-70B 开放权重模型及 GPT-5.4)和 6 种裁判(从 20B 到前沿规模)在 有/无 ground truth 配对条件下进行评估。裁判对齐度随任务难度单调下降;无 ground truth 时下降速度是有的 1.5 倍。在无 ground truth 的困难查询上,所有裁判都收敛到 77-82% 的狭窄区间,与规模无关,揭示了主要由任务难度决定的结构性天花板(尽管天花板高度对较弱生成器部分依赖提示)。 Ground truth 并非一律有益:它使 GPT-5.4 对齐度降低 1.5pp,使 Gemini-2.5-Pro 降低 3.9pp,符合过度锚定现象。在缓解策略中,思维链推理 与 裁判温度 影响可忽略;而 结构化评估准则 最高可提升 6.5pp,但未在所有裁判-生成器对上一致泛化。 在有 ground truth 时,QwQ-32B 最匹配程序化参考,而人工验证研究发现 GPT-OSS-120B 最为人类对齐;无 ground truth 时,前沿裁判仅在该共享天花板内取得微弱领先。这些结果揭示了现役 LLM 裁判 的固有局限,并为智能体系统的可靠评估提供了实用指导。
论文精读
TL;DR AgentJudgeBench 首次系统评估 LLM 法官在依赖驱动工具调用 DAG 上的可靠性:对齐随难度单调下降,无 ground truth 时六位法官在难题上收敛至 77-82% 结构性上限,模型规模无法突破。
问题
问题背景
Agentic tool-calling 系统通常使用 LLM 法官来自动评估工作流质量,但针对结构化、依赖驱动的工具调用流程,法官的可靠性尚未得到系统检验。
现有方法局限
当前 LLM-as-a-judge 方法主要面向开放式文本生成或偏好评估;当用于依赖驱动的 workflow DAG 时,其对齐性(与程序化参考的一致性)随任务难度单调下降。AgentJudgeBench 的实证显示:
- 无 ground truth 条件下对齐性下降速度快 1.5 倍;
- 在困难查询上,六个法官(20B 至前沿规模)均收敛到 77–82% 的窄带,形成模型容量无法突破的结构性天花板;
- 提供 ground truth 并不总是有益:GPT-5.4 和 Gemini-2.5-Pro 出现 over-anchoring,对齐性分别降低 1.5 pp 和 3.9 pp;
- CoT 推理和调整温度几乎无效,结构化评估 rubric 可提升最多 6.5 pp,但无法在 judge-generator 对之间稳定泛化。
为什么这个问题难且重要
Agentic tool-calling 涉及工具依赖、参数传递和分支决策,错误会沿 DAG 传播。法官必须理解执行语义而非表层文本,而现有基准多聚焦单步工具调用或简单序列,无法暴露依赖链上的系统性误判。业界正广泛采用 LLM 法官做规模化评估,其可靠性缺失会直接导致错误的质量信号,影响模型迭代与上线决策。
行业类比
类似用 LLM 评判代码生成质量:面对复杂函数调用链中的依赖错误,法官容易给出过于乐观或悲观的判断,削弱自动化评估的可信度。
核心洞察
- AgentJudgeBench 首次在 workflow DAG 上揭示 LLM judge 的结构性天花板:在 hard queries 且无 ground truth 条件下,所有六个 judges 收敛到 77-82% 对齐窄带,与模型规模无关。以往 LLM-as-a-judge 研究多聚焦开放文本或偏好评估,未覆盖依赖驱动的结构化工具调用;本基准通过六种 DAG 拓扑和三级难度设计,证明任务难度是主导因素,模型容量无法突破,为可靠评估 agentic 系统提供了新基准。
- Ground-truth 暴露并非普遍有益,反而会导致前沿 judge 过度锚定:GPT-5.4 和 Gemini-2.5-Pro 在有 GT 时对齐度分别下降 1.5pp 和 3.9pp。这挑战了有 GT 必然改进判断的直觉,突显 judge 对参考答案的过度依赖;本工作首次量化了这一反向效应,并提示在实践中需按 judge-generator 配对决定是否提供 GT,避免盲目信任标注数据。
- 缓解策略中,结构化 evaluation rubric 是唯一有效但非普适的方法,最高提升 6.5pp,而 chain-of-thought 推理和调整 temperature 几乎无影响。这对实际工程有价值:不应寄望于简单技术如 CoT 或采样温度来提升 judge 可靠性,而应投入设计针对性 rubric,但仍需为具体 judge-generator 组合做验证,因为提升在不同配对上不一致。
方法
输入:生成器轨迹与基准实例
AgentJudgeBench 包含 3,808 个实例,覆盖 6 种 DAG 拓扑 与 3 个难度层级。每个实例定义了一个依赖驱动的工具调用工作流,生成器(3B–70B 开源模型与 GPT-5.4 共 5 个)根据任务描述产生工具调用序列。
关键模块:评判器评估与对齐度量
- 评判器:6 个模型(20B 到前沿规模)在 有 ground truth 和 无 ground truth 两种条件下打分。有 ground truth 时提供程序化参考轨迹,无 ground truth 时仅根据任务描述和生成轨迹判断。
- 对齐度量:将评判器给出的质量分数或判定与程序化参考(ground truth + 规则)比较,计算 alignment(如准确率、一致率)。
- 缓解策略实验:测试 chain-of-thought 推理、评判器温度调整、结构化评估 rubrics 对 alignment 的影响。
输出:可靠性结论与工程启示
实验发现:
- 难度单调退化:对齐随任务难度单调下降,无 ground truth 时退化速度快 1.5 倍;
- 结构天花板:无 ground truth 的困难查询上,所有评判器收窄至 77–82% 区间,模型规模无法突破;
- ground truth 双刃剑:对 GPT-5.4 和 Gemini-2.5-Pro 反而降低对齐(over-anchoring);
- 缓解策略:CoT 与温度影响可忽略,结构化 rubric 最多提升 6.5 pp,但跨对不一致。
工程启示:当前 LLM 评判器在结构化、依赖驱动工作流上存在根本局限,评估不应盲目依赖单一评判器;应结合程序化参考、多评判器交叉验证,并针对具体生成器-评判器对做校准。
与同类方法的差异:首次将 LLM-as-a-judge 从开放文本/偏好评估拓展到 agentic tool-calling 工作流 DAG,系统揭示结构性可靠性上限,而非单一模型能力比拼。
实验
实验设计
AgentJudgeBench 是首个面向 workflow DAG 的 agentic tool-calling 可靠评估基准,包含 3,808 个实例,覆盖 6 种 DAG 拓扑与 3 个难度层级(easy/medium/hard)。实验配对 5 个生成器(3B–70B 开源模型、GPT-5.4)和 6 个评判器(20B 到前沿规模),在有 ground truth (GT) 与无 GT 两种条件下,比较 judge 判定与程序化参考(programmatic reference)的对齐度,并通过人工验证子集校准。
关键发现
- 评判器对齐度随任务难度单调下降,无 GT 时恶化速度快 1.5 倍;在 hard 查询无 GT 下,6 个评判器收敛至 77–82% 窄带,与模型规模无关,暴露结构性天花板。
- GT 暴露并非总是有益:GPT-5.4 降低 1.5 pp,Gemini-2.5-Pro 降低 3.9 pp,符合 over-anchoring 现象。
- 缓解策略中,chain-of-thought reasoning 和 judge 温度几乎没有影响;结构化评估 rubric 最高提升 6.5 pp,但跨 judge-generator 对泛化不一致。
- 有 GT 时 QwQ-32B 最匹配程序参考,人工验证则显示 GPT-OSS-120B 最符合人类对齐;无 GT 时前沿评判器仅在共享天花板内微弱领先。
对比解读与工程启示
与开放文本/偏好类 LLM-as-judge 基准不同,本工作首次在依赖驱动的结构化工作流上系统评估 judge 可靠性。结果表明:程序参考并不等同人类对齐;模型容量无法突破任务难度造成的天花板;结构化 rubric 有帮助但需按具体 judge-generator 对调优;提示工程与采样温度作用有限。实际评估 agentic 系统时,应避免在 hard 工作流上单独依赖 LLM judge(尤其无 GT 场景),建议混合程序化参考、人工校验与专门设计的 rubric。
行业影响
落地场景
AgentJudgeBench 针对依赖驱动的 agentic tool-calling 评估,适用于任何用 LLM-as-a-judge 做质量把关的 agent 产品,例如:电商订单处理 agent、企业 IT helpdesk、内容审核流水线、金融合规助手等。这类系统通常由多个工具调用组成 DAG,自动评估能避免逐条人工审核。
商业价值
- 降本:用高质量 judge 替代人工评估,节省 QA 人力;明确难度分层和 ground-truth 条件,避免盲目信任大模型 judge。
- 风控:发现 judge 在 hard 无 GT 场景下 77-82% 的“结构天花板”,提醒团队在关键流程中保留人工复核,降低错误放行风险。
- 产品化:结构化 rubric 能提升 judge 对齐度最高 6.5pp,可包装为评估配置模板直接复用。
与现有工作流集成
- 将 benchmark 纳入现有 eval 栈(如 LangSmith / Langfuse / Prometheus-Eval),作为 judge 模型选型与调优的回归测试集。
- 针对不同 generator-judge 对,使用论文中的难度分层和 GT 条件切换策略,动态调整评估方式。
- 在 CI/CD 中增加 judge alignment 检查,尤其关注 over-anchoring(如 GPT-5.4 和 Gemini-2.5-Pro 有 GT 反而下降),可设置阈值触发人工介入。
局限
- **基准覆盖有限**:只包含六种 DAG 拓扑和三个难度层级,虽然比现有工作更系统,但真实 agentic 工作流常涉及更复杂的动态依赖、长链路和多工具交互,本基准的实例生成基于固定模板,可能无法完全捕获生产环境中的多样性和噪声。此外,仅评估五个生成器和六个 judge,虽然涵盖不同规模,但缺少特定领域微调模型及更多商业 API 的对比,结论的外推性受限。
- **过度锚定现象未深入解决**:论文报告了 ground-truth 暴露对 GPT-5.4 和 Gemini-2.5-Pro 造成 alignment 下降(分别 1.5 pp、3.9 pp),归因于过度锚定,但未系统分析其成因或提供有效的缓解措施。同时,程序化参考(programmatic reference)本身可能并非完美 gold standard,虽然有人类验证,但覆盖规模有限,可能影响 judge alignment 度量的可靠性。
- **与真实部署场景有差距**:当前 benchmark 的 judge 评估主要基于最终答案或中间轨迹的静态对比,而实际 agentic 系统中 judge 往往需要同时考虑执行效率、资源消耗、错误恢复等多个维度,本工作对这些方面的建模不足。另外,无 ground-truth 条件下所有 judge 收敛到 77-82% 的窄带天花板,这一现象可能部分源于基准本身的难度分布或标注噪声,而非完全反映 judge 能力的真实上限,需要进一步控制实验验证。