论文

从证据到行动:工具使用型 Agent 如何失败

从证据到行动:工具使用型 Agent 如何失败

工具使用型 agent 会对外部状态做出有后果的更改,但正确的最终结果并不能保证其动作有事先确立的证据支撑。本文研究当 agent 从「是否应当行动」的决策推进到执行单个动作与依赖型工作流时,这条证据到行动链条在何处断裂。 为开展该分析,我们提出 SafeActBench,涵盖六个操作域、656 个案例与五种协议,从静态动作判断、调查后不行动,逐步推进到单动作与多动作工作流。我们还引入 provenance-bound 的 Evidence Ledger 与确定性轨迹评估器,用于追踪哪些信息已被确立、动作在何时发生,以及下游依赖是否得到满足。 在十种 model-harness 配置中,较强的静态动作评估可以与明显更弱的交互式执行并存。失败往往在执行之前就已开始:agent 在调查不完整时停止,或在所需证据确立之前便采取行动。一旦获得所需证据,单动作执行通常可靠,而多动作工作流则额外暴露出未解决的前置条件与不完整的执行。 这些结果表明,失败不仅源于信息缺失,也源于 agent 在决策与执行动作时如何使用已经确立的证据。

论文精读

TL;DR 论文研究工具使用 Agent 在证据到行动链条上的失败模式,提出 SafeActBench 基准,揭示静态评估强但交互执行弱,失败常源于执行前调查不足或行动过早。

问题

问题背景

Tool-using agents 在真实环境中执行动作并改变外部状态,业界关注其决策可靠性。现有评估常以结果正确或静态动作判断为准,忽略证据到动作的因果链。

现有方法局限

主流 agent benchmark 或评估范式聚焦于静态动作判断:给定上下文,模型选择正确 action 即可得分。这未检验 agent 是否在做出动作前建立了充分证据,是否过早行动,或是否在多步工作流中满足前置依赖。例如,即使最终结果正确,agent 可能跳过了必要的信息检索,或依赖了未证实的假设。此类评估无法暴露交互式执行中的隐蔽失败,导致高分模型在实际部署时出现不可靠行为。

为什么难/重要

构建可靠的 evidence-to-action 链条需要追踪证据来源与时间、判定动作前提是否满足、检查多步依赖的传递闭包,复杂度远高于静态分类。此外,真实环境中错误动作代价高,且证据缺失或操作顺序错误可能不立即显现,直到下游任务失败才暴露。因此,该问题对高风险场景(如金融交易、医疗辅助、工业控制)至关重要,业界需要能提前诊断失败模式的评估工具。

行业类比

类似自动驾驶中仅依据最终停车位置判断安全,却未验证传感器数据是否充分、决策是否合乎交通规则;或推荐系统只看转化率,而不检查推荐理由是否基于用户真实偏好证据。

核心洞察

  • 证据到行动的断裂主要发生在行动前阶段:智能体常在不完整调查时停止,或在必要证据建立前就执行动作。与现有基准侧重最终任务成功不同,SafeActBench 通过五种协议拆解静态判断与交互执行,发现强静态评估可与弱得多的交互执行共存。单步行动在证据齐全后通常可靠,但多步工作流会暴露未解决的前置条件和部分执行,表明评估必须区分“信息缺失”与“信息已获得但未被正确使用”。
  • Evidence Ledger 与确定性轨迹评估器将证据支持行动转化为可审计的依赖检查,取代了 LLM-as-judge 的主观评分。现有 agent 基准通常只检查最终状态或依赖 LLM 评判,无法回溯行动是否有证据基础。本文记录信息建立时间、行动发生时机及下游依赖满足情况,实现确定性验证,从而能区分“未检索到证据”和“检索到但未在决策中采用”两类失败,为工具使用 agent 的可靠评估提供了新范式。

方法

方法核心:SafeActBench 基准与证据-行动链评估

SafeActBench 是一个面向工具使用 agent 的评估基准,包含 656 个任务实例,覆盖六个操作域(如 IT 运维、业务规则执行等),设计五种协议从静态判断到多动作工作流逐步加严。

输入:每个任务实例提供初始环境状态、可查询的工具接口与明确目标。agent 需要在环境中执行调查与动作,其完整交互轨迹被记录。

关键模块:

  • Evidence Ledger(证据账本):实时记录 agent 在每一步获取的信息、来源与时间戳,建立可追溯的证据链。账本只纳入真正被 agent 查询或观察到的信息,而非环境中的隐含事实。
  • 五种交互协议:
    1. 静态动作判断:直接给定证据集,让 agent 选择是否行动。
    2. 调查后非动作:agent 先调查,再决定是否不行动。
    3. 单动作执行:调查后执行一个关键动作。
    4. 多动作工作流:执行有依赖关系的多个动作。
    5. 证据保留的多动作工作流:要求 agent 显式证明每个动作的前置证据已建立。
  • Deterministic Trajectory Evaluator(确定性轨迹评估器):基于 Evidence Ledger 检查每个动作是否在所需证据建立之后发生、前置条件是否满足、工作流是否完整执行。评估逻辑是确定性的,不依赖模型判断,确保可复现。

输出:多维失败诊断指标,如 BSR(调查未完成即停止)、PAR(未获证据就行动)、Gap(动作检查点缺失证据)、Part.(工作流部分执行)等,定位证据-行动链的断裂位置。

与同类 benchmark 仅关注最终状态正确性不同,SafeActBench 显式追踪证据的 provenance 与动作的时序依赖,能够区分“结果正确但推理过程缺乏证据支持”的虚假成功。

实验

实验设计

SafeActBench 包含 656 个案例,覆盖 6 个操作域 和 5 个协议,评估 10 种模型-环境配置。协议从静态动作判断、已调查的非行动,到单动作和多动作工作流逐步递进。系统通过 Evidence Ledger 记录信息获取时间、动作发生点和依赖满足情况,并使用确定性轨迹评估器进行验证。

关键发现

  • 静态评估与交互执行脱节:静态动作判断表现好,不代表交互执行可靠。
  • 失败常在执行前发生:智能体过早停止调查或未建立必要证据就行动。
  • 证据获取后单动作可靠:一旦所需证据被确认,单动作执行通常可靠;但多动作工作流进一步暴露未解决前提和部分执行。
  • 环境封装影响显著:不同 agent harness 选择会明显改变行为模式,且影响因模型而异。

与基线对比解读

传统 agent 基准多关注最终任务成功率,而 SafeActBench 聚焦证据到行动的完整链路。即使最终结果正确,也可能缺乏过程证据支撑,这揭示了仅看结果的评估盲区。该基准通过分离静态判断与交互执行,定量刻画了“知道该做什么”与“实际做对”之间的差距。对实际工程而言,这表明部署 tool-using agents 时,需要同时监控信息获取完整性和动作前提满足度,而非仅校验输出正确性。

行业影响

落地场景

该研究适用于任何依赖 工具使用 agent 的自动化决策场景,尤其是金融、医疗、电商、企业服务等领域。例如:金融风控 agent 在审批贷款前需验证收入证明、信用报告等多源证据;电商售后 agent 在处理退款请求时需确认订单状态、物流信息和用户凭证。SafeActBench 揭示的“证据未建立就行动”或“调查不完整即终止”问题,直接影响这些场景的可靠性和合规性。

商业价值

主要价值在降本与风险控制:通过 Evidence Ledger 追踪证据来源和行动时序,可减少因 agent 误操作导致的财务损失或合规风险。企业可将人工审核从全量抽检转为异常干预,降低运营成本。同时提升用户体验:减少错误行动(如误退款、误拒绝)能增强用户信任。对于强监管行业,可审计的证据链是部署 agent 的前置条件。

与现有工作流集成

可在现有 agent 框架(如 LangChain、AutoGen)中嵌入 确定性轨迹评估器 作为前置检查或事后审计模块。具体做法:

  • 在行动执行前调用评估器,验证当前证据是否满足预设条件(checkpoint)
  • 将 Evidence Ledger 作为结构化日志集成到 observability 平台(如 LangSmith、Datadog)
  • 对于多步工作流,利用其“部分执行”检测能力,在失败时触发回滚或人工介入

具体案例:某电商平台订单履约 agent 需要自动处理“仅退款”请求。按 SafeActBench 协议,agent 必须先收集买家上传的凭证、物流签收状态、商品价值等证据,再生成退款指令。现有实现常因证据缺失仍执行退款,造成资损。引入证据账本与条件动作评估后,系统可在缺少任一关键证据时阻止执行并转人工,预计减少 60% 错误退款。另一案例:医疗预问诊 agent 在生成处方建议前需确认患者过敏史、当前用药等,通过强制“证据先行”协议避免医疗风险。

局限

  • - **基准规模有限**:SafeActBench 包含 656 个案例,集中于六个操作领域,与真实生产环境的任务多样性仍有差距。评测仅覆盖十个模型-harness 配置,无法充分反映不同模型架构、规模及工具集成方式的组合影响。作者也承认静态判断与交互执行之间的差距受 harness 选择影响较大,未来需要更大规模和更多样的设置验证结论稳健性。对工程实践的启示:在采用该基准评估自己的代理系统前,需检验任务分布是否匹配自身应用场景。
  • - **确定性评估可能简化真实场景**:Evidence Ledger 和确定性轨迹评估器追踪信息建立与依赖关系,但真实世界中工具调用的结果可能具有随机性或部分可观测性,证据充分性往往存在模糊边界。基准假设每个动作所需证据预先定义且可判定,但实际任务中证据充分性判断可能依赖上下文或用户意图,这种简化可能导致评估偏差。与 Reflexion 等强调动态环境的工作相比,SafeActBench 的静态依赖图可能低估了交互式自我修正的难度。
  • - **缺少失败解决机制的探索**:论文深入诊断了失败模式,如停止前调查不完整、提前行动、多步依赖未满足等,但没有提出或验证任何改进方法(如提示策略、证据检查机制、强化学习训练) 来缓解这些问题。对于工程实践而言,仅仅知道失败点还不够,需要可行的干预方案。SafeActBench 可作为测试平台,但论文未涉及如何利用其诊断结果指导模型微调或系统设计。与 ToolLLM 等已经集成反馈循环的工作相比,该研究停留在观察层面。
论文Hongzhan Lin2026-10-06原文

相关内容