LongRCA Bench: 诊断长周期智能体故障中的责任角色与根本原因
当长周期智能体执行失败时,结果级评估只能显示最终的不成功,却无法定位决定性错误是在轨迹的哪一步引入的。开发者必须检查完整执行过程,以识别责任角色并定位最早的、决定性的根本原因步骤。现有的故障归因基准大多聚焦于较短轨迹,对跨越数百个记录步骤的诊断仍探索不足。 我们提出了 LongRCA Bench,包含五个领域的 1,140 条失败轨迹,且未注入人为错误。该基准提供了独立评分的人工标注,涵盖责任角色和最早决定性根因步骤。中位轨迹包含 145 步,而最强基线仅达到 13.2% 的精确根因步骤准确率。 进一步地,我们提出了 根因轨迹归因(Root-Cause Trajectory Attribution, RCTA),一种无需训练的方法,它从片段摘要中检索候选错误步骤,并将其追溯到可用的早期交接指令。在相同骨干、基准实例和评分协议下,RCTA 达到了 51.1% 的责任角色准确率和 24.1% 的精确根因步骤准确率。 这些结果凸显了在长轨迹故障诊断中,将责任角色归因与精确根因步骤定位作为两个独立目标进行评估的必要性。
论文精读
TL;DR LongRCA Bench 首次大规模标注长程 Agent 失败中的负责角色与最早根因步骤;训练无关的 RCTA 通过分段摘要检索与交接指令回溯,将根因步准确率从 13.2% 提升至 24.1%。
问题
问题背景
长时程 Agent 执行失败后,仅凭 outcome-level evaluation 只能看到失败结果,无法定位错误最早进入轨迹的位置。开发者必须检查完整执行记录,判断责任角色并定位最早决定性根因步骤。
现有方法局限
- 现有失败归因基准:多数聚焦短轨迹,通常只有几十步;LongRCA Bench 中轨迹中位数达 145 步,数百步长轨迹标注稀缺。
- 错误注入式合成数据:常见做法是人工植入错误生成失败样例,但这类失败模式与真实自然失败分布存在偏差;本文基准不注入错误,更贴近真实场景。
- 现有诊断方法:如基于 segment summary 的检索,容易把表面症状误判为根因——错误往往发生在早期,后续步骤只是被污染的结果,缺乏对早期 handoff 指令的追溯。
为什么这个问题难且重要
- 错误传播链极长:根因步骤与最终失败之间可能相隔大量无关步骤,信噪比很低,步骤级精确定位极具挑战。
- 责任角色多维:失败可能源于用户指令不完整、Agent 规划失误、工具调用异常等不同环节,需要跨角色联合推理。
- 人工成本高昂:逐步检查数百步轨迹不现实,自动化方法必须达到步骤级精度;当前最强基线 exact root-step 准确率仅 13.2%,说明问题远未解决。
行业类比
类似自动驾驶事故调查:需要从数小时驾驶日志中定位最早的关键决策失误,而不是只看碰撞瞬间;失败归因同样要求细粒度定位与高效自动诊断。
核心洞察
- 该工作将长程代理失败归因分解为“负责角色”和“最早决定性根因步骤”两个独立目标,并构建了无注入错误的 1,140 条真实失败轨迹基准。与以往短轨迹或人工注入故障的基准不同,LongRCA Bench 的标签由多人独立评分,中位数轨迹达 145 步,最强基线仅 13.2% 精确根步骤准确率,揭示现有方法在长程诊断上的显著能力缺口,为后续方法提供明确评测标尺。
- RCTA 方法利用长程代理中普遍存在的“交接指令—执行偏差”结构,先通过分段摘要召回候选错误步骤,再回溯至先前的交接指令定位根因,训练自由且计算开销低。相比直接依赖完整轨迹上下文或依赖图谱搜索的基线,它显式利用交接指令作为监督信号,将精确根步骤准确率从 13.2% 提升至 24.1%,同时分离“角色归因”与“根步骤定位”评测,暴露了仅做依赖搜索不足的问题。但精确根步骤准确率仍低,说明需要更强机制。
方法
输入与总体流程
输入为一条失败的长 horizon agent trajectory,由数百个步骤组成,涉及多个 agent 角色(如 planner、executor、tool user 等)。Root-Cause Trajectory Attribution (RCTA) 是一个 training-free 方法,直接使用预训练 backbone(如 LLM)进行推理,无需微调。
关键模块
轨迹分段
将完整轨迹按语义或固定长度切分为多个 segment,降低单次处理的上下文长度,同时保留段内的局部因果信息。召回候选错误步骤
对每个 segment 生成摘要,利用 backbone 判断哪些 segment 更可能包含导致失败的错误步骤。基于摘要筛选出若干候选 error steps,避免直接对全部步骤进行高成本定位。追溯到交接指令
对每个候选错误步骤,检索轨迹中更早出现的 handoff instructions(角色间传递的任务说明或约束)。通过比对错误步骤与其对应的交接指令,判断该步骤是否违反了指令要求,从而定位 earliest decisive root-cause step,并判定 responsible role(哪个角色对该错误负责)。
输出
输出两个独立标签:responsible role(角色级归因)和 earliest decisive root-cause step(步骤级精确位置)。
与同类方法的差异点
与以往主要针对短轨迹、依赖端到端分类或检索的 failure attribution 方法不同,RCTA 通过 分段摘要召回 + 交接指令追溯 的显式两阶段机制,专门应对长轨迹中错误定位的稀疏性与长距离依赖,且无需训练即可显著提升根因步骤定位的精确度。
实验
实验设计
LongRCA Bench 包含 1,140 条失败轨迹,来自 5 个领域,无错误注入;人工独立标注 responsible role 与 earliest decisive root-cause step,轨迹中位长度 145 步。评估在相同 backbone、benchmark instances 和 scoring protocol 下进行。RCTA 方法先对轨迹分段并生成摘要,从摘要中检索候选错误步骤,再回溯到之前的 handoff instructions 完成根因归属。
关键发现
最强 baseline 仅达 13.2% exact root-step accuracy,表明精确锁定最早决定性错误步骤极其困难。RCTA 将 responsible-role accuracy 提升至 51.1%,exact root-step accuracy 提升至 24.1%,相对 baseline 提升显著(root-step 相对提升约 83%)。此外,实验显示 dependency-guided search alone 在该设置下不充分,必须结合 handoff 指令回溯。
与基线对比解读
- 角色归属:RCTA 的 51.1% 超过半数,但 baseline 未披露该项,横向对比主要为 root-step 提供参照。
- 根因定位:从 13.2% 到 24.1%,提升约 10.9 个百分点,但 24.1% 的绝对值仍低,说明长轨迹故障诊断远未解决。
- 工程启示:免训练特性使 RCTA 可快速接入现有 agent 系统,用于事后诊断;建议将 responsible-role attribution 与 exact root-step localization 作为独立评估目标,避免仅用 outcome-level 指标掩盖定位难度。
行业影响
落地场景
LongRCA Bench 适用于多步骤 AI Agent 平台的可观测性与故障诊断,尤其适合客服自动化、金融合规审计、电商订单处理、企业 RPA 等长轨迹场景。例如:一个由 LLM 编排的电商售后客服 agent 跨库存查询、退款审核、物流对接等几十个步骤,当最终回答错误时,需要快速定位是 planner 错误分派、tool executor 参数错误,还是知识检索遗漏关键约束。该基准提供 1,140 条无注入错误的失败轨迹,可作为评测集。
商业价值
人工排查一条 145 步的轨迹耗时可能超过 30 分钟,而 RCTA 方法将根因步骤精确定位率从最强基线 13.2% 提升到 24.1%,负责角色准确率达到 51.1%,可显著缩短 MTTR(平均修复时间)。对 AI 产品团队:
- 降低 agent 上线后的维护人力成本;
- 减少用户遇到重复错误导致的流失;
- 快速定位是模型、prompt、工具还是数据问题,指导迭代优先级。 相比只输出最终成功/失败的 outcome-level 评估,角色级 + 步骤级归因能为模型供应商和集成商提供更细粒度的质量 SLA 指标。
与现有产品/工作流的接口
该方法训练无关、基于 backbone 与现有 tracing 数据,可直接嵌入 LangSmith、Langfuse、Arize Phoenix 等观测平台:
- 将 agent 执行日志按 segment 切分并生成摘要;
- 召回候选错误步骤;
- 追溯到早期 handoff 指令。
工程团队可把 RCTA 作为后处理插件,在 CI/CD 或回归测试中自动标记失败用例的根因角色,节省人工 review。现有工作流中只需增加
root_cause_attribution字段即可,无需重新训练模型。
局限
- **领域覆盖与标注客观性受限**:基准仅覆盖五个领域,轨迹全部来自具有显式 `handoff instructions` 结构的 agent 系统,对于单一 LLM 连续决策或隐式协作场景,标签定义与 RCTA 方法难以直接迁移。此外,“最早决定性根因步骤”的判定存在主观性,不同标注者可能对‘最早’与‘决定性’的权重理解不同,论文未报告标注者间一致性系数,可能影响标签的可靠性与可比性。
- **RCTA 依赖结构化先验且绝对准确率偏低**:RCTA 需要先进行分段摘要,候选步骤召回严重依赖 `handoff instructions` 的存在;若轨迹缺乏清晰交接指令或分段边界模糊,召回质量会明显下降。实验显示 exact root-step 准确率仅 24.1%,离实用诊断仍有很大差距;对比基线仅使用同一 backbone 实现,未与更强 LLM 推理、多智能体辩论或监督式根因定位模型比较,难以评估性能上限。
- **基准规模与后续研究支持不足**:1,140 条轨迹虽在长轨迹人工标注中已属较大规模,但相比通用 agent 轨迹数据集(百万级)仍偏小,不足以训练可靠的端到端归因模型。论文仅提供训练自由方法 RCTA 作为基线,没有公开标准数据划分或监督式基线,导致后续研究者开发数据驱动方法时缺少统一的比较基础,复现与扩展成本较高。