论文

根因归因是一个搜索问题:面向长时程 Agent 失败的持续搜索

根因归因是一个搜索问题:面向长时程 Agent 失败的持续搜索

长时程任务中 AI agent 的广泛部署产生了海量执行日志,从这些记录中诊断失败对系统可靠性至关重要——它能把结果层面的信号转化为可执行的干预。但数据规模巨大,人工审查不现实,因此需要自动化根因归因(RCA)。然而,基于 LLM 的自动化 RCA 方法诊断准确率偏低,且执行轨迹越长越明显。其症结在于:相关信息往往稀疏、分散在相距很远的动作中、且与可见的失败点脱节,使根因归因退化成一个巨大的搜索问题。 现有 RCA 方法通常依赖一次性的 LLM 判断来从执行轨迹中诊断失败。这在较短轨迹上尚可,但这类 judge 往往过早锁定一个看似合理的诊断,使更长轨迹中的关键证据未被检查。为此,我们提出 Continual Search:一个迭代式框架,在连续多轮中推动 judge 持续搜寻尚未解决的诊断证据。 我们在四个现有 RCA benchmark 上评估 Continual Search。鉴于现有 benchmark 缺乏大规模执行轨迹,我们进一步提出 MegaRCA-Mix,用于规模化评估 RCA。MegaRCA-Mix 包含 50 个人工标注的失败 trial,覆盖长时程、执行密集的任务,构成一个极具挑战性的测试平台。 在多个 benchmark 套件与多个模型家族上, Continual Search 均稳定提升归因表现。例如在 MegaRCA-Mix 上,它将 GPT-5.5 的 F1 从 0.349 提升到 0.498,提升超过 40%。更有意思的是,在同一模型家族内,较低档位的模型甚至可以超越更高档位的对应模型,说明有效的搜索能够胜过单纯的模型规模。

论文精读

TL;DR 将长程 agent 失败归因重构为搜索问题,通过 Continual Search 迭代检索未决证据,在 MegaRCA-Mix 上 GPT-5.5 F1 提升超 40%。

问题

问题背景

长时任务中 AI agents 产生海量执行日志,从失败结果自动定位根因(root-cause attribution, RCA)成为提升系统可靠性的关键环节。

现有方法局限

现有自动化 RCA 主要依赖 one-shot LLM 判断:把整条执行轨迹一次性输入模型,期望给出诊断。这种方式在短轨迹上有效,但在长轨迹中,LLM 容易在早期锁定一个看似合理的诊断,不再继续检视剩余日志。根因证据往往稀疏、分散在相距很远的动作间,且与可见失败信号无直接关联。这种“过早收敛”导致大量关键证据被遗漏,诊断准确率急剧下降。此外,现有基准普遍缺少大规模执行轨迹,难以暴露真实长时场景下的性能退化。

为什么这个问题难/重要

长轨迹中的根因定位本质上是大规模搜索问题:相关信息占比极低、分布长尾、存在长距离依赖。人工审查成本不可扩展,而单次 LLM 调用受上下文窗口和注意力偏向限制,难以覆盖全局。生产环境中 agent 故障修复依赖准确的根因定位,错误诊断会直接导致无效的干预措施,因此该问题具有高度工程紧迫性。

行业类比

类似 自动驾驶事故复盘 场景:从数百小时日志中定位导致失效的单一传感器异常,逐帧扫读不如迭代式定向搜索高效。

核心洞察

  • 根因归因在长程 agent 日志中本质上是搜索问题,而非单次判断问题。 现有 one-shot LLM judge 倾向于在轨迹早期锁定一个看似合理的诊断,从而忽略分布在后续步骤中的关键证据。Continual Search 通过多轮迭代提示,强制 judge 持续寻找未解决的诊断证据,将静态的归因判断转化为动态的证据检索过程。这一视角与以往把 RCA 当作分类或单步推理的 baseline 有根本差异,直接针对长轨迹中稀疏、分散的证据分布。
  • 有效的搜索策略可以弥补模型规模差距,甚至让低 tier 模型超越高 tier 模型。 在 MegaRCA-Mix 上,同一模型族中较低 tier 模型配合 Continual Search 的 F1 超过了更高 tier 模型,说明在长轨迹 RCA 任务中,证据获取能力比原始参数规模更重要。这对工程实践是一个重要信号:与其盲目升级模型,不如先优化诊断流程。该结论也挑战了“更大模型=更好诊断”的默认假设,与很多只比较模型能力的工作形成对比。
  • 现有 RCA 基准缺乏大规模执行轨迹,导致长程故障归因能力被低估或无法评测。 MegaRCA-Mix 提供了 50 个人工标注的 failure trials,专门覆盖长周期、执行密集型的 agent 任务。它弥补了当前 RCA 评测中缺少大规模日志场景的空白,使研究者能够在更真实、更稀疏的证据分布下检验方法。这一基准的引入揭示了已有 short-trajectory 基准的局限性,推动领域从短轨迹评估转向长程执行日志的可扩展诊断。

方法

输入

  • 长 horizon 执行轨迹:包含 agent 的动作、环境观察、最终失败信号及中间状态。
  • 现有 RCA 基准或 MegaRCA-Mix 等大规模执行日志。

关键模块

  1. 判定器(Judge):以 LLM 作为诊断器,每轮接收当前证据集合与原始轨迹片段,输出候选根因归因。
  2. 迭代搜索循环:框架在连续多轮中驱动判定器,每轮结束时会询问“是否还存在未解决的诊断证据”。若存在,则将该证据标记为下一轮搜索目标;若不存在,则停止。
  3. 证据获取与上下文更新:根据上一轮未解决线索,从执行轨迹中定位并提取相关片段,追加到下一轮上下文,避免重复已覆盖内容。
  4. 停止条件:达到最大轮数或判定器确认无新的未解决证据。

输出

  • 最终根因归因集合,以及每一步归因所依赖的证据片段。

与同类方法的差异点:相比一次性 LLM 判断或独立重采样,Continual Search 将归因视为搜索问题,以“未解决证据”为接力信号不断深入,而不是重新生成完整诊断。

实验

实验设计

在四个现有 RCA 基准(TRAIL, TELBench, AgentRx, Who&When)以及新提出的 MegaRCA-Mix 上评估 Continual Search 框架。MegaRCA-Mix 包含 50 条人工标注的长时程、执行密集任务失败轨迹,专门用于测试大规模日志下的归因能力。基线为一次性 LLM 判断,方法则通过逐轮提示法官继续搜索未解决证据。计算资源未报告,主要开销来自多轮 LLM 推理调用。

关键发现

Continual Search 在所有基准和模型家族上一致提升归因性能,尤其在长轨迹上效果显著。在 MegaRCA-Mix 上,GPT-5.5 的 F1 score 从 0.349 提升至 0.498,相对提升超过 40%。更值得关注的是,同模型家族内较低层级的模型采用 Continual Search 后可以超越较高层级模型,表明有效的搜索策略能够弥补模型规模不足。在短执行轨迹上,该方法收益有限,因为一次性判断已足够准确。

对比解读

与独立重采样(independent resampling)相比,Continual Search 通过迭代式寻找“未解决证据”实现了有方向性的探索,而非简单重复采样,因此效果更优。这一结果重新定义了 RCA 为大范围搜索问题:面对海量 agent 日志,优化搜索与证据获取策略可能比单纯增大模型参数更有效、更经济。当前 MegaRCA-Mix 规模仍有限(50 条),未来需在更大规模、更多样任务上进一步验证。

行业影响

落地场景

Continual Search 可直接应用于 AI Agent 可观测性平台 与 AgentOps 工具链,面向长时程、多步骤的执行日志做自动化根因归因。典型业务包括:智能客服工作流、RPA 流程自动化、多工具调用型 agent(如代码生成、数据查询)、以及自动驾驶仿真日志分析。这些场景的执行轨迹往往包含数百次 action,错误信号稀疏且分散,一次性 LLM 判断极易漏检关键证据。

商业价值

核心价值在降本与可靠性提升:

  • 减少人工审查成本:长轨迹人工定位根因通常需要数小时,自动化归因可将 MTTR 从小时级压缩到分钟级。
  • 提升 agent 上线信心:稳定准确的 RCA 能加快故障修复闭环,降低重复性错误导致的用户流失或业务损失。
  • 释放长尾价值:论文表明低阶模型配合 Continual Search 可超越高阶模型,意味着企业可用更小模型达到同等诊断水平,直接降低推理成本。

集成接口

Continual Search 可作为独立诊断模块嵌入现有 LLM judge 管道:

  • 输入为执行轨迹 JSON 或日志序列,输出根因标签与证据片段。
  • 以 API 形式与 LangGraph / AutoGen 等 agent 框架集成,在任务失败后自动触发。
  • 只需替换现有一次性判断 prompt 为多轮“继续搜索”循环,无需改动底层模型或日志格式。

具体 Use Case

  1. 电商智能客服 agent:用户订单查询经历意图识别、库存查询、支付接口调用等多个步骤,最终回答错误。Continual Search 自动回溯所有 action,定位到某个工具返回格式异常导致后续推理错误,而非表面上的 LLM 幻觉。
  2. 自动驾驶仿真测试:长序列决策日志中,规划模块偶发违规。逐帧人工分析成本极高,Continual Search 可迭代搜索前序感知或预测输出中的异常信号,精确归因至上游模块误差。

局限

  • **短轨迹收益有限**。论文在 4.3 节明确指出,Continual Search 在短执行轨迹上的提升幅度明显小于长轨迹。这是因为短轨迹中相关证据分布较为集中,一次性 LLM 判断通常已能提取关键信息,迭代搜索带来的额外探索收益有限。对于以短任务为主的智能体应用,该方法可能引入不必要的推理轮次,造成延迟与成本浪费,而诊断准确率提升不显著。因此,实际部署时需要根据轨迹长度动态决定是否启用 Continual Search,或结合自适应触发机制。
  • **MegaRCA-Mix 基准规模与多样性受限**。该基准仅包含 50 个人工标注的失败试验,虽然覆盖长时程、执行密集型任务,但样本量小,任务域和失败模式可能偏向特定类型(如网页导航、工具调用等)。人工标注成本高,难以扩展到更多环境和智能体架构,导致评估结果的外部效度有限。此外,基准未公开详细的领域构成和失败类型分布,难以判断对真实世界智能体故障多样性的代表性。与更大规模自动生成或半自动标注的基准相比,MegaRCA-Mix 的统计功效较弱。
  • **对 LLM 推理能力与调用成本敏感**。Continual Search 需要 LLM 在多轮对话中持续判断是否存在未解决的诊断证据,这要求模型具备较强的指令遵循、自我评估和不确定性表达能力。对于基础模型或上下文窗口较小的模型,可能无法有效收敛,甚至出现诊断漂移。同时,多次调用显著增加 token 消耗和推理延迟,在高并发或实时 RCA 场景中可能不满足性能要求。论文未系统分析成本-收益权衡,也未与轻量级证据检索方法(如基于 embedding 的相似度搜索)进行对比,限制了工程落地的可行性评估。
论文Harsh Raj2026-09-11原文

相关内容