论文

从序列到结构:面向LLM智能体的关系不确定性传播

从序列到结构:面向LLM智能体的关系不确定性传播

在复杂交互环境中,对大型语言模型(LLM)智能体进行不确定性量化(UQ)至关重要。现有UQ方法多依赖局部信号,如词元概率、预测熵或单步置信度,忽略了错误随执行轨迹累积的长程依赖,因而难以识别源于最终答案前多个推理或交互步骤的智能体故障。 为此,我们提出 RUPA(关系不确定性传播框架),一种面向LLM智能体的轨迹级UQ方法。RUPA 将执行历史建模为有向轨迹图,其中推理状态、工具交互和环境反馈作为节点,通过时间与语义依赖边连接;随后在此图上传播不确定性,以刻画执行风险如何在交互步骤间累积与传递。传播信号与轨迹级行为特征及目标对齐信息结合,生成对完整智能体轨迹的置信度估计。 我们在 τ-2、Terminal-Bench-2 和 GAIA 等代表性智能体基准上,使用 6 个跨多系列的开源LLM进行评估。实验结果表明,RUPA 在提供更精确的不确定性估计、实现更早的故障检测以及改善不确定性引导的智能体执行方面,始终优于现有UQ方法。 这些结果证明,显式建模关系依赖对于长程LLM智能体的可靠UQ至关重要,为可信赖的智能体执行提供了实用基础。

论文精读

TL;DR RUPA 将 LLM Agent 执行轨迹构建为有向关系图,沿时间与语义依赖传播不确定性,补足局部信号忽略的长程错误累积,提升长程任务失败检测与置信度校准。

问题

问题背景

当前 LLM agent 在复杂交互环境(工具调用、多步推理、环境反馈)中部署时,可靠的不确定性量化(UQ)成为关键需求,以支持错误检测、风险预警与动态决策。

现有方法局限

主流 UQ 方法依赖 局部信号,如 token 概率、预测熵、单步置信度等。这些信号只能刻画单步输出的不确定性,无法建模跨步骤的 误差累积。顺序型 agent UQ 方法虽考虑步骤序列,但假设线性传播,难以捕获复杂步骤关系(如工具调用分支、环境反馈回环)中的风险转移。因此当失败原因早于最终答案若干步出现时,传统方法往往在最终阶段才给出高置信错误,漏检早期风险。

为什么这个问题难/重要

长时程 agent 任务中,单步风险会通过 语义依赖 与 时间依赖 在轨迹中传播、放大或相互抵消。例如某步工具返回错误结果,后续推理可能基于错误前提继续,直到多步后才显现失败。要准确量化轨迹级不确定性,必须显式建模 关系性依赖图,而非简单叠加局部信号。业界对 agent 的信任部署(如自动代码修复、信息检索)要求 UQ 既能给出整体置信度,又能实现 早期失败检测,从而节省计算资源并避免错误动作外溢。

行业类比

类似自动驾驶中的多传感器融合与路径规划:仅凭单帧检测置信度无法判断整体驾驶安全,需要跨时间关联各模块的风险状态。

核心洞察

  • RUPA 将 LLM agent 执行轨迹建模为有向关系图,在图上传播不确定性,从而捕捉跨步骤误差累积。与只看 token 概率、预测熵或单步置信度的传统 UQ 方法不同,RUPA 能定位到最终失败前若干步的风险来源,直接提升长程交互任务的可信度评估。
  • 关系依赖的显式建模是轨迹级 UQ 的关键补充;实验显示,RUPA 在 τ-2、Terminal-Bench-2、GAIA 三个 benchmark 上一致优于现有方法,并且在 partial trajectory 阶段就能给出更早的失败预警,而不只是事后置信度。与简单序列化步骤的 UQ 相比,图传播保留了工具交互与环境反馈之间的语义依赖,更符合 agent 执行的真实结构。

方法

输入与轨迹图构建

RUPA 的输入是 LLM agent 的完整执行历史,包括推理步骤、工具调用、环境反馈等。框架首先将这段历史解析为有向轨迹图:每个推理状态、工具交互、环境反馈构成节点;边分为两类——时序依赖边(按执行顺序连接相邻步骤)和语义依赖边(捕捉跨步骤的信息引用或因果关联)。图中显式保留了长距离依赖关系,这是后续不确定性传播的基础。

关系感知不确定性传播

在图上,RUPA 执行关系感知的不确定性传播。初始不确定性来自各节点的局部信号(如 token 概率、工具返回置信度等),然后沿有向边迭代传播,让每个节点的风险吸收其依赖节点的影响。传播机制能够反映错误如何从早期步骤累积并转移到后续决策,即使失败的根本原因发生在多步之前,也能在最终节点形成较高的不确定性。

轨迹级置信度估计

传播后的图信号与轨迹级行为特征(如步数、重复调用、异常模式)以及目标对齐信息(最终答案与任务目标的匹配程度)相结合,输出针对完整轨迹的置信度估计。该置信度可用于失败检测、提前止损或不确定性引导的 agent 执行。

与仅使用局部信号或简单顺序聚合的 UQ 方法不同,RUPA 显式建模轨迹内的关系依赖,从而更准确地刻画长程错误传播。

实验

实验设计

RUPA 在 τ-2、Terminal-Bench-2、GAIA 三个 agent benchmark 上评估,覆盖 6 个开源 LLM(多个模型家族)。对比对象包括基于局部信号的传统 UQ 方法(token probability、entropy、per-step confidence)与顺序 agent UQ 方法。评估角度涵盖轨迹级失败检测的准确率、部分轨迹下的早期失败检测能力,以及不确定性引导执行对 agent 性能的改善。

关键发现

实验显示 RUPA 一致优于现有 UQ 方法:

  • 更准确的不确定性估计:在完整轨迹上显著提升失败检测性能。
  • 更早的失败检测:利用部分轨迹即可捕获早期风险信号。
  • 不确定性引导执行带来实际收益:将 RUPA 的不确定性用于任务选择或交互策略,可提升 agent 最终表现。
  • Graph-based trajectory modeling 提供 complementary signals:消融表明关系依赖传播是性能增益的主要来源。

基线对比解读

传统局部 UQ 方法难以处理长程依赖,错误可能在多个 reasoning/interaction 步骤前埋下,最终才爆发;顺序 agent UQ 方法虽然考虑步骤序列,但无法充分建模复杂步骤间的风险传播。RUPA 的 directed trajectory graph 显式编码 temporal 与 semantic 依赖,并通过 uncertainty propagation 让风险在图中累积与转移,因此对 long-horizon 交互任务更鲁棒。这种从 sequence 到 structure 的建模思路,为实际部署中可信 agent 执行提供了基础。

行业影响

落地场景

RUPA 适合部署在长时程、多步交互的 LLM agent 系统中,如自主任务执行平台(AutoGPT、LangChain Agent)、企业工作流自动化(RPA + LLM)、复杂客服/售后系统、代码生成与维护 agent。具体用例:

  • 电商售后 agent:处理退换货流程,需调用订单查询、库存、支付等多个 API,RUPA 可识别早期步骤中的错误(如错误解析用户意图)并提前终止或转人工。
  • 代码仓库维护 bot:自动修复 issue、生成 PR,RUPA 评估整个修复轨迹置信度,降低低质量代码合并风险。

商业价值

  • 降本:通过 early stopping 避免无效执行和 token 浪费,减少后续错误步骤的累积;同时降低人工审核与干预成本。
  • 增收 / 体验提升:提升 agent 任务完成率和用户信任,可设置置信度阈值进行自动路由(低于阈值转人工或切换更强模型)。
  • 风险控制:在金融、医疗等高风险场景,轨迹级不确定性为审计和合规提供量化依据。

集成接口

RUPA 可作为 agent 执行框架(如 LangChain、LlamaIndex)的后处理组件,接收轨迹日志(推理状态、工具调用、环境反馈),构建关系图并输出置信度分数。该分数可对接:

  • LLM 网关 / 路由层:决定是否重试、切换模型或人工接管。
  • 监控 dashboard:实时展示轨迹风险分布,辅助运维决策。
  • 数据飞轮:收集低置信度样本用于后续微调或提示词优化。

局限

  • - **关系图构建依赖静态 schema**:RUPA 将轨迹抽象为节点和边,但节点类型与依赖关系需预先定义,例如 `reasoning_state`、`tool_call`、`temporal`、`semantic`。对于工具集合动态变化、反馈格式非结构化的真实环境,这种手工设计可能遗漏隐式因果或长程依赖,且论文未做图构建错误对最终置信度影响的敏感性分析。工程部署时需针对不同 agent 框架重新设计图模式,迁移成本较高。
  • - **传播计算开销可能限制实时性**:不确定性传播需要在整个轨迹图上执行信息聚合,图规模随推理步数和分支数增长。论文未提供与 token-level UQ 或单步置信度方法的推理延迟对比,也未讨论在线场景下的增量更新或截断策略。对于长 horizon 和 tool-heavy 任务,全图传播可能成为瓶颈,难以满足低延迟交互要求。
  • - **评估范围和基线覆盖有限**:实验仅在 τ-2、Terminal-Bench-2、GAIA 三个 benchmark 上,使用 6 个开源 LLM 验证;未纳入基于深度集成或贝叶斯近似的强 UQ 基线,也缺少置信度校准误差(如 ECE)指标。此外,当前开源仓库缺少第三方复现和独立评测,不确定性引导的执行改进在跨域任务上的稳健性仍需更多证据。
论文Zhengzhao Ma. Boxi Cao2026-08-17原文

相关内容