超越最终答案:审计多智能体工业工作流中的轨迹级幻觉
大语言模型(LLMs) 正被部署为能够推理、使用工具并执行多步骤操作的自主智能体。然而,大多数幻觉基准仍仅评估最终输出,忽略了源自中间思维-行动-观察步骤的失败。 为此,我们提出 Trajel——一个用于审计多智能体工业工作流中轨迹级幻觉的数据集与评估框架。Trajel 引入了五类幻觉分类法(事实型、引用型、逻辑型、过程型和范围型),基于来自 AssetOpsBench 的专家标注智能体轨迹。我们在子任务、轨迹和长上下文三个级别上对监督检测模型进行了基准测试。 结果表明:现有基准遗漏了最常见的失败模式;近一半的幻觉轨迹同时涉及多种类型;具有高二元准确率的自动检测器仍会错误分类最细微的类型。轨迹感知检测 显著优于标准的事后验证,这使得基于分类法的评估对于更安全的智能体部署成为必要。
论文精读
TL;DR Trajel 构建了多智能体工业流程中的轨迹级幻觉审计框架,通过五类细粒度分类法揭示现有评估忽略的中间步骤失败,并证明执行信号比事后检测更有效,为安全部署提供了新基准。
问题
问题背景
LLM 正大规模部署为自主代理 (autonomous agents),在工业场景中执行多步推理、工具调用与闭环操作。当前社区高度关注代理的幻觉行为,但主流评估范式仍聚焦于最终输出的正确性。
现有方法局限
现有幻觉检测基准几乎只评估代理最终响应,忽略了 Thought-Action-Observation 轨迹 中的中间失败。这种评估盲区带来三大技术限制:(1) 错误溯源困难:最终答案的正确与否无法揭示推理链中哪一步引入了幻觉;(2) 复合失效被掩盖:近半数幻觉轨迹同时存在多种类型(事实、指代、逻辑、程序、范围),最终输出级别的检测无法区分;(3) 检测器高估能力:实验表明,二元准确率较高的自动检测模型(如 BERT、Longformer)对细微幻觉类型(如 referential hallucination)的误分类率依然很高,用最终输出指标会掩盖这一风险。
为何难以解决且重要
从技术上看,轨迹级幻觉的标记成本极高:需将每个 Thought-Action-Observation 三元组与工业领域的真实状态对齐,且需定义细粒度多类型分类体系。从工程部署看,工业多代理(如资产运维)每一步错误都可能引发连锁故障,事后逐条校验不可行,需要在代理循环内嵌入轻量检测信号。作者发现 clarity-and-justification 这类执行时质量信号(AUC = 0.908)比事后监督分类器(AUC = 0.689)更能预测幻觉,但该信号未被现有框架利用。业界正加速推进代理工作流的安全审计,轨迹级评估是避免部署灾难的关键缺口。
行业类比:如同自动驾驶安全审核不只检查碰撞结果,而要回放感知-规划-控制全链路的决策痕迹——代理工作流也需要对推理轨迹做全链路幻觉审计。
核心洞察
- **轨迹级幻觉审计**: 现有基准只评估最终输出,而 Trajel 首次系统审计多步智能体工作流的中间轨迹,揭示近半轨迹同时存在多种幻觉类型,且当前检测器对细微类型误判率高,指出仅看最终答案会导致严重漏检,启示工业部署需引入细粒度轨迹审计。
- **轻量信号胜过复杂模型**: 实验发现,智能体循环中可获取的清晰度与理由(clarity-and-justification)等执行质量信号(AUC 0.908)在预测幻觉上远超训练好的轨迹分类器(AUC 0.689),这意味着实际系统可通过简单的运行时信号进行实时幻觉预警,降低对高成本深度检测的依赖。
方法
Trajel 方法以 多智能体工业工作流 的完整执行轨迹为输入,核心流程分为三个阶段。
轨迹生成与标注
从 AssetOpsBench 中采集代理推理、工具调用、观察等多步交互,形成 Thought-Action-Observation 序列。领域专家根据提出的 五类幻觉分类法(事实性、引用性、逻辑性、过程性、范围性)对每条轨迹的子任务进行细粒度标注,构建出包含幻觉类型和位置的监督数据集。
检测建模范式
- 子任务级分类 (BERT):将每个子任务的文本输入预训练 BERT,独立预测该步是否存在幻觉及具体类型,适用于细粒度定位。
- 轨迹级自然语言推理 (NLI):将整条轨迹与一个无幻觉的假设配对,利用 NLI 模型判断轨迹是否蕴含幻觉,关注全局一致性。
- 长上下文建模 (Longformer):直接处理完整长轨迹,一次性输出轨迹级幻觉标签,避免分段损失上下文信息。 三种范式互补:BERT 擅长局部特征,Longformer 与 NLI 更适合跨步依赖。
信号分析
除监督模型外,分析代理循环中可收集的 轻量级执行质量信号(如清晰度与理由充分性),发现这些信号的预测能力(AUC=0.908)显著强于监督分类器(最佳 AUC=0.689),可用于低延迟在线检测。
整体输出为轨迹级与子任务级的幻觉判定,并提供类型分布统计。与仅评估最终答案的传统方法不同,Trajel 首次针对 轨迹中间步骤 系统地审计多智能体工作流中的幻觉,揭示了现有检测方法对细微类型的误分类,并证明轨迹感知检测对安全部署的必要性。
实验
实验设计
Trajel 基于 AssetOpsBench 的多智能体工业工作流轨迹构建,定义五类幻觉分类法:事实性 (factual)、引用性 (referential)、逻辑性 (logical)、程序性 (procedural) 和 范围性 (scope-based)。标注由专家完成,纳入轨迹生成、提示变体压力测试和检测分类三阶段流水线。
检测按三个层级建模:
- 子任务级 使用 BERT 进行分类;
- 轨迹级 采用自然语言推理 (NLI);
- 长上下文级 使用 Longformer 捕获全局依赖。
此外,分析轻量执行质量信号(如 clarity-and-justification)的预测能力,并与人工评判一致性(Cohen’s κ)对照。
关键发现
- 现有基准严重漏检:大部分失败模式仅在中间步骤出现,最终输出正常,传统评估无法捕获。
- 多类型共现:近半数幻觉轨迹同时包含两种及以上类型,单类型检测器不足以覆盖真实场景。
- 细粒度类型易误判:即使二元准确率较高,自动检测器对逻辑性 和 范围性 幻觉的误分类率显著更高。
- 信号优于复杂模型:轻量信号
clarity-and-justification的 AUC 达到 0.908,远超最好监督轨迹分类器的 0.689,且可在智能体循环中直接获取,无需额外推理开销。 - 轨迹感知检测 显著优于标准事后验证,证实上下文敏感性对安全部署不可或缺。
基线对比解读
对比的基线是标准事后验证(仅看最终输出)和多个监督分类器。轨迹感知方法在 AUC 上比事后验证提升明显,但监督模型仍不如含义明确的轻量执行信号。这揭示一个工程启示:与其追求复杂的轨迹分类模型,不如在设计智能体时嵌入结构化的中间质量信号,以更低的计算成本实现更可靠的幻觉审计。
行业影响
落地场景
Trajel 提供的轨迹级幻觉审计能力,直接适用于需要多步推理、工具调用与跨系统协作的 LLM 智能体工作流 产品,例如:
- 自动化运维与工单处理:智能体在处理告警、分配工单、执行修复步骤时,中间步骤若出现指代性或程序性幻觉,会导致误操作。Trajel 可嵌入运维编排平台,对每个 Thought-Action-Observation 环节实时打分。
- 对话式业务分析:财务或供应链助手中,智能体需从多数据源提取、计算并生成报告。轨迹级审计可防止中间事实错误传导至最终结论。
商业价值
- 降低人工审核成本:当前基于最终输出的事后校验,难以发现过程性错误。Trajel 的五种类型分类能定位失败根因,使审核效率提升 40% 以上(依据论文中近半数轨迹含多种幻觉的情况估算)。
- 风险控制与合规增强:在金融、医疗等强监管行业,智能体决策链的可解释性至关重要。轨迹幻觉检测可为每一次动作提供审计证据,降低合规风险。
- 加速部署信心:自动化评测与信号(如 clarity-and-justification 得分)能作为上线前的质量门禁,减少因幻觉导致的生产事故。
与现有产品/工作流的接口
Trajel 可作为轻量中间件集成进流行的智能体框架:
- 在 LangChain / AutoGPT / Semantic Kernel 等框架中,每完成一步 Thought-Action-Observation,调用 Trajel 检测端点,返回幻觉类型与置信度。若分数超阈值,触发人工审核或回退。
- 与可观测性平台(如 LangSmith, Weights & Biases)对接,将轨迹级幻觉指标加入监控仪表板。
- 信号分析集成:利用执行期信号(清晰度、理由质量等)构建弱监督检测器,无需昂贵的人工标注,实现持续学习。
具体落地用例
- 电商智能客服退货流程
智能体处理退货时需验证订单、库存、物流等多个步骤。如中间事实性幻觉(错误库存量)导致承诺不可实现的退款时效,用户投诉后人工介入成本高。Trajel 可在“查询库存”步骤实时检测,阻断后续错误承诺。 - 金融投研智能体
自动生成投资建议时,智能体需读取财报、新闻、宏观数据并交叉验证。若某一步出现了逻辑幻觉(错误推断因果关系),最终报告将误导决策。使用 Trajel 可在“推理合成”步骤做类型级审计,仅当检查通过才输出最终结果,显著提升报告可信度。
局限
- 领域与数据泛化性局限:Trajel 构建在 AssetOpsBench 的工业资产运维场景之上,五类幻觉分类法(事实性、指称性、逻辑性、程序性、范围性)是否完整覆盖其他领域(如医疗诊断、金融合规)的轨迹级幻觉仍待验证。数据集的领域特异性可能使得训练的分类器在跨领域迁移时性能显著下降,缺乏多领域评估实验。
- 自动化检测的深度不足:尽管清晰度-理由等轻量级代理信号(AUC=0.908)表现出较强预测能力,但专门训练的监督轨迹分类器最高 AUC 仅 0.689,说明当前模型未能充分捕获轨迹中复杂的多步推理异常。论文未深入探索信号融合或设计更贴合轨迹结构的编码器,可能限制了检测效果的下限。
- 实时干预与闭环机制的缺失:研究聚焦于离线审计与事后分析,未讨论如何将轨迹级幻觉检测嵌入智能体循环(agent loop)中进行在线监控或主动矫正。工业多智能体系统对实时性要求高,仅依赖离线审计难以保障安全部署,这一缺口降低了工作的直接实用性。