行业新闻

AgentForesight:用 7B 审计员在线识别多智能体任务的关键错误

多智能体系统出错往往不是当场报错,而是错误前提被一路沿用;这项工作让一个 7B 模型在线审计每一步,在任务失败前定位关键错误步骤和责任人。

多智能体任务里,一个 Agent 给出错误前提,后面的 Agent 却可能照常执行下去。罗格斯大学、得州大学奥斯汀分校和普渡大学的研究团队提出 AgentForesight,用一个 7B 模型在任务运行过程中持续审计:每完成一步就读取当前执行记录,判断该继续还是报警,把原本事后才做的归因前移到错误扩散之前。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/59719c9e-98f3-4f9e-9dac-a5688e075d1b/020(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 从事后归因到在线审计,在任务失败前识别关键错误 多智能体的失误,未必表现为当场报错。更麻烦的是,一个 Agent 给出错误前提,其他 Agent 却继续认真执行。来自罗格斯大学、得克萨斯大学奥斯汀分校和普渡大学的研究团队提出 AgentForesight,让一个 7B 模型在任务运行中持续审计。在 AFTraj-2K 测试集上,它对失败轨迹的关键错误步骤识别指标 Exact-F1 达到 66.44 ,比最强通用模型基线高 19.88 分,而对成功轨迹误报率仅为 2.37% 。 让一个 Agent 规划,一个 Agent 搜索,再让另一个 Agent 汇报,任务就一定更可靠吗? 设想这样一个场景:用户想买一副 200 美元以内的降噪耳机,筛选 Agent 却把预算上限设成了 300 美元。接下来,比较参数、生成报告、给出推荐,每一步都可能有条不紊。可再漂亮的报告,也掩盖不了整条工作流已经偏离了用户要求。 后面的 Agent 未必做错了自己的子任务。它们只是把 前面那一步的错误 ,当成了继续工作的前提。 等推荐生成后,再追问「哪个 Agent、哪一步出了错」,当然有助于复盘。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-10-10原文

相关内容