论文

您的智能体也在老化:面向已部署系统的智能体生命周期工程

您的智能体也在老化:面向已部署系统的智能体生命周期工程

长期运行的AI智能体正越来越多地部署为持久化操作型系统,然而它们仍像刚初始化的模型一样被评估。第一天基准测试忽略了一个基本系统问题:智能体在部署后能保持可靠多久?即使模型权重冻结,智能体的有效状态也会因压缩交互历史、从不断增长的记忆存储中检索、更新后修订事实以及经历例行维护而持续变化。因此,可靠性成为完整智能体框架的生命周期属性,而不仅是基础模型的快照属性。 我们提出AgingBench,一个面向智能体生命周期工程的纵向可靠性基准:不仅衡量已部署智能体是否退化,还诊断退化的形式以及修复应瞄准的方向。AgingBench将智能体老化归纳为四种机制:压缩老化(compression aging)、干扰老化(interference aging)、修订老化(revision aging)和维护老化(maintenance aging)。为诊断这些故障,AgingBench使用时间依赖图(temporal dependency graphs)和配对反事实探针(paired counterfactual probes),为记忆管道的写入、检索和利用阶段生成诊断档案。 在7个场景、14个模型、多种记忆策略以及运行者控制和自主智能体上,经过约400次运行(跨越8到200个会话)的结果显示:智能体老化并非一维——行为测试可保持良好,而事实精度衰退;派生状态追踪可能在单个模型内急剧崩溃;同一个错误答案可能根据诊断档案指向的不同需要不同的修复。这些结果表明,可靠的智能体部署需要生命周期评估、机制级诊断和阶段定向修复,而不仅仅是更强的第一天模型。

论文精读

TL;DR AgingBench 首次将 AI Agent 可靠性从“初日”快照拓展为全生命周期属性,系统揭示压缩、干扰、修正、维护四种老化机制,并提供阶段级诊断以指导靶向修复。

问题

问题背景

随着大语言模型驱动的 AI Agent 从单次任务执行转向持久化运行(如个人助理、代码项目管理),长期可靠性 正成为生产部署的核心关注点。当前业界仍以初始化性能作为主要评估标准,忽视了 Agent 在持续交互中的状态演化与能力退化。

现有方法局限

主流基准(如 AgentBench、WebArena)仅测试“第一天”表现,未覆盖部署后的老化效应。即使模型权重冻结,Agent 的有效状态仍会随记忆压缩(遗忘关键信息)、检索干扰(无关记忆污染)、事实修订(更新导致冲突)及维护操作(如索引重建)而累积变化。现有评估缺乏对退化形式的细粒度诊断,无法区分“记错”“想错”还是“用错”,导致修复手段盲目,难以融入工程管线。

技术挑战与重要性

Agent 老化具有多机制纠缠、时序依赖特点,诊断需要构建时序依赖图反事实探测等新工具。这类评估不仅要测量性能下降曲线,还要定位记忆管线的写入、检索、利用三阶段中的故障根因。在自主系统广泛部署的背景下,缺乏生命周期评估将使生产环境面临“静默衰退”风险——行为测试表面正常,但事实精度已崩解,可能引发连锁决策失误。

行业类比

如同自动驾驶系统,初始路测通过后仍需持续监控传感器退化与模型漂移,Agent 的可靠性必须从一次性的基准测试转变为贯穿生命周期的工程属性。

核心洞察

  • **Agent 老化是多维度的系统级退化,而非单一性能衰减**。传统评估仅在部署首日测试模型能力,AgingBench 揭示了即使行为测试保持清洁,事实精度和派生状态跟踪也可能急剧崩溃。这种维度分离提示:仅靠更强的基座模型无法保证长期可靠性,必须对完整 agent 管线进行纵向监测。
  • **老化诊断需从行为观测下沉到组件级归因,才能指导针对性修复**。不同于仅报告性能下降,AgingBench 将记忆管线分解为写入、检索与利用阶段,并通过时间依赖图与反事实探测生成诊断剖面,定位故障发生在哪一阶段。这使得同一错误答案可能对应完全不同的修复策略,为工程化维护提供了可操作的信号。
  • **在冻结模型权重下,agent 的有效状态仍会因历史压缩、记忆增长等动态变化而持续漂移**。该工作率先将压缩老化、干扰老化等机制形式化,并引入压力配置(PressureConfig)来系统性地模拟部署中的累积效应,为构建具备自我维护能力的自主 agent 提供了基准与设计原则。

方法

任务生成:时间依赖图与压力配置

AgingBench 通过 时间依赖图 (Temporal Dependency Graph) 组织 Agent 运行过程中的信息演变。每个场景定义了一系列事实的写入、检索、更新和冲突,形成结构化的会话序列(8–200 次交互)。

  • 写入:在特定会话中注入新事实。
  • 检索:在后续会话中查询这些事实,要求 Agent 从内存中召回。
  • 更新/修订:引入事实修正,测试 Agent 是否仍记住旧版本或产生干扰。
  • 维护:模拟模型升级、系统重启或索引重建等操作,观察可靠性变化。

这些操作由 PressureConfig 控制,包含四种典型老化机制:压缩老化(历史压缩丢失细节)、干扰老化(新信息覆盖旧知识)、修订老化(事实更新后的一致性崩塌)、维护老化(系统维护引入的副作用)。

纵向评估:Aging 曲线与退化检测

Agent 在执行会话序列的过程中,评估指标随时间绘制成 Aging 曲线,而非单点分数。关键指标包括:

  • 事实精确度 (Factual Precision):随时间是否衰减。
  • 派生状态追踪 (Derived-State Tracking):如预算余额等计算状态是否准确。
  • 行为正确性:任务完成度是否保持。

这揭示了“行为测试可能仍然干净,但事实精度已下降”的隐蔽退化。

组件级诊断:内存管线分解与反事实探针

为定位退化来源,AgingBench 将 Agent 的内存管线拆分为三个阶段:

  1. 写入 (Write):将新信息编码进记忆。
  2. 检索 (Retrieve):从存储中召回相关信息。
  3. 利用 (Utilization):使用检索到的信息进行决策。

通过 反事实探针 (Counterfactual Probes) 构造干预:例如,为错误回答提供理想的检索结果,若答案仍错,则故障在利用阶段;若变为正确,则检索阶段有缺陷。由此生成每个 Agent 的诊断档案,指出修复应针对的管线阶段。

方法差异

不同于仅关注首日性能的基准,AgingBench 首次将 Agent 可靠性视为寿命属性,并提供机制级诊断而非单纯的退化检测,有助于实施阶段定向修复。

实验

实验设计

AgingBench 构建了纵向可靠性基准,覆盖 7 个场景、14 个模型、多种记忆策略以及自主/受控 agent,共进行 400+ 次运行(跨 8–200 个会话)。基准通过时间依赖图配对反事实探针,对记忆管线的写入、检索、利用三个阶段进行组件级诊断,系统性测量压缩老化、干扰老化、修订老化、维护老化四种退化机制。

关键发现

Agent 老化并非单一维度衰退:

  • 行为测试保持正确时,事实精度可能已显著下降;
  • 同一模型内派生状态跟踪可能突然崩溃;
  • 相同错误答案需要根据诊断剖面指向的不同阶段,采取针对性修复(例如写入纠正 vs. 检索优化)。 老化曲线在不同场景、模型间差异显著,仅靠“第一天”快照无法预测寿命可靠性。

与基线对比

传统评估仅测量初始性能,遗漏了部署后 agent 动态状态(记忆压缩、更新冲突、例行维护)引入的衰退。AgingBench 首次将可靠性定义为全 agent 系统的寿命属性,而非基模型快照。对比快照式基准,本基准能定位故障所处的具体存储器阶段,为工程修复提供直接依据,推动从“更强的初始模型”转向“更耐久的系统工程”。

行业影响

落地场景

部署了持久化 AI Agent 的产品均可受益于寿命可靠性评估,典型场景包括:

  • 智能客服与虚拟助手:跨多会话维护用户上下文,随时间可能遗忘关键信息或产生幻觉。
  • 代码审查与项目管理 Agent:持续跟踪项目演进,记忆膨胀导致检索失效。
  • 企业知识库 Agent:定期同步更新,需评估事实修订后的连贯性。
  • 内容审核与合规 Agent:策略更新后需验证旧记忆是否干扰新判断。

商业价值

  • 降低运维成本:提前发现 Agent 退化,减少因错误输出带来的业务损失和人工修复开销。
  • 提升服务可靠性:通过生命周期评估,保障长期运行 Agent 的决策质量,增强用户信任,延长 Agent 有效服役时间。
  • 优化资源分配:诊断报告可精确指向记忆管线的写入、检索或利用故障阶段,指导定向修复,避免盲目全量重训,节省算力与时间。

与现有工作流的集成

AgingBench 可作为 MLOps 管线中的健康检查模块

  1. 在 Agent 部署后,定期运行基准测试,生成老化曲线。
  2. 利用时间依赖图反事实探针获得的诊断档案,自动定位退化组件(如压缩器、检索器)。
  3. 结合 CI/CD 流程,当可靠性指标低于阈值时,触发维护或回滚,实现闭环生命周期管理。

具体落地 Use Case

  1. 电商智能导购 Agent:该 Agent 维护用户偏好和购物历史,长期会话中,压缩老化导致对话混淆。通过 AgingBench 评估,发现事实精度随会话数急剧下降,但行为测试仍正常;诊断指向写入阶段压缩比率过高。据此调整记忆压缩策略,提高关键信息的保留周期,使订单推荐准确率回升。
  2. 金融投研知识库 Agent:汇总研报并回答分析师查询。当有大量新研报注入时,发生干扰老化,旧信息被错误覆盖。用 AgingBench 的类型状态覆盖干预,定位到检索阶段加权不当,修正后新旧信息召回平衡,避免错误投资建议。

局限

  • **实验覆盖度有限**:AgingBench 目前涵盖 7 个场景和 14 个模型,尽管在基准中属于较多配置,但所有场景均为合成构造,且代理角色集中在研究助理、生活助手等有限类型。真实部署中代理承受的负载模式、交互频率和环境扰动远比基准中的受控条件复杂,因此 AgingBench 的诊断结论是否能平滑迁移到生产环境仍有待验证。此外,实验的会话长度(8–200)虽展示了老化趋势,但尚未触及某些企业级代理长达数年的运行周期,极端长尾老化模式(如知识库的长期漂移)未被充分捕捉。
  • **诊断工具的通用性有待加强**:论文提出的**时间依赖图**和**反事实探查**依赖于对内存流水线(写入、检索、利用)的显式分解,以及针对每种老化机制的定向干预。然而,并非所有代理架构都提供如此清晰的阶段划分;对于使用隐式记忆(如通过参数记忆的长期上下文蒸馏)或混合检索策略的代理,诊断探针的设计与插桩可能成本高昂,甚至不可行。当前方法默认代理遵循显式的记忆-检索-利用环路,这限制了其在更广泛代理生态中的适用性。
  • **与现有基准的衔接不足**:作为首个聚焦**代理寿命工程**的纵向基准,AgingBench 缺乏与传统单点性能基准(如 MMLU、AgentBench)的直接对比,也没有与近期涌现的代理可靠性评估(如 ToolSandbox 对鲁棒性的测试)建立交叉验证。这使得从业者难以评估老化作为一项独立风险相对于初始能力的重要性,也不容易将 AgingBench 的诊断结果嵌入现有的代理测试管道中,可能阻碍其快速采纳。
论文Jianing Zhu2026-05-25原文

相关内容