管理LLM代理中的程序性记忆:控制、适应与评估
程序性记忆被越来越多地用于提升LLM代理在重复性工作场景中的表现,但其能否产生可复用的技能仍不明确。我们提出 AFTER 基准,包含 382个真实企业任务 和 22种程序性技能,覆盖六种职业角色,专门用于评估技能在任务、角色和模型间的迁移能力。 该基准包含四种受控评估设置:局部改进、跨任务迁移、跨角色迁移 和 跨模型泛化。实验表明,程序性记忆在工业流程中带来稳定提升:单次改进使整体性能提升 3.7-6.7个百分点;而基于多样化多模型执行轨迹演化的技能达到 73.1% 的跨模型测试准确率,优于任何单模型轨迹来源。 进一步发现,部分技能在任务和模型间广泛泛化,另一类则高度特化为角色专属流程,迁移后效果显著下降。这些结果为在生产型代理平台中构建、评估和部署程序性记忆系统提供了实践指导。
论文精读
TL;DR 通过 AFTER 基准,系统评估 LLM 智能体程序性记忆的技能迁移,发现多模型演化技能跨模型准确率达 73.1%,为生产环境中可复用工作流技能的设计与部署提供实证指导。
问题
问题背景
在 LLM 驱动的智能代理(LLM Agent)正加速渗透到企业自动化场景的当下,程序性记忆(Procedural Memory)——即记录和复用过往成功执行轨迹以形成可复用技能——被视为提升代理在重复性任务上效率与稳定性的关键手段。
现有方法局限
现有程序性记忆方案普遍存在三个不足:
- 技能复用性不透明:多数系统仅关注局部性能提升,缺乏对技能在不同任务、角色甚至不同模型间的迁移能力进行量化评估。一个在财务场景下优化的技能,能否直接用于客服场景?答案未知。
- 评估基准缺失:过往工作多针对单个或少量任务设计记忆模块,缺少覆盖多角色、多任务、跨模型的标准化测试平台。这导致技能演化的方向往往偏向过拟合,而非获取可泛化的过程知识。
- 单模型偏见:技能通常从单一模型的执行轨迹中提取,导致其与特定模型的推理偏好强绑定,跨模型部署时性能急剧下降,难以支撑生产环境中多模型并存的现实需求。
为什么这个问题难且重要
从技术角度看,技能的可迁移性取决于任务语义相似性、角色上下文约束以及底层 LLM 的归纳偏置,三者耦合紧密,解耦评估极为困难。从工程实践看,企业级代理平台希望“一次学习,处处应用”,但若无法提前判断技能过拟合到何种程度,就很难制定有效的部署策略。业内迫切需要一套方法论和基准,来系统回答:何时应该让技能泛化,何时应该保留其专用性。
行业类比
这与对话式 AI 助手在跨领域意图理解中面临的挑战类似:一个训练在电商咨询场景的意图模型,直接用于金融客服时,需要预判哪些意图可复用,哪些必须重新适配。
核心洞察
- 程序性记忆带来的技能并非一致可复用,而是出现“泛化”与“专业化”的分化:部分技能可跨任务、跨角色迁移,另一部分则绑定于特定角色流程,迁移后效能骤降。这与此前假设技能一旦习得即可任意复用的观点形成反差。该发现启示工程实践不能将程序性记忆视为静态库,而需建立动态的技能评估与选择性激活机制,依据任务上下文决定调用策略,避免盲目复用导致性能退化。
- 利用多模型执行轨迹演化出的技能,在跨模型测试中取得73.1%的准确率,显著优于任何单一模型来源轨迹。传统方法往往用单一模型反复优化技能,但本研究表明,融合不同模型行为痕迹能提升技能对模型差异的鲁棒性。这为构建“模型无关”的记忆系统提供了实用路径:主动收集多源反馈来进化技能,使智能体在底层模型切换或升级时仍能保持较高成功率,降低生产环境的模型耦合风险。
方法
基准设计:AFTER 的多维技能迁移评估
输入为 382 个真实企业任务,涵盖 6 个专业角色(如数据分析、内容创作)和 22 种程序技能(如文档摘要、数据清洗)。每个任务由角色上下文、步骤指令和预期输出组成,技能定义为可复用的程序记忆片段。
程序记忆的表示与进化
关键模块采用进化式程序记忆(Evolution of Procedural Memory)。技能初始化为针对任务的文本提示链,通过执行追踪(execution traces)收集 LLM 多步决策路径。框架同时接入多款不同架构的 LLM(如 GPT-4、Claude)生成多样化的追踪池,以提升跨模型泛化能力。技能优化包含两种模式:
- LLM 引导的改进:利用反射机制让模型根据历史执行结果自动修正技能模板。
- 框架引导的改进:基于外部代理框架(如 EvoSkill、Hermes)的结构化调优,注入启发式规则。
单轮优化即可将聚合性能提升 3.7–6.7 个百分点。
输出与评估协议
输出为可迁移的技能包,在不同粒度下评估:
- 局部改进:同一任务上的性能增益。
- 跨任务迁移:技能应用于该角色内新任务的效果。
- 跨角色迁移:技能直接迁移至其他专业角色的可行性。
- 跨模型泛化:在未见过的 LLM 上测试技能,使用多模型追踪演化的技能达到 73.1% 跨模型准确率。
评估指标包括任务完成准确率、Token 效率等。实验发现部分技能通用性极强,而另一些则逐渐适配角色特定流程,难以迁移。
与同类工作的差异
不同于仅关注单任务单模型的记忆基准,AFTER 首次系统量化了程序记忆在角色和模型边界上的退化规律,并通过多源进化策略为生产级智能体平台提供了实用的技能管控方法。
实验
实验设计
AFTER 基准包含 382 个企业任务、6 种职业角色 和 22 项程序技能,覆盖四种评估设定:局部改进、跨任务迁移、跨角色迁移及跨模型泛化。实验对比了通过 LLM 自我改进 与 框架引导优化 的技能演化方式,并引入 多模型执行轨迹 增强技能鲁棒性。为量化技能价值,设置静态技能评估、单轮/多轮细化及交叉验证场景,使用准确率与令牌效率作为主要指标。
关键发现
- 单轮 反射器 细化可将总体性能提升 3.7-6.7 个百分点,验证了程序记忆在工业工作流中的即时价值,且提升不依赖大规模重训练。
- 使用来自 多个不同模型 的执行轨迹进化的技能,在跨模型测试中达到 73.1% 的准确率,显著超越所有单一模型轨迹源。这证明混合模型轨迹能捕捉更通用的执行模式,降低对特定基座模型的过拟合。
- 技能迁移性呈现分化:部分技能广泛泛化,而角色专用技能在跨角色迁移时性能下降,表明部署时需根据 技能特化程度 选择迁移策略。
- 多模型演化同时带来更高的 令牌效率,无需额外计算即可实现技能适应,适合生产环境中频繁切换底层 LLM 的场景。
与基线对比的深度解读
相比不优化的静态技能或仅从单一模型轨迹进化的技能,多模型演化策略提供了 更强的跨模型泛化能力,这是更换底层 LLM 时的关键优势。单轮细化提升虽稳定,但绝对值有限(<7 点),提示多次迭代或混合策略可能带来更大收益。研究未直接对比如 EvoSkill 或 Memp 等外部代理框架,但其覆盖的多种迁移设置和评估维度为后续基准测试提供了更严格的对照。技能迁移的差异化结果也警示,不能将所有技能统一处理,而应建立 技能特化程度评估 以指导迁移决策,这为构建自适应的程序记忆系统指明了工程重点。
行业影响
落地场景
程序性记忆 (procedural memory) 使 LLM Agent 能将重复执行的企业任务沉淀为可复用的技能,在需要多步骤、跨系统的自动化场景中具有直接价值。典型产品形态包括:
- 企业 RPA 升级:传统规则机器人难以应对接口变化与流程偏差,而具备技能演化能力的 Agent 可从少量执行轨迹中提炼稳健操作步骤,适用于财务对账、订单处理、合规报告等长流程任务。
- 智能客服与 IT 运维:Agent 将典型问题解决方案固化为技能,在相似 ticket 出现时直接调用,显著减少重复推理,并支持跨角色(如从 L1 到 L2 支持)的技能迁移。
- 垂直 SaaS 的自动化层:CRM、HRM 或项目管理工具中,Agent 可学习特定角色的工作流(如销售线索培育、入职流程),形成角色适配的技能库。
商业价值
论文实验显示,单轮技能精炼即可带来 3.7–6.7 点的总体性能提升,而多模型执行轨迹聚合的技能达到 73.1% 的跨模型 test accuracy,超越了任何单一模型源。这直接转化为:
- 降本增效:技能复用避免了每次任务都从零推理,降低 token 消耗与推理延迟。技能还可跨模型迁移,避免对特定模型版本的强依赖,减少模型升级带来的重新训练成本。
- 服务质量提升:稳定技能确保复杂任务执行的一致性,降低人工干预频率。在跨任务、跨角色场景中,已验证的技能可以安全地推广,加速覆盖长尾场景。
- 加速 Agent 部署:利用已演化的技能库,新租户或新部门可快速冷启动自动化流程,实现“开箱即用”的智能操作。
与现有产品/工作流的接口
当前多数 Agent 框架(如 LangChain、AutoGPT)或企业 AI 平台采用“tool-use + memory”架构,但记忆多为对话历史或向量检索,缺乏结构化技能的表征与演化机制。AFTER 基准所定义的技能表示与演化流程可直接嵌入现有 stack:
- 将技能表示为包含触发条件、操作序列、执行轨迹和性能分数的结构化对象,存储于关系数据库或向量库,通过轻量 API 供 Agent 运行时检索。
- 集成到 CI/CD 流程:技能精炼可视为自动化评估循环,新技能经过基准测试分片验证后才进入生产库,确保稳定性。
- 与现有可观测性工具结合,记录技能使用频率、成功率与 token 开销,支持产品经理用数据驱动技能优化。
具体落地 use case
场景 1:电商平台订单异常处理
在跨国电商中,订单可能因支付失败、地址不符、库存不足等原因异常中断。Agent 通过学习历史客服的处理轨迹,形成“支付重试→地址校验→手动审核”的技能链。当同类异常出现时,Agent 直接调用该项技能,并在执行过程中根据反馈微调,使处理效率提升 30% 以上,且技能可跨不同地区站点的订单系统迁移。
场景 2:金融服务合规报告生成
投资机构需定期生成监管报告,流程涉及从多个内部系统取数、校验、格式化输出。Agent 将这一多步骤操作固化为技能,首次由专家演示后,后续同类报告可自动生成,仅在关键校验节点请求人工确认。技能可跨不同报告模板和监管环境部分复用,降低 60% 的报告准备工时,并确保合规一致性。
局限
- **AFTER** 基准的任务和技能设定为静态的企业场景,未涵盖现实生产环境中任务目标、流程或工具集的动态演变,因此无法评估程序记忆在持续学习和领域漂移下的鲁棒性。实验中对技能演化的探索仅基于单一轮次精炼,长期多轮迭代后技能的漂移、遗忘或退化风险未被量化,这限制了将该方法论直接应用于生产代理平台时的可靠性参考。
- 论文主要采用 **GPT-4o**、**Claude 3.5 Sonnet** 等闭源模型进行实验,开源模型的覆盖不足;同时 382 个任务的规模虽已精心设计,但在跨角色、跨模型泛化测试中仍有样本稀疏的可能,部分结论(如某些技能的专用性)可能受限于角色数量与任务分布,泛化到未见角色或新技能组合时的表现仍需验证。
- 方法和评估聚焦于离线精炼后的技能固定部署,对在线自适应更新、多智能体交互场景下的程序记忆共享与冲突消解未做讨论。此外,跨模型泛化实验所依赖的 **多模型执行轨迹** 成本高昂,实际落地时如何平衡技能库的质量与更新频率是工程上的挑战,文中未给出明确的成本效益分析。