Agent Memory Distillation:用层级教师记忆赋能小型LLM智能体
记忆系统在提升智能体(agent)性能方面已展现出潜力,但对于小型语言模型(small language models)而言,其潜力尚未得到充分探索——小模型难以自行生成足够多的成功轨迹。 为此,我们提出 Agent Memory Distillation (AMD),一种无需训练的框架,通过层级记忆(hierarchical memory)将结构化知识从大型教师智能体迁移至小型学生智能体。AMD 从成功的教师轨迹中构建三种互补记忆:Workflow memory 编码任务级策略;Subtask memory 在中间粒度提供具体行为示例;Function memory 捕获每个函数的调用约定与常见陷阱。在推理时,Workflow 与 Subtask 记忆在任务开始时主动注入,Function 记忆则在工具调用出错时被动态检索。 我们在三个工具使用基准(AppWorld、BFCL V3、ToolSandbox)上,以 GPT-5-mini 为教师,对四个学生模型(4B-8B参数)进行评估。AMD 平均准确率分别提升 27.2%p、11.2%p 和 3.4%p,一致优于现有基于记忆的基线方法。进一步分析表明:Subtask memory 贡献最大;教师有效性同时取决于教师能力与学生兼容性;4B 规模的学生模型获益最多。
论文精读
TL;DR Agent Memory Distillation 从大教师 agent 的成功轨迹中提炼 Workflow、Subtask、Function 三级记忆,无需训练即让小模型显著提升工具调用能力,平均准确率最高提升 27.2%p。
问题
问题背景
LLM 驱动的工具调用智能体正成为自动化工作流的核心,但大模型高昂的推理成本和延迟促使业界探索将能力压缩到小型模型(如 4B–8B 参数)的工程路径。
现有方法局限
现有记忆系统(如 Reflexion、MemGPT)虽能提升 agent 性能,却依赖 agent 自身生成大量成功轨迹作为记忆库。小模型受限于推理和规划能力,难以产出足够的高质量轨迹,导致传统记忆方法失效。同时,知识蒸馏方案(如 logit 级蒸馏或 fine-tuning)需要重新训练学生模型,不仅增加工程开销,还会丢失工具调用的结构化知识(如 API schema、步骤顺序)。此外,多数记忆方案采用单一粒度(仅保存完整轨迹或函数调用),忽略了任务层面Workflow 策略、中间粒度子任务行为和细粒度函数陷阱的互补价值。
为什么这个问题难/重要
将大模型的工具使用能力迁移给小模型面临三重技术挑战:
- 错误累积:工具调用存在严格 schema 和顺序依赖,小模型单步错误会引发级联失败;
- 多层次知识需求:同一任务需同时掌握全局规划(何时调用哪个工具)、步骤衔接(如何处理中间结果)和细节惯用(避免常见参数错误);
- 小模型容量瓶颈:低容量模型对长上下文敏感,记忆注入必须高度精简且按需触发。
该问题直接关系到边缘部署、低延迟交互和成本敏感场景,是 LLM 从实验室走向大规模工程落地的关键隘口。
行业类比
类似将大规模推荐系统的“专家策略”蒸馏为移动端轻量模型,Agent Memory Distillation 通过层次化记忆把大模型工具调用经验赋予小模型,在低资源环境中维持任务成功率。
核心洞察
- 小模型智能体无需训练即可通过分层记忆蒸馏获得显著工具调用能力提升。与传统知识蒸馏需在 logits 层面训练不同,Agent Memory Distillation(AMD)直接在推理阶段将大模型成功轨迹转化为 Workflow、Subtask、Function 三类记忆并注入小模型,解决了小模型因能力不足难以自主探索的问题。相比现有记忆增强方法(如 Reflexion 仅存经验池),AMD 的分层结构实现了不同粒度的记忆精准检索与注入,更契合工具调用任务的复杂层次。
- Subtask memory 的贡献最大,表明中间粒度的行为范例对小模型至关重要。消融实验显示,移除 Subtask memory 会导致最大性能降幅,其效果远超 Workflow(仅提供任务级策略)和 Function(仅提供函数调用规范)。这揭示出小模型无法仅靠高层规划或底层格式说明完成复杂交互,需要包含具体步骤和上下文的情境化行为示例来引导模仿,为设计轻量级智能体记忆系统提供了明确的粒度量指导。
- 教师模型与学生模型的兼容性是蒸馏效果的关键,而非单纯追求教师能力。实验发现,教师能力提升并不必然带来学生性能增益,若教师推理风格或记忆表示与学生模型不匹配,反而可能引入噪声。该发现挑战了“越强的教师越好”的直觉,提示在实际部署小模型智能体时,应优先选择推理模式与学生对齐的教师,以最大化记忆迁移的效率与稳定性。
方法
输入
- 教师代理轨迹:大模型(如 GPT-5-mini)在目标任务中成功执行的历史(包含计划、工具调用序列、最终结果)。
- 学生代理:待提升的小模型(4B–8B 参数),无需对其微调。
- 任务定义:含可用工具 API、任务描述、环境反馈接口。
关键模块
1. 层次化记忆生成 从教师轨迹中抽取三种互补记忆,覆盖不同粒度:
- Workflow 记忆:任务级的抽象策略,描述完成某类任务的高层步骤与决策分支。
- Subtask 记忆:中间粒度的行为示例,将轨迹按子目标切分,保留“观察→操作”对,提供可模仿的具体动作序列。
- Function 记忆:细粒度的工具使用规范,记录每个 API 的参数要求、常见错误模式及修正方式。 所有记忆均以自然语言组织,可灵活插入上下文。
2. 混合注入与检索
- 主动注入:任务开始时,将相关的 Workflow 和 Subtask 记忆直接拼入学生代理的系统提示或初始对话,为其提供静态的决策框架和示范。
- 被动注入:仅当学生代理在工具调用阶段触发错误(如参数非法、API 名称错误)时,实时检索相应的 Function 记忆,追加到当前上下文,帮助即时纠偏。
输出
学生代理结合注入的记忆与自身推理能力,生成更准确的计划与工具调用,最终输出任务完成结果。整个过程不修改模型权重,完全依赖上下文工程。
与同类方法的差异
不同于传统知识蒸馏(需训练学生模型)或单一记忆库(缺乏粒度分层),AMD 通过 层次化记忆+主动/被动双模式注入 在无训练范式下高效转移教师经验,尤其放大了 Subtask 记忆的示范效应。
实验
实验设计
基于三个工具使用基准(AppWorld、BFCL V3、ToolSandbox)评估 Agent Memory Distillation (AMD) 框架。使用 GPT-5-mini 作为教师代理,在四个参数规模为 4B–8B 的学生模型上进行 zero-shot 蒸馏,生成 Workflow、Subtask、Function 三类层次化记忆。Workflow 与 Subtask 记忆在任务启动时主动注入,Function 记忆在工具调用错误时被动检索。对比对象包括无记忆学生、教师模型及现有记忆类方法。
关键发现
- Subtask 记忆贡献最大:消融实验表明中间粒度的行为示例对性能提升最关键。
- 教师有效性取决于能力与兼容性:并非教师越强效果越好,需考虑学生模型的理解适配度。
- 4B 小模型受益最明显:AMD 对极轻量级代理的提升幅度最大,证明层次化记忆能弥补小模型生成轨迹不足的短板。
- 准确率提升显著:在 AppWorld 上达 +27.2%p,BFCL V3 上 +11.2%p,ToolSandbox 上 +3.4%p,部分场景让学生代理达到甚至超越教师水平。
基线对比深度解读
AMD 一致 优于已有记忆类基线,核心优势在于:
- 结构化分层记忆 将任务策略、行为实例与细粒度调用陷阱分离,检索精准度高于传统扁平记忆。
- 训练无关 避免了对小模型进行昂贵微调,仅通过记忆注入即实现知识迁移,工程部署成本极低。
- 交互效率高:相对于多次工具调用试错,主动注入正确的记忆减少了无效交互,提升了小模型的首次成功率。该框架为资源受限场景下的小模型代理提供了可落地的知识继承方案。
行业影响
落地场景
Agent Memory Distillation (AMD) 将大型教师 agent 的层次化记忆蒸馏到小型学生 agent,特别适合资源受限的端侧或边缘部署场景。可落地的产品/业务包括:
- 智能助手与对话式 AI:在移动设备上运行的工具调用 agent,能够根据用户指令完成复杂任务(如订餐、行程规划),无需依赖云端大模型。
- 企业自动化流程:ERP、CRM 或 RPA 系统中的 agent,通过记忆历史成功操作序列,快速适应新的业务流程,减少对开发者手工编写规则的依赖。
- 定制化教育/培训模拟器:在专业领域(如医学、法律)构建交互式 agent,通过教师 agent 的示范路径,指导小模型按规范执行任务。
商业价值
AMD 直接面向降本增效:
- 推理成本大幅降低:4B–8B 的学生模型取代大型教师模型(如 GPT-5-mini),在保持相当性能的前提下,降低 API 调用或自建推理集群的成本。
- 离线/隐私场景可用:小型模型可本地运行,避免数据外传,适合金融、医疗等高隐私领域。
- 提升开发效率:训练零成本的记忆蒸馏,允许快速迭代改进 agent 行为,无需重新训练或微调。
与现有产品/工作流的接口
AMD 作为训练无关框架,可灵活插入现有 agent 工作流:
- 在 agent 编排层(如 LangChain、AutoGen)中,将 Workflow/Subtask 记忆注入系统消息,Function 记忆作为工具调用的异常处理库。
- 记忆存储可使用向量数据库(如 Chroma、Pinecone)结合元数据过滤,实现高效检索。
- 与现有的 RAG 流水线 互补:RAG 提供事实性知识,AMD 提供过程性知识(如何完成一个任务)。
具体落地 Use Case
电商智能客服 Agent
用户要求“帮我退换一周前购买的破损商品”。教师 agent 记录下成功路径:查询订单 → 验证退换策略 → 生成退货标签 → 通知仓库。AMD 将这一 Workflow 和 Subtask 注入 8B 学生模型,使其在手机端即可自动完成退换货流程,无需人工客服介入。遇到“物流接口参数错误”时,Function 记忆触发修正提示,保证鲁棒性。金融合规报告生成 Agent
投行分析师需要定期生成持仓合规报告。教师 agent 示范了数据抽取、模板填写、检查清单调用的完整步骤。AMD 提取记忆后,部署在本地工作站上的小模型(如 4B 量化版)可自动完成报告初稿,仅在关键合规节点要求人工复核,既保护客户隐私,又将处理时间从小时级降至分钟级。
局限
- 教师依赖与轨迹质量:AMD 假设教师 agent 能生成足够的高质量成功轨迹,而实际中教师可能出错,轨迹噪声会直接影响记忆质量。论文提到教师效能取决于其能力和学生兼容性,但未探索教师失败率高或轨迹稀疏时的稳健性。此外,记忆构建需针对特定基准收集轨迹,跨域迁移可能需重新生成,可复用性有限。
- 上下文窗口与检索效率:所有记忆以文本形式注入 prompt,随着记忆体量增长,可能超出学生模型的上下文限制,尤其对 4B 的小模型(上下文窗口通常较小)构成挑战。论文虽分析检索数量影响,但未深入讨论长对话或多步任务中记忆累积导致的 token 溢出问题。Function memory 的被动检索机制依赖错误触发,可能因早期错误传播而降低效率。