Mem-π: 通过学习何时生成与生成什么的自适应记忆
现有基于记忆的智能体通常依赖从情节记忆库或技能库中基于相似性检索返回静态条目,这些条目往往与当前上下文不匹配。为此,我们提出 Mem-π 框架,为大型语言模型(LLM)智能体提供自适应记忆:在需要时按需生成有用指导,而非从外部记忆存储中检索。 Mem-π 使用一个专用的语言或视觉-语言模型(其参数独立于下游智能体),基于当前智能体上下文联合决策何时生成指导以及生成什么指导。我们采用决策-内容解耦强化学习目标训练该模型,使其能够在生成无帮助时选择放弃,否则生成简洁有用的指导。 在涵盖网页导航、基于终端的工具使用和基于文本的具体交互等多种智能体基准测试中,Mem-π 持续优于基于检索的方法和先前经过强化学习优化的记忆基线,在网页导航任务上取得 30% 以上的相对提升。
论文精读
TL;DR Mem-π 用独立模型按需生成上下文相关的 Agent 指导,并通过决策-内容解耦 RL 训练使其自主判断何时生成,在 Web 导航等任务中显著超越检索式记忆。
问题
问题背景
LLM 驱动的自主智能体(agent)在复杂交互任务中表现出色,但无状态特性导致其无法跨轮次积累可复用的经验。为弥补这一缺陷,研究者广泛引入外部记忆模块,如情景记忆库(episodic memory bank)或技能库,存储过往成功轨迹或抽象技能,以便在后续任务中检索辅助决策。
现有方法的局限
主流方案依赖基于相似度的静态检索:将当前观测或指令编码后,从记忆库中召回最相似的条目直接注入代理上下文。这种做法存在三重根本缺陷:
- 上下文错配:检索到的静态条目是过去特定场景的固化产物,难以泛化到当前细粒度的任务变体或环境动态,经常提供误导性信息。
- 决策与内容耦合度低:记忆仅按相似度打分,无法判断在“当前这一步”是否真正需要记忆介入;不必要的检索反而引入噪声,干扰代理原有推理链。
- 生成能力缺失:检索只是搬运已有片段,无法根据当前上下文重构或抽象出新的指导,导致知识的复用停留在表面匹配,而非深层理解。
为什么这个问题难且重要
构建真正自适应的记忆面临两大技术挑战:一是 “何时干预”——模型必须具备情况判断能力,能在误导性介入与沉默之间做出取舍;二是 “如何生成”——即便决定介入,记忆模块需要生成紧凑、任务相关的指引,而非长篇大论或套话。这两者相互依存:如果生成策略不够精确,模型很可能倾向于总是生成(over-generate),从而抵消记忆的价值。业界对自主代理(如计算机操作代理、深度研究助理)的需求急剧增长,静态记忆方案已明显制约成功率与效率的进一步提升。RL 优化记忆策略虽然先进,但通常将决策(是否生成)和内容生成绑定在同一奖励信号下,导致优化困难、策略退化。
行业类比
如同 AutoGPT 类代理中,通用知识检索往往会返回过时或无关的 API 文档片段,迫使工程师不得不手工构建领域专用的工具描述模板——自适应记忆相当于让模型自己学会何时查阅、何时现编一份定制化的操作手册。
核心洞察
- **从检索到生成的范式转变,使记忆不再被静态存储限制**:传统方法通过相似度检索外部记忆库,返回固定条目,但常与当前任务上下文错配。Mem-π 将记忆建模为生成式策略,由独立模型按需产生上下文专属的指导,并且通过弃权机制仅在有利时介入,从根本上避免了检索噪声和无关干扰,为 agent 提供了更灵活、精准的记忆能力。
- **决策-内容解耦的强化学习,让模型学会何时沉默**:以往 RL 优化记忆往往只考虑最终任务奖励,容易迫使模型在无关时刻也生成冗余信息。Mem-π 明确将“是否生成”和“生成什么”的奖励解耦,训练模型能够自主弃权,只在有助于下游任务时给出简洁指导,从而显著降低无效交互,提升整体效率和对齐程度。
方法
输入与记忆策略建模
Mem-π 接收智能体的当前交互上下文作为输入,包括任务描述、环境观察(文本或图像)、历史动作序列等,不依赖外部记忆库检索。框架的核心是一个专用的记忆策略模型(独立于下游智能体的 LLM 或 VLM,拥有自己的参数),它被训练为直接生成上下文相关的指导(guidance)而非从静态库中查找。
关键模块:决策-内容解耦的生成式记忆
记忆策略执行两步联合推理:
- 决策输出:模型首先生成一个控制 token(如
<generate>或<abstain>),表示当前是否需要提供指导。 - 内容生成:若决策为生成,则随后输出简洁的、任务相关的指导文本;若弃权则不输出内容,智能体独立行动。
整个流程由同一个模型完成,但训练时将决策与内容显式分离,以便优化。
训练流程:Adaptation Distillation + Decision-Content Decoupled RL
Adaptation Distillation(适应蒸馏)
从专家示范或高质量交互记录中提取“上下文-指导”对,用监督微调让策略模型初步学会在适当情境下生成有效指导,并吸收弃权行为(例如在不需要指导的地方标记为弃权)。这为后续 RL 提供稳定的初始化。Decision-Content Decoupled RL(决策-内容解耦强化学习)
在此阶段,模型在任务环境中在线交互,根据最终任务成功率和指导质量获得奖励。奖励函数被解耦为两部分:- 决策奖励:鼓励在指导有用时生成、在指导无用或冗余时弃权,惩罚错误干扰。
- 内容奖励:评价生成指导的实际效用(如是否提升任务完成效率或成功率)。 通过策略梯度(如 PPO)联合优化,模型学会自适应平衡“何时生成”与“生成什么”,避免无关记忆的负面影响。
输出与集成
记忆策略的输出(弃权或指导文本)直接插入下游智能体的提示(prompt),作为前置线索引导其推理与动作决策,框架保持轻量且与具体智能体架构解耦。
与同类方法的核心差异:传统检索式记忆(如从情节记忆库按相似度查询)返回静态、上下文无关的片段,易造成误导;其他 RL 优化记忆方法则未显式分离决策与内容,训练信号混杂。Mem-π 通过生成式策略 + 决策-内容解耦 RL,实现按需生成且能主动弃权的自适应记忆,显著提升了跨环境鲁棒性。
实验
实验设计
Mem-π 在三个不同领域的 agent 基准上进行评估:Web 导航(如 MiniWoB++/WebArena 风格任务)、终端工具使用 以及 文本化具身交互。实验采用下游 agent 冻结、仅微调独立的记忆策略模型的范式。该记忆模型(语言或视觉-语言模型)通过 决策-内容解耦强化学习 训练:奖励函数分别鼓励正确的生成时机决策和内容的有用性,且允许策略选择 不生成(abstain)以避免噪声。基线包括传统的基于相似度检索的 episodic memory bank、skill library,以及先前基于 RL 优化但无决策-内容解耦的记忆方法。
关键发现
- 一致性领先:Mem-π 在所有基准上均优于检索式记忆基线,Web 导航任务相对提升超过 30%,整体平均相对提升超过 20%。
- 自适应生成质量:模型学会了在上下文无需记忆指导时主动 abstain,有效减少了无关信息对 agent 的干扰;而当生成时,输出的指导简洁且任务相关。
- 解耦训练的重要性:消融实验表明,将决策优化与内容优化解耦能显著提升性能,单独优化任一目标都会导致性能下降。
- 跨模态泛化:框架在纯文本与多模态(视觉-语言)记忆模型上均表现良好,显示出对感知输入的鲁棒性。
与基线对比的深度解读
现有检索式记忆系统依赖固定存储条目,其相似度匹配在动态上下文中经常产生 不一致的静态经验,从而误导 agent。Mem-π 通过条件生成完全解决了该问题——记忆内容与当前状态严格对齐。与先前 RL 优化的记忆方法相比,Mem-π 的决策-内容解耦设计避免了两者联合优化时的相互干扰:模型可以单独优化“何时生成”而不损害“生成什么”,反之亦然。这带来两大实际收益:① 在难以利用外部知识的场景下,abstain 机制防止了幻觉式指导;② 解耦训练使奖励信号更聚焦,收敛更快且更稳定。从工程角度看,将记忆作为独立微调的生成策略,不仅解耦了升级成本(可单独替换记忆模型),还便于注入领域知识,比修改整个 agent 更灵活。
行业影响
落地场景
Mem-π 通过独立模型按需生成上下文相关的指导,可广泛应用于需要长期记忆与经验积累的 LLM 智能体系统:
- 企业级 RPA 与流程自动化:在 Web 导航、终端工具调用等任务中,Mem-π 能动态生成操作提示,替代静态 skill 库,使自动化流程适应界面变更。
- 对话式 AI 与客服智能体:在多轮交互中积累用户偏好与问题解决经验,按需生成个性化建议,提升问题解决率。
- 科学研究辅助与知识工作:在文献检索、实验设计等长周期任务中,生成中间步骤的引导,避免重复试错。
- 交互式产品推荐与电商导购:根据用户历史行为和实时意图,动态生成推荐理由或搭配建议,而非简单检索相似商品。
商业价值
- 降低记忆维护成本:传统 memory bank 需持续清理与重训,Mem-π 的生成式策略能适应环境变化,减少人工维护开销。
- 提升智能体成功率与效率:在 Web 导航等任务上相对提升超 30%,直接转化为更少的人工介入、更快的任务完成速度,适合大规模 SaaS 部署。
- 改善用户体验:生成的指导更贴合当前上下文,避免不相关记忆检索造成的错误操作或答非所问,提升用户信任与留存。
与现有产品工作流的集成
Mem-π 作为独立参数模型,可无缝嵌入当前 LLM 智能体架构:
- 插件式部署:在下游 agent 调用前,通过 API 调用 Memory LLM 生成
guidance,再注入 prompt 或作为 system instruction,与 LangChain、AutoGPT 等框架兼容。 - 训练流水线:采用决策-内容解耦 RL 训练,可复用现有 agent 交互数据,通过 abstention 机制保证仅在需要时介入,不影响 agent 原有推理链。
- 多模态扩展:原生支持 VLM,可与视觉 grounding 模型配合,用于 GUI 操作智能体等场景。
具体场景示例:
- 电商客服智能体:当用户咨询商品时,Mem-π 根据历史对话和当前查询,生成一条简短的推荐话术(如“该用户曾关注降噪耳机,可优先推荐新品 WH-1000XM6,并强调续航提升”),而非仅检索相似案例。
- 医疗文献分析辅助:研究者使用 LLM 进行文献综述,Mem-π 根据已阅读的论文生成下一步检索方向或实验设计提示,减少无效阅读。
局限
- - **计算与部署开销**:Mem-π 使用与下游代理分离的专用模型(语言或视觉语言模型)来生成记忆指导,这增加了系统的整体参数规模和推理延迟。与传统的检索式记忆(仅需向量相似度搜索)相比,前向生成需要额外的模型调用,对实时性要求高的应用场景可能不适用。论文未提供推理时间和硬件开销的详细对比,实际部署时需要权衡性能提升与额外成本。
- - **训练依赖特定奖励设计**:决策-内容解耦的 RL 训练需要精心设计奖励函数以区分“何时生成”和“生成什么”,并在多样化的 agent 环境中保持一致。论文仅在有限类型的基准(web 导航、终端工具、具身交互)上验证,这些环境的奖励相对结构化;对于开放域、长程规划任务,奖励的稀疏性和对齐难度可能显著增加,限制方法的通用性。
- - **记忆模型泛化边界待验证**:尽管 Mem-π 在三个领域展示了强性能,但其记忆策略是否能在完全不同的任务族(如代码生成辅助、多轮对话管理)中迁移,仍需进一步研究。检索式方法通过更新记忆库即可适应新领域,而 Mem-π 可能需要针对新环境微调(甚至重新训练)专用记忆模型,其零样本泛化能力尚未评估。