论文

AutoMem:作为认知技能的记忆自动化学习

AutoMem:作为认知技能的记忆自动化学习

记忆管理可以被视为一种可学习的技能,类似于认知科学中的元记忆能力——知道编码什么、何时检索以及如何组织知识。我们提出AutoMem框架,将文件系统操作提升为与任务动作并列的一等记忆动作,让模型自主决定如何管理其记忆。这一记忆技能沿两个维度提升:支持记忆的结构(提示、文件模式、动作词汇)和模型运用该结构的熟练度。两个维度都难以手动优化:长期任务中的情节运行数千步,一个记忆错误可能在很久后才显现,人工审查完整轨迹不现实。 AutoMem自动化两个维度的优化。第一循环中,一个强LLM审查完整智能体轨迹并迭代修订记忆结构,该结构塑造智能体与其记忆文件的交互方式。第二循环中,从多个情节中识别智能体自身良好的记忆决策,并将其作为训练信号直接提升模型的记忆熟练度。 在三个程序化生成的长期游戏(Crafter、MiniHack和NetHack)中,仅优化记忆而不修改模型的任务动作行为,就将基础智能体的性能提升了约2倍至4倍,使一个32B开源模型与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。 结果表明,记忆管理是一种独立可学习的技能,也是长期任务中产生巨大收益的高杠杆目标。

论文精读

TL;DR AutoMem 将记忆管理视为可训练的认知技能,通过两个自动化循环分别优化记忆结构与模型熟练度,在不改任务行为的情况下,让 32B 开源模型在长时程游戏中性能提升 2-4 倍,媲美前沿大模型。

问题

问题背景

大语言模型(LLM)在执行长周期任务时,常因上下文窗口有限或信息遗忘而失败,因此需要引入外部记忆模块。记忆管理逐渐被视为独立于任务执行的关键能力,来自认知科学中的元记忆(metamemory)概念——何时编码、如何检索、怎样组织知识。

现有方法局限

当前记忆系统主要依赖人工设计的记忆结构(固定schema、检索策略),缺乏自适应优化能力:

  • 结构固化:记忆文件格式、操作词汇需专家凭经验定义,难以随任务演化。
  • 能力割裂:记忆更新(write/retrieve)与任务推理分开处理,模型无法自主学习最优记忆策略。
  • 反馈缺失:长轨迹中记忆错误可能延迟爆发,人类难以完整回放并修正数千步的决策。

为什么这个问题难 / 重要

记忆管理的双重挑战在于:

  1. 结构优化:提示词、文件 schema、动作空间需随任务迭代调整,手工调参不可行。
  2. 熟练度训练:模型需从自身历史中识别正确记忆决策作为训练信号,但优良记忆轨迹不易自动标定。

业界对长程自主智能体(如虚拟世界探索、代码库维护、科学实验设计)需求强烈,记忆能力直接决定其任务完成度与泛化性,因此将记忆作为可学习技能而非固定组件,具有高杠杆价值。

行业类比

类似自动驾驶的规划模块——早期的模块各自手工规则,而端到端系统让规划行为与感知、控制共同优化,记忆管理也需要从外部辅助升级为模型自身可优化的技能。

核心洞察

  • 将记忆管理视为可独立训练的认知技能,而非附加组件:AutoMem 将文件系统操作提升为与任务动作同级的“第一公民”,使模型自主决定如何编码、检索与组织记忆。这不同于多数工作把记忆当作固定的外部存储或硬编码的读写策略,而是通过两个自动化循环分别优化记忆结构(prompt、schema)和记忆熟练度(从轨迹中挖掘正确决策作为训练信号),让记忆成为可进化、可专项提升的能力维度,完全脱离对人工设计规则的依赖。
  • 记忆结构优化与记忆熟练度训练的双循环解耦:AutoMem 用强模型审查完整轨迹来迭代修正记忆支架(outer-loop 1),再用代理自身的良好记忆决策来直接微调模型(outer-loop 2),两条轴线独立自动化。这避免了以往工作要么只改 prompt 要么只靠检索增强的片面性,且巧妙绕开了长程任务中单步记忆错误难以归因、人工审查不可行的痛点。实验证明,仅优化记忆而不改任务动作,就能让 32B 开源模型性能提升 2-4 倍,逼近 Claude Opus 4.5 等前沿系统,揭示出记忆管理是长程任务中极高杠杆的优化目标。

方法

AutoMem 将记忆管理视为可学习的认知技能,通过内外双层自动化循环,分别优化 记忆结构 (memory scaffold)模型记忆熟练度 (memory proficiency),两者协同提升 LLM 智能体在长程任务中的表现。

内循环:文件系统作为记忆动作空间

基础智能体 (inner-loop agent) 在任务动作之外,直接暴露文件系统原语 读、写、查询 作为一等记忆动作。它自主决定何时编码信息、组织文件内容、检索历史知识,无需人工预设记忆规则。初始记忆结构包含提示模板、文件模式 (schema) 及动作词汇,定义智能体与记忆的交互方式。

外循环 #1:自动进化记忆支架

一个更强的 meta-LLM 审查完整智能体轨迹(含数千步任务与记忆操作),自动诊断记忆失误(如关键信息遗漏、错误写入、检索失败),并迭代修订记忆结构:

  • 调整提示措辞,加入显式的“先检索再写入”等记忆纪律
  • 精简或扩展文件模式,适应不同环境的记忆需求
  • 优化动作词汇,减少歧义 每次修订后,智能体在新结构下重跑任务,meta-LLM 继续分析,形成闭环。经多轮进化,支架从初始通用版演化到环境专属的高效结构(如 Crafter v0→v5)。

外循环 #2:记忆决策的监督训练

从大量 episode 中自动识别智能体正确的记忆决策(如在恰当时机将关键状态持久化到文件),将其抽取为 (上下文, 正确记忆动作) 对,用于微调基础 LLM。此过程只增强记忆操作的熟练度,不改变任务动作分布,使模型内化“先检查记忆再决策”的 memory discipline,成为记忆专家。

关键差异

与依赖固定检索机制或纯上下文窗口的方法不同,AutoMem 将记忆本身当作独立可训练技能,同时自动优化“如何记忆”(结构)和“能否记好”(模型能力),两者形成互补增益,且在长程任务中无需人工标定轨迹。

实验

实验设计

实验在三个程序生成的长程游戏环境 CrafterMiniHackNetHack 上进行,基础 agent 为 32B 开源 LLM,通过文件系统操作执行记忆动作。AutoMem 包含两个自动化优化循环:

  1. 外循环 1:强 LLM 审查 agent 完整轨迹,迭代优化记忆支架(prompt、文件 schema、动作词汇)。
  2. 外循环 2:从大量 episode 中识别 agent 自身的正确记忆决策,作为训练信号微调模型,提升记忆熟练度。 优化仅针对记忆行为,不修改任务动作。对比基线为无记忆的同一基础模型。

关键发现

  • 记忆管理是高杠杆独立技能:仅优化记忆(不改变任务动作)使基础 agent 性能提升约 2× 至 4×,使 32B 开源模型达到 Claude Opus 4.5Gemini 3.1 Pro Thinking 等前沿系统的水平。
  • 双层优化互补:在外循环 1 优化记忆支架后,外循环 2 追加训练记忆专家(memory specialist)能进一步提升性能。
  • 自动化的必要性:长程任务单次失误可能在数千步后才暴露,人工审查完整轨迹几乎不可行,AutoMem 的自动化循环有效规避了手工调参瓶颈。

与基线对比的深度解读

基线 agent 缺乏有效记忆管理,难以在复杂环境中保持长期一致性。AutoMem 通过将文件系统操作升级为 一等记忆动作,使得模型能自主决定何时写入 / 读取 / 组织记忆。这种设计将记忆元认知(metamemory)概念工程化,使记忆策略可通过数据驱动方式进化。与仅依赖提示工程或固定记忆模块的方法相比,AutoMem 的动态记忆架构更适应环境变化,并在不扩大模型参数的情况下大幅提升长程任务表现,为后续研究提供了新的优化维度——将记忆作为独立可训练技能,而非静态附件。

行业影响

落地场景

AutoMem 的思路——将记忆管理建模为可通过轨迹反馈自动优化的认知技能——直接适用于所有依赖长程智能体的产品场景。典型的业务线包括:

  • 智能客服与个人助理:跨多轮对话维护用户意图、历史操作与个性化偏好,避免上下文丢失。
  • 代码开发智能体:在复杂重构任务中自动记录设计决策、已尝试的方案及其结果,减少重复探索。
  • 自动化运维与流程挖掘:在数千步的诊断/修复序列中保存关键状态与恢复点,提升容错率。

商业价值

核心价值在于将人工调参的负担转为自动化搜索,显著降低部署长程智能体的总拥有成本 (TCO):

  • 降本:免除为每个任务手写 prompt 架构、文件模式与动作词汇;外层循环的自动审查替代了昂贵的人工轨迹审核。
  • 增收/体验提升:实验表明仅优化记忆即可带来 2×–4× 的任务性能提升,使开放权重模型逼近顶尖商用系统,直接转化更高的任务完成率与用户满意度。
  • 新杠杆点:记忆优化独立于任务动作策略,意味着企业可以在不改变原有模型决策逻辑的前提下,通过升级记忆子系统获取可叠加的收益。

与现有产品/工作流的接口

AutoMem 设计上与主流 LLM 应用栈高度兼容

  • 动作空间扩展:可将 file-system operations 作为 tool 集成进 LangChain、Semantic Kernel 或 OpenAI Agents SDK,使现有智能体快速获得可进化的记忆能力。
  • 观测与训练管线:外层循环可利用已有的轨迹存储与评估框架(如 LangSmith、Weights & Biases),将强模型审查与自动微调嵌入 CI/CD 流程。
  • 模块化替换:记忆 scaffold 的产物(system prompt、文件 schema)可作为配置层独立更新,无需改动业务逻辑,适合 A/B 测试与灰度发布。

具体落地 Use Case

  1. 电商购物助手:AutoMem 自动学习记录用户在不同会话中的尺寸偏好、品牌倾向和预算,并在后续对话中主动引用,实现无感的个性化导购。外层循环持续优化知识的编码时机与检索策略,避免冗余存储和遗忘。
  2. 企业内部知识库问答:在运维或合规咨询场景中,智能体通过记忆文件组织已有工单和决策树,自动学会先查询相关文件再生成回答(如论文所述“consult-before-write”纪律),减少幻觉并提升首次解决率。记忆结构可随业务规则演化而自动调整,无需人工重写 prompt。

局限

  • **实验环境受限**:AutoMem 的验证仅基于三个程序生成的长程游戏(Crafter、MiniHack、NetHack),这些环境虽有丰富的随机性和长期依赖性,但与实际的文本对话、代码生成或机器人操控等开放式任务仍有较大差距。论文未讨论其方法在非游戏领域的迁移能力,特别是当记忆操作的定义更模糊、任务奖励更稀疏或难以量化时,双层优化框架是否仍能有效运行。此外,记忆脚手架(文件模式、行动词汇)的设计依赖于对环境的合理抽象,若迁移到新领域,自动化循环可能需要大量领域知识注入,泛化性存疑。
  • **计算成本与外部依赖较高**:外循环1需要让一个更强的 LLM(meta-LLM)审查数千步的完整轨迹,并迭代改进记忆结构,这一过程不仅资源消耗大,而且性能高度依赖 meta-LLM 的推理质量和一致性。若 meta-LLM 本身能力不足或审查时存在偏差,可能导致记忆脚手架收敛到次优解。此外,训练记忆熟练度(外循环2)需要大量采样和筛选,虽通过自动识别“好的记忆决策”来构造训练信号,但该识别过程可能引入噪声,增加训练不稳定风险。整体而言,AutoMem 的有效实施受限于可用的大规模计算资源和高水平的上游模型。
  • **与同类记忆增强方法的对比不足**:论文虽提及外部记忆相关工作,但缺少对近期记忆管理框架(如 MemGPT、Generative Agents)的系统性消融实验和性能对比。例如,MemGPT 同样将文件系统作为记忆,并通过提示工程管理读写;Generative Agents 利用记忆流和反思机制组织长期记忆。AutoMem 的创新在于自动化学习记忆策略,但未展示与这些方法的定量比较,难以直观判断其提升来自“自动化训练”这一卖点,还是来自更强大的基模型或特定的环境适配。此外,训练出的记忆策略是否优于精心手工设计的记忆提示也缺少深入分析。
论文Shengguang Wu2026-07-01原文

相关内容