论文

即时记忆:学习为 LLM Agent 策划任务自适应的记忆

即时记忆:学习为 LLM Agent 策划任务自适应的记忆

现有 agentic 记忆系统 多在写入时 完成记忆筛选:任务完成后,其轨迹被蒸馏为 reflection、workflow、skill 等固定产物,后续按相似度检索。这迫使系统在未知未来查询时就决定什么值得记住,不可逆地丢弃信息,且生成的摘要与查询无关,却要服务多种下游任务。同时,存储决策的价值可能滞后许多任务才显现,带来长时程的信用分配 难题。 JitMem(Just-in-Time Memory) 改为保留原始轨迹,把筛选推迟到读取时:当前任务已知后,筛选器依据检索到的 trace 与新任务,即时合成紧凑、任务自适应的 payload。由于 payload 在同一任务上被消费,筛选器可直接依据即时任务成功 训练,无需延迟的效用信号,也无需人为地把相关任务分组。 在 ALFWorld、WebShop 与 τ^2-bench 上,JitMem 一致优于无记忆 agent 以及启发式、可学习的写入时记忆方法,较最强基线分别提升 16.2、16.3、3.9 个绝对成功率点。值得注意的是,即便未经训练的筛选器也已能媲美甚至超越这些基线,说明读取时的任务自适应筛选 本身就是主要增益来源;对筛选器进行训练则进一步叠加提升。

论文精读

TL;DR JitMem 把记忆固化从写时推迟到读时:保留原始轨迹,遇新任务时由 curator 合成任务自适应 payload,直接优化即时任务成功,在 ALFWorld / WebShop / τ²-bench 上较最强写时基线再提升 16.2 / 16.3 / 3.9 个百分点。

问题

问题背景

当前 LLM agent 领域关注如何从历史任务轨迹中积累经验以提升连续任务表现。主流做法是在任务结束时即 write-time 将轨迹压缩为固定记忆(如 reflection、skill 或 workflow),供后续相似查询检索复用。

现有方法局限

这种 write-time curation 存在两个关键缺陷:

  • 信息损失不可逆:压缩决策发生在新查询到来之前,系统无法预知未来任务需要哪些信息,导致固定摘要难以覆盖多样下游任务,通用性与针对性无法兼得。
  • 训练信号延迟:若尝试学习一个 write-time 记忆筛选器,其存储决策的价值要等到未来相关查询出现才显现,形成长时程信用分配难题,难以用即时奖励有效训练。

为什么这个问题难且重要

LLM agent 在真实场景中面对的是开放、动态的任务序列,任务之间相关性未知且分布漂移。如何让记忆系统既保持信息保真度,又能针对当前任务高效提取是核心矛盾。业界对 agentic memory 的关注持续升温,因为经验复用是降低推理成本、提升长程任务成功率的关键杠杆,但现有写时策展方法往往在灵活性和可学习性上受限。

行业类比

类似于推荐系统中,与其离线预计算所有物料向量并固化索引,不如在查询到来时根据上下文动态聚合和排序,以应对长尾与实时变化。

核心洞察

  • 将 agent 记忆的构建时机从任务完成后的写时(write time)转移到新任务出现时的读时(read time),是 JitMem 的核心创新。传统方法在写时就把轨迹压缩成固定摘要,导致信息损失且摘要与未来查询无关;JitMem 保留原始轨迹,在读出时根据当前任务动态生成针对性 payload,使记忆内容与当前查询高度相关,从而更有效地利用历史经验。这一设计直接解决了写时方法中“为未知未来查询做决策”的根本矛盾,而该矛盾在现有 agentic memory 文献中未被充分重视。
  • JitMem 允许直接使用即时任务成功作为 curator 的训练信号,消除了长时程信用分配问题。写时 curator 的存储决策价值可能在多个任务后才显现,通常需要人为分组相关任务或使用复杂的延迟奖励机制,训练困难且不稳定;而 JitMem 的 curator 在当前任务中合成并立即被消费,其效果可直接由该任务的成功率衡量,无需任何额外分组或长期回报估计。这大幅简化了训练流程,使 curator 可以通过标准监督学习高效优化,同时也解释了为何未训练的 curator 已能取得不错效果——因为任务自适应本身已提供了大部分增益,训练只是进一步放大。

方法

输入与存储设计

JitMem 的核心改变是保留原始轨迹(raw trajectories),不做 write-time 蒸馏。每个已完成任务的完整执行记录(动作、观察、中间推理)直接存入记忆库。当新任务到来时,系统基于相似度检索出最相关的过去轨迹,作为候选记忆片段。

关键模块:read-time curator

与传统方法在写入时就把轨迹压缩成固定摘要不同,JitMem 在读取时调用一个 memory curator。该 curator 的输入为:

  • 当前任务的描述与上下文
  • 检索到的原始轨迹集合

curator 据此合成一个紧凑、任务自适应的 payload,例如专门针对当前任务提炼的提示、步骤建议或策略片段。这个 payload 不是通用摘要,而是为当前任务即时定制。curator 的实现可以是 LLM 本身,通过提示工程让 LLM 做聚合与筛选;也可以是一个可训练的小型模块(如轻量 Transformer),直接学习从轨迹集合到 payload 的映射。

输出与消费

生成的 payload 被拼接到当前任务 agent 的上下文中,agent 基于此 payload 执行任务。由于 payload 在同一任务内被消费,其质量直接影响当前任务的成败,因此训练信号可以直接来自即时任务的成功或失败。

训练与优化

curator 的训练目标是最大化当前任务的成功率。无需等待未来查询,也无需人为划分相关任务组。可以采用强化学习(以任务成功为奖励)或监督学习(以专家生成的优质 payload 为标签)直接优化 curator 参数。实验表明,即使不训练,仅用 LLM 做 read-time curation 就已经能带来显著收益;进一步训练 curator 可以叠加提升。

与同类方法的差异点:JitMem 把记忆整理的时机从 write time 移到 read time,使记忆内容能够针对当前查询动态生成,从而避免了 write-time 方法的长期信用分配难题和不可逆信息损失。

实验

实验设计

在三个交互式 LLM agent 基准上评估 JitMem:ALFWorld(具身决策)、WebShop(网页购物)、τ²-bench(工具使用)。对比三类基线:无记忆 agent、启发式 write-time memory 和学习式 write-time memory。评估指标为任务成功率。

关键发现

JitMem 在所有基准上一致优于所有基线,相对最强基线分别提升:ALFWorld +16.2、WebShop +16.3、τ²-bench +3.9 个百分点。值得注意的是,未训练 curator 已经与最强基线竞争或超越,表明 read-time task-adaptive curation 本身是主要增益来源;训练 curator 进一步放大优势。

与基线的深度对比

传统 write-time memory 在任务完成时蒸馏固定 artifact,存储决策的价值要到未来相关查询出现才显现,形成长程信用分配问题,难以训练。JitMem 保留原始轨迹,在读时根据当前任务合成紧凑 payload,直接以当前任务成功为监督信号,避免了延迟效用和人工分组相关任务的需求。相比之下,未训练 curator 的强表现说明,即使不学习,读时自适应提取本身就能降低噪声、保留与当前查询相关的信息,这解释了为什么 JitMem 能大幅超越启发式和 learned write-time 方法。

行业影响

落地场景

Just-in-Time Memory (JitMem) 适用于需要长期积累任务经验的 LLM agent 产品,尤其在多轮交互、历史轨迹可复用的场景。典型应用包括:

  • 电商购物助手:存储用户历史会话轨迹,新请求到来时检索相似轨迹,由 read-time curator 动态生成针对性 payload,提升商品推荐和问题解决准确率。
  • 企业服务自动化:如 IT 运维 agent,积累故障处理轨迹,新故障出现时检索相似案例并生成操作摘要,加速修复流程。
  • 代码辅助工具:如 Copilot 类 agent,保留过往代码生成与调试轨迹,在相似任务中提供上下文相关建议。

商业价值

  • 降本:保留原始轨迹但仅生成紧凑 payload,避免长上下文输入,降低平均 token 消耗;curator 训练直接使用即时任务成功信号,无需复杂奖励设计,训练成本低。
  • 增收/体验提升:论文在三个 benchmark 上任务成功率提升最高 16.3 个百分点,直接改善服务质量和用户留存;即使未训练的 curator 已具备竞争力,进一步训练可滚动优化,形成数据飞轮。

与现有产品/工作流的接口

  • 集成方式:作为记忆模块嵌入 LangChain 或 AutoGen 等 agent 框架,替换现有 write-time summarizer。
  • 存储:保留原始轨迹于向量数据库,新增一个 read-time curator 模型(可用小模型或 LLM 本身)。
  • 训练闭环:收集 agent 执行任务的即时成功信号,用监督学习或强化学习微调 curator,无需人工标注。

具体场景示例:电商平台智能客服——存储历史客服对话轨迹及解决方案,新问题到来时检索相似轨迹,curator 生成针对当前用户问题的简明指导,避免客服重复浏览长对话,提高响应速度和准确性。金融风控 agent——处理异常交易时参考历史案例轨迹,动态提取关键特征和决策依据,辅助人工审核,降低误判率。

局限

  • **存储与检索开销**:JitMem 保留原始轨迹而非在写入时压缩,虽然避免了信息丢失,但会导致存储成本随任务数量线性增长;在推理时,系统需要检索并处理更多原始文本,可能增加上下文长度压力和推理延迟。对于长期运行、高吞吐的 agent 场景,轨迹库可能迅速膨胀,若缺乏有效的存储上限或轨迹淘汰机制,系统难以规模化。论文未讨论存储上限、检索效率或上下文截断策略,这一局限在真实部署中可能被进一步放大。
  • **训练信号依赖**:JitMem 的训练直接利用即时任务成功作为监督信号,这要求环境能提供明确、可自动判定的成功标签(如 ALFWorld 目标达成、WebShop 成功购买)。对于开放式对话、长期规划或部分可观察环境中,成功信号可能稀疏、延迟甚至缺失,导致 curator 难以训练。此外,即使无需训练就能取得竞争力,但进一步提升性能仍需在模拟环境中收集大量交互数据,训练成本可能较高,且对不同任务类型的泛化能力尚不明确。
  • **评估域有限**:实验仅在 ALFWorld、WebShop 和 τ²-bench 三个相对结构化、任务目标清晰的基准上进行,可能高估了方法在更复杂、动态环境中的表现。这些基准中任务步骤较短、奖励明确,而 JitMem 的 read-time 合成策略是否适用于需要长期跨会话记忆、个性化或非结构化交互的任务仍未验证。另外,论文主要与 heuristic 和 learned write-time 方法对比,缺少与更先进的 agentic memory 系统(如基于向量数据库的混合记忆或多智能体协作记忆)的全面比较。
论文Yefan Zhou2026-09-23原文

相关内容