论文

Jev-Mem: 面向高效 AI Agent 的 System-One 控制式 Agentic Memory

Jev-Mem: 面向高效 AI Agent 的 System-One 控制式 Agentic Memory

Agentic memory 对长时程 AI agents 至关重要,但现有系统多依赖 自回归 LLM 来控制记忆的组织、检索与使用,把昂贵的生成过程放到了记忆操作的关键路径上。为此,作者提出 Jev-Mem,一种受 System-One/System-Two 认知模式启发的新型 agentic memory 架构。 Jev-Mem 将这一分工引入记忆系统,由三个平面组成: - System-One 控制平面:在构建阶段管控记忆类型与关系组织,在检索阶段动态完成查询路由、检索预算分配、图遍历、候选打分与自适应停止; - 多关系记忆平面:结构化存储记忆及其多重关系; - System-Two 推理平面:仅在复杂推理与答案合成时被调用。 实验表明该设计同时提升了记忆效果与系统效率。在 LoCoMo 上,Jev-Mem 取得 0.777 的 LLM-as-a-Judge 总分,较最强基线相对提升 11.0%;记忆构建时间降至 158 s,比最快的竞品记忆系统加速 6.6 倍;平均查询延迟降至 0.93 s,减少 36.7%。

论文精读

TL;DR Jev-Mem 将 System-One/System-Two 认知分工引入 agentic memory,用轻量控制平面主导记忆构建与检索决策,使 LoCoMo 得分提升 11%、构建提速 6.6 倍、查询延迟降 36.7%。

问题

问题背景

随着 LLM agents 走向长程任务,agentic memory 成为支撑持久上下文、个性化与多步规划的核心组件。

现有方法局限

主流 agentic memory 系统在记忆构建和检索时,把 autoregressive LLM 作为控制平面:由模型生成记忆的组织决策、查询路由、相关性评分和停止条件。这带来三个具体问题:

  1. 每次记忆写入或检索都触发昂贵的生成,延迟可达秒级,让记忆操作成为响应瓶颈;
  2. 记忆图谱构建和查询时的推理步骤不受预算约束,容易在低价值证据上过度消耗 token;
  3. 检索停止决策依赖 LLM 逐轮判断,导致平均查询延迟高且不稳定。

在 LoCoMo 基准上,即便最强基线也需要数秒级响应,记忆构建时间超过千秒。

为什么这个问题难/重要

本质困难在于,记忆操作需要高频、低成本的决策,而深度推理需要低频但高质量。如果用单一 autoregressive LLM 同时承担两者,无法按任务难度动态分配算力,导致“简单查询也付复杂推理成本”。业界对长程 agent 的部署成本与交互延迟高度敏感,但现有系统往往把 System 2 级别的推理用在记忆管理的每一步,既慢又贵。必须找到一种架构,让快速决策与深度推理解耦,同时保证检索质量不下降。

行业类比

类比生产环境中的数据库查询优化器:高频的索引选择、代价估算与扫描裁剪应由轻量规则引擎完成,只有复杂 join 优化才调用重型 planner——agentic memory 同样需要把日常记忆控制从 LLM 生成中剥离。

核心洞察

  • Jev-Mem 将 System-One/System-Two 认知分工引入代理记忆架构,通过专门的 System-One 控制平面承担记忆类型判定、关系组织、查询路由、检索预算分配等高频轻量决策,使记忆操作不再依赖昂贵的 autoregressive LLM 生成。与 MemGPT、A-MEM 等现有系统不同,这些系统通常让 LLM 直接生成记忆写入格式或检索计划,导致生成延迟成为记忆操作的瓶颈;Jev-Mem 把这类决策前移到轻量控制器,只有复杂推理和答案合成才调用 System-Two,从而在保持效果的同时大幅降低延迟和构建时间,将记忆系统视为一个控制问题而非单纯的存储或检索问题。
  • Jev-Mem 通过结构化多关系记忆图和 System-One 控制器的图遍历、候选评分与自适应停止机制,实现了检索效率与效果的同时提升。传统记忆检索往往需要 LLM 对候选记忆逐一评分或生成多步查询,计算开销大且延迟高;Jev-Mem 的 System-One 控制器在图上执行查询路由和证据引导扩展,动态决定何时停止检索,避免不必要的 LLM 调用。实验显示在 LoCoMo 上总体得分提高 11.0%,构建时间加速 6.6 倍,查询延迟降低 36.7%,证明记忆系统的性能瓶颈可通过轻量控制逻辑优化,而非简单增大模型或存储,为未来 agentic memory 设计提供了新方向。

方法

输入

  • 长期交互中的原始事件流(对话、行为、偏好表达)
  • 当前查询 Q

关键模块

Jev-Mem 采用 System-One / System-Two 双平面认知架构,分解为三个平面:

  1. System-One 控制平面(轻量决策核心):在记忆构建阶段,对输入事件进行 类型化标注(事件类型、偏好类型),并建立 多关系边(语义关系、有向因果关系)。在检索阶段,该平面执行 查询路由(决定检索路径:时间线/因果链/语义相似)、检索预算分配、图遍历、候选评分 与 自适应停止(判断证据是否足够)。
  2. 结构化多关系记忆平面:存储由 System-One 组织好的类型化节点和关系边,形成可高效遍历的异构图。
  3. System-Two 推理平面:仅在 System-One 判定需要复杂推理或答案合成时被调用,基于已检索到的候选记忆生成最终回答;简单查询可直接由 System-One 输出轻量响应。

输出

  • 检索到的证据子集 / 最终答案(若无需 System-Two,则由 System-One 直接给出轻量响应)

该设计将昂贵的自回归生成从记忆操作的关键路径上移除,System-One 用轻量分类/评分/规则决策替代 LLM 生成,仅在最终答案合成或复杂推理时才触发 System-Two,从而在保持记忆效果的同时大幅降低延迟。与同类工作(如完全依赖 LLM 控制记忆组织与检索)相比,差异点在于 Jev-Mem 显式引入 System-One 平面作为记忆控制专用模块,将检索决策与推理生成解耦,避免了每次记忆操作都进行完整 LLM 生成。

实验

实验设计

Jev-Mem 在 LoCoMo 基准上进行评估,覆盖长期对话记忆任务。对比多个现有 agentic memory 系统,采用 LLM-as-a-Judge 作为效果指标,同时记录 内存构建时间 与 平均查询延迟 以衡量效率。实验重点验证 System-One 控制平面是否能在不牺牲效果的前提下显著降低昂贵 LLM 生成开销。

关键发现

  • 整体效果:Jev-Mem 获得 0.777 的 LLM-as-a-Judge 分数,相对最强基线提升 11.0%。
  • 构建效率:内存构建时间降至 158 秒,比最快竞争系统快 6.6 倍。
  • 查询效率:平均查询延迟为 0.93 秒,较基线降低 36.7%。

结果表明,System-One 控制平面将记忆组织与检索中的大量决策从 autoregressive LLM 中解耦,避免了生成代价成为关键路径,同时保持甚至提升了记忆有效性。

与基线对比

最强基线虽在效果上具有竞争力,但通常依赖 LLM 在每次查询或构建时进行全文生成,导致高延迟与高计算成本。Jev-Mem 的 System-One 轻量控制 + System-Two 按需推理 架构在不降低评分的前提下,同时获得构建 6.6× 加速与查询 36.7% 延迟下降。该差异验证了双系统分工在 agentic memory 中的工程价值:常规决策由轻量控制平面处理,仅复杂推理才调用重型模型。

行业影响

落地场景

Jev-Mem 适合需要长期记忆的 AI Agent:个人助理、企业知识助手、客服机器人和研究/代码代理。其 System-One 控制平面 将记忆读写从 LLM 生成路径剥离,延迟降至亚秒级,可嵌入实时交互。

商业价值

降本:构建时由轻量控制器完成类型标注与关系抽取,不再逐条调用大模型。实验显示构建时间 158s,较最快基线快 6.6 倍,大幅降低 token 成本。

提效:查询阶段通过路由、预算分配和自适应停止,平均延迟 0.93s,较基线降低 36.7%;评分质量提升 11%,减少错误回答和人工干预。

集成方式

可作为独立 记忆服务 或 SDK 接入 LangChain、LlamaIndex、AutoGen 等框架的 memory 接口;内部采用多关系图 + 向量索引,对外暴露 write_memory 和 retrieve_memory 异步 API。可叠加在已有知识图谱/向量库之上作为控制层,优化查询规划。

具体 use case

  • 电商智能客服:多轮对话中快速召回用户历史订单、偏好和投诉,System-One 直接路由到子图并生成候选,仅需复杂推理(如退换货政策冲突)时调用 System-Two,降低单次对话成本。
  • 企业代码助手:对代码仓库、内部文档和项目历史构建多关系记忆,提问时先做 证据引导的扩展,只检索高相关节点,避免全库扫描,提升响应速度并保证答案可溯源。

局限

  • **评估覆盖不足** 论文仅在 `LoCoMo` 一个基准上验证,且采用 `LLM-as-a-Judge` 作为主要指标,缺乏人类评估或多基准交叉验证。`LoCoMo` 侧重于对话记忆,未涵盖工具调用、代码生成、多智能体协作等更复杂的 agent 场景,因此结论的泛化性存疑。此外,构建时间和查询延迟的测量可能依赖特定硬件与缓存策略,读者难以直接复现效率优势,削弱了工程参考价值。
  • **System-One 设计可能过度依赖手工规则** 文中未披露控制器的具体实现细节,如 query routing、retrieval-budget allocation 和 candidate scoring 是使用轻量分类器、启发式规则还是小型 LLM。若依赖固定提示词或规则,在面对分布外查询或新的记忆类型时可能需要重新设计,难以做到零样本迁移。论文未讨论跨领域适配成本,这限制了方法在真实动态环境中的可维护性。
  • **有效性提升有限,深层推理仍依赖 System-Two** 相较于最强基线,Jev-Mem 的 LLM-as-a-Judge 分数提升仅 11%,而效率提升显著(6.6× 构建加速、36.7% 延迟降低),这表明贡献更偏向工程优化。对于需要复杂多跳关联或抽象归纳的查询,System-One 控制平面可能无法完全替代深度推理,仍需回溯到 System-Two,此时延迟优势可能减弱。论文未报告此类高难度查询上的单独表现。
论文Dongming Jiang2026-09-21原文

相关内容