论文

LycheeMemory V2: 基于语义段落级整合的高效 LLM 智能体长期记忆

LycheeMemory V2: 基于语义段落级整合的高效 LLM 智能体长期记忆

长期任务 LLM 智能体需从历史交互中保留信息以支持后续任务。现有记忆系统通常采用急切整合 (eager consolidation) 策略,即在每次交互后调用 LLM 提取、总结或更新记忆,导致随对话增长构建成本不断上升。粗粒度总结虽可降低构建成本,但易丢失细粒度上下文证据;而扩大检索上下文或依赖多跳 LLM 推理则把开销转移到查询阶段。 本文提出 LycheeMemory V2,一种高效的长期记忆框架,用语义段落级整合 取代逐轮整合。它将多次交互批量划分为语义段落,并为每个完成的段落编码为上下文无关的类型化记忆记录。段落级批量处理降低了 LLM 编码频率,而语义边界检测相比固定窗口批处理能更好地保留连贯的事件级与时间证据。生成的记录通过轻量级结构化索引组织,支持查询规划式证据检索。 实验基于 GPT-4.1-Mini,LycheeMemory 在 LoCoMo 上达到 89.22% 准确率,在 LongMemEval-S 上达到 92.20%,均达到当前最优。相比 A-Mem,构建 token 在 LoCoMo 上减少 86.0%,在 LongMemEval-S 上减少 75.9%,且未增加查询阶段 token 用量。结果表明,长期智能体记忆的精度-成本权衡不仅取决于保留何种信息,也取决于整合的粒度。

论文精读

TL;DR LycheeMemory V2 用语义段落级整合替代逐轮整合,批量编码对话段并保留事件级证据,在 LoCoMo 与 LongMemEval-S 上以最高准确率将构建 token 降低 86%/76%,且查询成本不升。

问题

问题背景

长时程 LLM 智能体需要保留历史交互信息,以支持未来任务。当前领域关注如何高效构建和检索长期记忆,平衡记忆质量与计算开销。

现有方法局限

现有记忆系统多采用 即时整合 (eager consolidation):每次交互后立即调用 LLM 提取、总结或更新记忆。

  • 记忆构建成本随对话轮数线性增长,长对话下开销显著。
  • 粗粒度摘要虽降低构建成本,但会丢弃细粒度上下文证据,影响后续推理准确性。
  • 增大检索上下文或引入多跳 LLM 推理可将负担转移到查询阶段,导致查询延迟和成本上升。
  • 固定窗口分批整合容易切断事件或话题边界,破坏语义连贯性。

为什么这个问题难/重要

核心挑战在于同时优化 构建成本、查询成本 和 记忆保真度。逐轮整合成本高但信息完整,批量整合成本低但易丢失边界信息,需要在线语义分段技术。另外,生成的记忆记录需结构化、可检索,以支持精准证据召回。业界对 AI 助手、个性化服务等长时程应用关注度高,记忆系统的效率直接影响部署成本与用户体验。

行业类比

类似生产环境中的日志处理系统:若对每条日志实时解析(逐轮整合)会消耗大量资源;若仅按固定时间窗口批量处理(固定窗口分批),可能丢失关键事件上下文。语义分段 + 批量解析 可在效率与准确性之间取得平衡。

核心洞察

  • 将记忆构建的触发从逐轮改为语义分段,是降低 LLM 长期记忆成本的核心架构选择。与 A-Mem 等逐轮整合的基线相比,LycheeMemory V2 通过 **语义边界检测** 把编码频率降下来,同时保留事件级时间证据,避免固定窗口破坏连贯性。实验显示构建 token 减少 86.0% 且精度反而提升,说明 **整合粒度** 比单纯增加总结力度更影响成本-精度曲线。工程启示:记忆系统应将分段检测与编码解耦,让热路径不频繁调用 LLM。
  • 成本-精度权衡不仅取决于保留什么信息,还取决于以什么粒度整合,这一视角改变了对记忆系统的评估方式。以往工作常通过增加检索上下文或让查询时多跳推理来弥补构建端的信息丢失,但 LycheeMemory 证明通过 **语义分段级整合** 可以在不增加查询 token 的前提下降低构建成本。对工程决策的启示:应同时监控构建 token、查询 token 和精度,寻找三者的帕累托最优,而非一味追求记忆全面或检索丰富。
  • 查询计划驱动的多路检索与类型化记录存储相解耦,让低构建成本也能维持高检索精度。LycheeMemory 的 lightweight structured indexes 和 **查询规划** 避免了对单一向量检索的依赖,通过多路召回、融合和多样性选择,将证据定向返回。与 A-Mem 等仅依赖向量或摘要的机制相比,这种检索设计更能控制查询时开销。工程上可借鉴:存储时对记忆按类型建索引,检索时先生成计划再分路取证据,能有效约束上下文长度并提升答案质量。

方法

输入:长程对话流。

  • 在线语义分割:通过语义边界检测,将连续对话划分成语义连贯的段(segment),段内多轮交互保留事件级上下文,避免固定窗口截断叙事。
  • 段级记忆编码:每个语义段完成后,一次性调用 LLM 编码为 context-independent typed memory records(上下文无关类型化记忆记录),记录包含实体、事件、时间等结构化字段。与按轮编码相比,LLM 调用次数大幅减少。
  • 结构化证据组织:记忆记录存入轻量结构化索引,如向量索引 + 字段过滤,便于后续精确检索。
  • 计划引导多路检索:查询时先用小型计划模块分解查询意图,然后沿不同索引路径检索相关记录,经过融合、重排和多样性选择得到证据集。

输出:最终答案以及增量更新的记忆库。

在 LoCoMo 上达到 89.22%,LongMemEval-S 上 92.20%;相比 A-Mem,构建 token 降低 86.0% 和 75.9%,且查询 token 不增加。

与同类方法差异:将记忆构建粒度从“每轮交互”提升到“语义段级”,同时保留段内细粒度上下文,避免了频繁编码的高成本与粗粒度摘要的信息丢失之间的两难取舍。

实验

实验设计

论文在 LoCoMo 与 LongMemEval-S 两个长时记忆基准上评估,底层 LLM 使用 GPT-4.1-Mini,对比基线包括 A-Mem 等。评估指标涵盖准确率及构建/查询 token 开销,并通过消融实验验证分段触发、记忆表示与检索管线各模块贡献。

关键发现

  • 准确率:LycheeMemory 在 LoCoMo 达 89.22%,LongMemEval-S 达 92.20%,均达到 SOTA 水平。
  • 构建成本:相比 A-Mem,LoCoMo 构建 tokens 减少 86.0%,LongMemEval-S 减少 75.9%,查询 tokens 未增加。
  • 机制:语义分段合并 降低了 LLM 编码频率,同时保留事件级上下文;结构化索引 支持查询规划与多路检索,避免将开销转移到推理侧。

与基线对比

A-Mem 采用逐轮构建,随对话增长 token 成本线性攀升。LycheeMemory 将多轮交互批量合并为语义段,仅在段边界触发记忆编码,显著压缩构建侧调用次数。相比固定窗口分段,语义边界检测防止了事件证据被割裂。查询侧通过 query planner 与多路检索融合,保障在降低构建成本的同时不牺牲证据召回,整体实现更优的准确率-成本权衡。

行业影响

落地场景

LycheeMemory V2 适合任何需要长周期对话记忆的 LLM agent,典型如:

  • 电商售后客服:用户跨多次会话咨询订单物流、退换货进度,系统需保留前期证据,避免重复问询。
  • 在线教育辅导:长期跟踪学生错题、薄弱知识点,根据历史表现规划复习路径。

这之外,医疗健康随访、金融理财顾问、企业 IT 支持等都可将该框架作为记忆底座。

商业价值

核心收益在构建侧成本:相比 A-Mem,LoCoMo 构建 token 降低 86.0%,LongMemEval-S 降低 75.9%,且查询 token 不增。对于日均百万级交互的客服系统,可显著节省 LLM 推理开销。同时,语义分段保留事件级证据,使回答准确率(LoCoMo 89.22%,LongMemEval-S 92.20%)达到 SOTA,直接改善用户体验与任务成功率,降低人工接管率。

跟现有产品/工作流的接口

集成路径清晰:

  • 记忆构建阶段:替换现有 per-turn 记忆模块,通过 agent 框架(LangChain/LlamaIndex)的自定义 memory 接口接入,将对话流路由到语义分段器。
  • 存储层:轻量结构化索引可用 PostgreSQL/SQLite,向量检索部分对接现有向量库(Milvus/Pinecone/Qdrant)。
  • 查询侧:做为 retriever 插件嵌入 RAG pipeline,替换原有多路召回+重排逻辑,保留 answer generation 不变。

这样可以在不大改上层 agent 架构的前提下,获得降本与精度收益。

局限

  • 方法依赖 LLM 进行在线语义分割和记忆编码。虽然分段级整合降低了构建频率,但每个分段边界判定和记忆编码仍需调用 LLM,引入了额外的模型判断开销。论文未详细说明语义分割步骤的 token 成本与延迟,也未在不同规模或不同类型的 LLM 上验证分割稳定性和代价。若分割模型能力不足,可能错误合并语义边界,导致事件级证据丢失。
  • 实验仅在 GPT-4.1-Mini 单模型上,且仅用 LoCoMo 和 LongMemEval-S 两个基准,覆盖任务类型有限。缺乏对更长周期、多会话、多模态或真实部署场景的评估。另外,性能提升部分来自针对性设计(如类型化记录、多路检索),泛化到其他领域或 agent 架构时可能需要重新调整,论文未提供足够的消融或跨域验证。
  • 与 A-Mem 等 baseline 的对比集中在构建 token 和准确率,未充分比较端到端延迟、存储占用、检索复杂度。类型化记忆记录虽然结构化,但可能限制隐式关联或跨事件复杂关系的表达,导致信息损失。论文也未讨论记忆更新、删除或冲突解决的机制,在长期连续运行中可能积累冗余或矛盾信息。
论文Dongfang Li2026-08-13原文

相关内容