微软发表Memora记忆系统,长对话SOTA并减少98%上下文token
微软Memora通过分离记忆存储与检索,让AI代理在长对话中高效回忆细节,性能新SOTA且大幅降低计算开销。
当前AI代理无法记住历史交互,处理长任务时需反复读取全文,效率低下。微软提出的Memora记忆框架将存储内容与检索方式解耦,既保留丰富细节(如项目时间线、多轮讨论),又用轻量结构层高效索引,在LoCoMo等基准上超越Mem0、RAG等方法,同时减少98%上下文token消耗。
正文摘录
 概览 - 如今的 AI 智能体记不住过去的交互。它们必须被反复喂入相关信息,或从外部源检索,这在处理更长、更复杂的任务时效率越来越低。要扩展智能体的能力,我们需要一种更高效的方式来长期保留和访问信息。 - Memora 是一个可扩展的记忆系统,通过解耦 存储什么(丰富的记忆内容)与 如何检索(轻量级的抽象和线索锚点),在抽象性与具体性之间取得平衡,从而显著提升智能体在长周期任务上的生产力。 - Memora 在 LoCoMo 和 LongMemEval 上达到了新的 SOTA,超越 Mem0、RAG 和全上下文推理,同时使用的上下文 token 最多减少 98%。 - [Memora 论文(在新标签页中打开)](https://arxiv.org/abs/2602.03315) 发表于 ICML 2026。Memora 代码已开源:[https://github.com/microsoft/Memora(在新标签页中打开)](https://github.com/microsoft/Memora)。 想象一个职场 AI 助手,帮你管理一个为期数月的项目。在数周的对话中,你分享了约束条件、商定了里程碑、修订了截止日期,并暴露了数十个利益相关者的偏好。后来你让它给同事起草一份更新时,它应该不仅记得最新的决策,还要记得一路走来的历程:尝试过什么、排除了什么、谁参与了意见。今天的 AI 智能体在这方面很吃力。