选择何时取代抽取?一项基于类型化决策模型的 Agent 记忆预注册测试
对话记忆 究竟需要 LLM 抽取的事实,还是选对原始轮次就足够?已发表的结果互相矛盾:基于抽取的系统报告从蒸馏事实中获得增益;近期研究发现,配合良好排序的原始历史同样有效,但对 排序是否重要 存在分歧。 我们在留出的 LoCoMo 与 LongMemEval 对话上开展了一项预注册研究。在 LoCoMo 的紧预算下,由单次调用 Jev(一个类型化决策模型)选出的原始轮次,不劣于 LLM 抽取式记忆(单侧 95% 界为 -3.0 点,对照 -5 点边界)。盲评人工打分使差距缩小,但不改变结论。原始轮次的写入成本低 3,061 倍,且结果在第二个答案模型上依然成立。 在本研究内,重排序 的增益随预算增长而缩小: - 保留 30 个候选中的 3 个时,它在 LoCoMo 上提升 17.4 点、LongMemEval 上 9.1 点; - 预算宽裕时仅提升 1.5 与 1.1 点,此时抽取式系统反而更准确。 这或许解释了已发表结果为何彼此分歧。 在上下文对齐时,Jev 的选择准确度与 LLM 重排序器相当(非劣界 -2.0),延迟仅为其三分之一,并优于多调用图遍历。此外,重排序会削弱模型的 正确弃答 能力。计划、代码与人工评分答案均已公开。
论文精读
TL;DR 预注册对照实验表明,用 Jev 选择原始对话轮次在 LoCoMo 上非劣于 LLM 抽取式记忆,且写入成本降低 3061 倍,挑战了对话记忆必须抽取事实的假设。
问题
问题背景
对话式 AI 智能体的长期记忆成为热点,核心问题是如何在有限的上下文预算内,为 agent 提供最相关的历史信息。
现有方法局限
当前主流方案分为两类:提取式记忆(extraction-based systems,如 mem0、LongMemEval 设计、SeCom)利用 LLM 对每轮对话抽取结构化事实,再进行检索;选择式记忆 直接从原始对话轮次中挑选相关片段。然而,提取式方法需要额外 LLM 调用,写入成本高,且提取过程可能丢失原始语境细节。选择式方法虽然写入成本低,但排序质量直接影响效果,已发表研究结论矛盾:有些工作显示 raw history 加良好排序可与提取媲美,但对排序是否起关键作用存在分歧;在宽松预算下提取系统更准确,在紧预算下 raw turns 选择不劣,但缺少系统性的预注册实验验证。
为什么这个问题难/重要
长期记忆模块直接影响 agent 的回答质量与上下文连贯性,同时成本和延迟是工程落地的硬约束。不同方法(提取 vs 选择)在准确率、写入成本、查询延迟之间存在 trade-off,而现有基准和评测协议不一致(如 LoCoMo 与 LongMemEval 上 reranking 增益差异),导致从业者难以选择最优方案。预注册实验提供可靠效应量,并引入 typed decision model(Jev)单次调用选择 raw turns,证明在紧预算下非劣,且延迟仅为 LLM reranker 的三分之一,对构建可扩展的低成本 agent 记忆具有直接工程指导意义。
行业类比
类似于搜索引擎中召回与精排的权衡——用轻量级 typed decision model 快速筛选候选对话轮次,避免昂贵的事实提取,正如在推荐系统中用粗排模型替代全量精排以降低延迟和计算成本。
核心洞察
- - 在严格上下文预算下,选择原始对话轮次(selection)可以替代事实提取(extraction),达到非劣效果且成本降低 3,061 倍。这挑战了以 mem0 和 SeCom 为代表的提取式记忆系统假设,证明 raw turns + Jev 的轻量方案足以在 tight budget 场景完成任务,对工程实践意味着可以避免昂贵的事实蒸馏流水线,直接构建基于轮次检索和选择的记忆层。
- - 重排序(reranking)的增益高度依赖上下文预算:当保留 3/30 个候选时,LoCoMo 上增益 17.4 点,但预算宽裕时增益降至 1.5 点,提取系统反而更准确。这解释了以往研究中关于 ranking 是否重要的矛盾结论,并提示实际系统应根据预算动态决定是否部署 reranking 组件,避免在宽裕预算下浪费计算。
方法
输入
- 对话历史原始轮次(raw turns)作为候选记忆单元,每个轮次为一条独立文本。
- 当前查询(query)与 预算(budget,允许保留的轮次数量,如 3/30)。
- 可选 reranker 或 图遍历 产生的候选排序结果,用于对比。
关键模块:Jev typed decision model
- Jev 是一个类型化决策模型,通过单次调用完成轮次选择,输出结构化决策(如轮次索引列表),避免自由文本解析。
- 与通用 LLM reranker 不同,Jev 不输出相关性分数,而是直接给出“保留/丢弃”的硬决策,并在输出中约束类型(例如 JSON schema),确保结果可直接用于上下文组装。
- 选择过程不依赖任何预先提取的事实;Jev 直接从原始轮次中判断哪些轮次对当前查询最有用。
输出
- Jev 输出选中轮次的集合,作为 上下文(context) 喂给答案模型生成回复。
- 在需要 abstention(正确弃答)场景中,Jev 支持输出空选择或低置信度信号,而 reranker 会降低这种正确弃答率。
与同类方法的差异点
提取式记忆系统(如 mem0)需先对每条消息提取事实并存储,再检索事实作为上下文;而 Jev 跳过提取步骤,直接对原始轮次做选择,从而将写入成本降低 3,061 倍,并在 tight budget 下达到非劣效准确率。
实验
实验设计在 held-out LoCoMo 与 LongMemEval 上进行预注册非劣效检验,对比「raw turns + 单次 Jev 选择」与「LLM 抽取事实记忆」。主要终点为 tight budget 下的准确率差(margin -5 点,单侧 95% 界)。同时测试 reranking 在 3/30 候选与慷慨预算下的增益,以及 Jev 对照 LLM reranker、multi-call graph traversal。盲评与更换 answer model 作为稳健性。
关键发现:tight budget 下 raw turns + Jev 非劣于 extraction memory,单侧 95% 界 -3.0 点,优于 -5 点 margin;写入成本降低 3,061 倍。reranking 增益随预算缩水:3/30 时 +17.4(LoCoMo)/+9.1(LongMemEval),慷慨预算时仅 +1.5/+1.1,此时 extraction 更准。Jev 在 matched context 与 LLM reranker 精度非劣(界 -2.0),延迟为 1/3,且优于 multi-call graph traversal;reranking 还降低了正确弃答。
对比解读:结果解释了已发表文献的分歧——reranking 的边际价值依赖记忆预算,预算紧张时选择原始轮次已足够,预算宽裕时抽取式记忆才显现优势。工程上,低延迟/成本敏感场景应优先采用 typed decision model 直接选 raw turns,避免昂贵抽取;在充裕上下文且精度要求高时再引入 extraction 或 reranking。Jev 单次调用的低延迟和 typed 决策特点适合在线 agent 记忆系统。
行业影响
落地场景
对话式 AI 助手、智能客服、个人长期记忆系统等产品可直接受益。在 实时客服、电商导购、企业知识助手 场景中,历史对话体量大、写记忆预算有限,使用 Jev 这类 typed decision model 从原始轮次直接选择相关上下文,替代 LLM 事实抽取,适合边缘部署或高并发查询。
商业价值
核心降本路径:论文显示 raw turns 写入成本比 LLM extraction 低 3,061 倍,对大规模多租户记忆系统,可显著降低 token 消耗与推理成本。同时,Jev 选择延迟约为 LLM reranker 的三分之一,体验提升明显。在预算紧张时非劣于抽取记忆,可视为 成本-精度 Pareto 前沿 上的重要选项。
与现有 stack 集成
现有记忆 stack 通常包含 embedding index、reranker、LLM extractor。可将 extractor 替换为 selection 模块:
- 查询时,embedding 或规则召回候选
raw turns - 用轻量模型(如 Jev)做选择/排序,保留 LLM reranker 仅当预算充足时启用,形成分层策略
- 对需要精确事实的 domain,保留 extraction 作为 fallback
具体 use case:电商平台客服机器人,维护每个用户的历史会话索引,在回答“我的订单怎么还没发货?”时,选择相关原始消息而无需预先抽取订单实体,节省高并发下的写库成本;内容平台的个性化推荐对话,用 selection 快速构建用户画像上下文,支持低延迟交互。
局限
- - 论文只在 **LoCoMo** 和 **LongMemEval** 两个数据集上验证,且主要结论(非劣性)建立在 LoCoMo 的 tight budget 设置下。在 LongMemEval 上小预算场景未充分展示,其他对话类型(如工具调用、代码生成、长文档问答)未覆盖。Jev 作为类型化决策模型,其选择性能依赖特定结构化输出设计,泛化到普通 LLM 或不同 prompt 策略时的表现未知。论文虽承认预算依赖性,但未系统扫描中间预算水平,结论外推需谨慎。
- - 原始轮次选择(**Turns + Jev**)在长对话或需要跨会话信息压缩时可能失效。论文第 5.6 节提到“Where Turns + Jev’s accuracy stops”,但未详细刻画失效条件。提取方法可通过蒸馏事实处理长程依赖与冗余,而选择方法受限于上下文窗口和候选轮次排序质量。当相关信息分散在多个低相关轮次或对话超过模型上下文时,选择可能遗漏关键事实。论文未与基于图的记忆遍历或层级压缩方法全面对比,也未测试动态预算分配策略。
- - 研究设计主要回答“选择是否不劣于提取”,而非“选择是否更优”。在小预算下两者相当,但在大预算下提取系统更准确,因此选择方法不能作为通用替代。Jev 的延迟优势测量基于特定硬件和实现,成本计算依赖 token 定价和调用次数,未考虑实际生产中的缓存、批量处理或基础设施差异。人类盲评虽缩小差距,但样本量和评分者间一致性未详尽报告,稳健性需进一步验证。