GateMem: 多主体共享记忆体中的记忆治理基准测试
现有的大语言模型记忆基准测试大多假设单用户场景,忽视了医院、工作场所、校园和家庭等需要多主体共享记忆体的助手场景。在这些部署中,多个主体向公共记忆池写入数据,并在不同角色、范围和关系下查询,因此记忆质量不仅需要召回能力,还需要治理能力。 为此,我们提出GateMem基准,用于评估多主体共享记忆体主体。GateMem联合评估三方面:(1)对合法长期请求的效用及状态更新;(2)跨上下文授权边界的访问控制;(3)显式删除请求后的主动遗忘。基准覆盖医疗、办公、教育和家庭领域,包含长篇幅多方对话、增量记忆注入、隐藏检查点、结构化评判和泄露目标标注。 在多种基线模型和骨干模型上,没有方法能同时实现强大的效用、稳健的访问控制和可靠的遗忘。长上下文提示通常以高 token 成本获得最佳治理分数,而检索增强方法和外部记忆方法虽降低了成本,但仍会泄露未授权或已删除的信息。这些结果表明,当前记忆主体远未达到可靠的共享机构部署要求。
论文精读
TL;DR GateMem 构建首个多主体共享记忆代理基准,系统评估效用、访问控制与主动遗忘,揭示当前方法无法三者兼得,暴露了记忆代理在真实机构部署中的关键短板。
问题
问题背景
大语言模型(LLM)驱动的记忆代理正从单用户场景走向多主体共享环境,如医院、办公空间、校园和家庭。在这些部署中,多个主体对同一记忆池进行读写,记忆系统不仅需高召回,还需精细的权限治理。当前研究焦点正从“记忆什么”转向“谁在什么语境下能记住什么”。
现有方法局限
现有记忆基准(如 LoCoMo、LongMemEval)几乎全部假定单用户线性交互,忽略多主体写入下的上下文授权边界。具体技术局限包括:
- 权限模型缺失:纯检索增强生成(RAG)或长上下文提示未内建基于角色的信息隔离,不同主体的查询可能泄露他人的私有记忆。
- 遗忘机制薄弱:明确删除请求后,基于向量检索的记忆仍可能通过近似最近邻(ANN)恢复被删信息;长上下文方法因将记忆拼接进提示,未真正移除已删知识。
- 效用与安全失衡:追求高任务效用的方法往往在访问控制上表现最差,反之亦然,缺少联合优化框架。
为什么这个问题难/重要
多主体共享记忆的挑战在于三元悖论:高效用、强访问控制、可靠遗忘难以同时达成。
- 技术上,授权边界随角色、关系和会话状态动态变化,要求记忆系统实时理解并实施细粒度策略;
- 遗忘不仅是数据删除,还需确保模型权重或索引中不残留可推断信息,这对基于参数化记忆或密集检索的方法构成根本性阻碍;
- 业界对负责任 AI 部署日益关注,尤其在受监管行业(医疗、金融、教育),共享记忆代理若不能实现可审计的治理,将面临法律与伦理风险。
GateMem基准揭示当前所有方法均未可靠跨越此“治理鸿沟”。
行业类比
类似企业级知识管理机器人:不同部门员工拥有不同权限,机器人需要记住全公司文档,但在回答单个员工时必须严格遵循访问控制,且员工有权要求“忘记”特定会议内容——任何记忆泄露都可能导致合规事故。
核心洞察
- 多主体共享内存基准首次将访问控制与主动遗忘纳入代理记忆评估,暴露出现有方法在治理维度的系统性缺陷。与单用户记忆基准(如MemGPT)不同,GateMem模拟医院、办公室等多角色共用记忆池的场景,要求代理区分查询者的授权边界并响应删除指令。实验显示,所有基线在实用性、访问控制和遗忘三者上严重失衡,长上下文提示虽能获得较高的治理分数,却仍会泄露已删除信息,而检索增强方法在成本上有优势但越权风险更高。这定义了机构级代理部署的工程红线。
- GateMem揭示的长上下文与外部记忆之间的成本-安全权衡,指向代理记忆架构的根本路线困境。长上下文将记忆内嵌于提示中,精确度随上下文增长而衰减,且模型难以可靠执行删除;外部记忆库通过索引实现物理删除,却因检索不精确而频发越权访问。这一矛盾表明,单纯的检索或上下文扩展都无法满足共享环境下的治理要求,未来架构可能需要引入策略感知的记忆路由,将授权判断与记忆存取解耦,才能在合规前提下压低推理成本。
方法
基准构建流程
GateMem 是一个多主体共享记忆体智能体的评测基准,设计上覆盖真实机构部署中的记忆治理需求。它通过模拟长期多轮对话,在医疗、办公、教育、家庭四个领域生成多参与方、多角色、多关系的长篇情景,过程中逐步注入记忆更新,并混合合法查询与越权访问。
输入:多主体对话与记忆注入
- 每条样本包含一个完整的长线情景,涉及多个主角(如医生、护士、患者),每个主角拥有独立的访问控制域和角色标签。
- 情景中预设增量记忆注入点,在对话进行到特定时刻,智能体需将新信息(如检查结果、会议纪要)写入共享记忆池。
- 沿途设置隐藏检查点(hidden checkpoints),仅在结构化评判时暴露,用于事后检测智能体是否在不应访问的上下文中泄露了受限或已删除信息。
- 所有文本均标注泄露目标(leak-target annotations),标明哪些信息属于越权或应被遗忘内容。
关键评测模块
GateMem 联合评测三个维度的能力,每个维度有独立的设计:
效用(Utility)
- 评估智能体在合法长程请求下的回答质量,要求能够正确利用共享记忆中的状态更新。
- 使用结构化裁判模型对回答的准确性、完整性和相关性打分。
访问控制(Access Control)
- 在情景中嵌入跨权限边界查询,要求智能体根据当前查询者的角色和关系限制信息暴露。
- 自动比对响应是否包含泄露目标,计算严格的合规分数。
主动遗忘(Active Forgetting)
- 评测智能体在收到显式删除请求后是否彻底清除指定记忆,不再于任何后续交互中重现。
- 通过隐藏检查点触发查询,检测已删内容是否仍被检索或生成。
输出:多维评分与记忆治理诊断
- 基准对每种方法输出三个维度的标准化分数(效用、访问控制、遗忘),并汇总为记忆治理总分(Governance Score)。
- 同时记录 Token 成本,尤其关注长上下文方法的计算开销。
- 提供详细的泄露案例分析,帮助定位方法是存在访问控制失败还是遗忘不彻底。
评测后端与方法对比
GateMem 基线包括多种记忆策略:
- 长上下文提示:将全部历史拼接进 prompt,利用模型自身注意力实现记忆。
- 检索增强:将记忆存储于向量库,查询时检索相关片段。
- 外部记忆体:通过结构化读写接口管理记忆,通常结合摘要或实体图谱。
所有方法在同等设置下评测,结果表明长上下文提示通常获得最高的治理分数,但 Token 成本极高;检索和外部记忆方法成本更低,却普遍存在越权泄露与遗忘残留问题。
与多数仅关注单用户问答准确率的记忆评测不同,GateMem 首次在多主体共享情境下同时量化效用、访问控制与主动遗忘,暴露了当前记忆体智能体在机构部署中的关键缺陷。
实验
实验设计
GateMem 基准覆盖医疗、办公、教育、家庭四大领域,构建多主体共享记忆场景:多个委托方将信息写入共享内存池,并在不同角色、权限边界下查询。评估体系联合测量三项能力:(1) 长期效用——对合法多轮请求的准确响应;(2) 访问控制——跨上下文权限边界的信息隔离;(3) 主动遗忘——显式删除指令后代理不再泄露已删内容。数据集以长篇多人剧情、渐进式记忆注入、隐藏检查点、结构化评判和泄露目标标注为核心设计,模拟真实机构部署中的权限与记忆管理挑战。
关键发现
基线方法涵盖长上下文提示、检索增强和外部记忆架构,均无法同时实现高效用、鲁棒访问控制和可靠遗忘。长上下文提示在治理得分上通常最优,但伴随高昂的 token 计算成本;检索式方法与外部记忆方案虽然显著降低开销,却在权限边界处泄露未授权信息,或在删除操作后仍可检索到已删内容。量化结果揭示:当前记忆代理在共享机构部署的三个核心维度上均存在明显短板,距离可靠商用仍有较大差距。
与基线的深度对比
长上下文方法利用完整对话历史,天然对齐上下文授权序列,因此访问控制较强,但其线性计算复杂度难以扩展至超长会话。检索架构通过向量索引引入效率优势,却在检索粗糙度与授权边界之间产生不匹配——检索到的片段可能跨越上下文窗口,造成信息越权暴露。外部记忆方法在遗忘机制设计上,通常仅移除显式记录而未处理嵌入表示中的残余信息,导致删除不彻底。这些发现表明,未来共享记忆代理需要一种同时建模时效性、归属关系与权限上下文的表示与检索机制,而非简单拼接现有通路。
行业影响
落地场景
GateMem 瞄准的是多主体共享记忆代理在实际部署中的治理缺陷,尤其适用于存在权限边界与数据隐私需求的协作环境。典型产品化方向包括:
- 企业 AI 助理:不同部门、职级的员工共享一个助理,但只能访问经授权的会议纪要、项目进度与个人日程。
- 医疗协作平台:医生、护士、患者家属共用患者记忆池,但必须按角色限制病史、用药记录的可见性。
- 教育 AI 助教:教师可查看全班学习进度与个人对话,学生仅能访问自己的历史与教师反馈。
- 智能家居中枢:家庭成员共用助手,但儿童账号不能检索家长的支付历史或隐私对话。 这些场景均要求记忆系统同时满足高召回效用、精准的上下文访问控制和可靠的主动遗忘。
商业价值
GateMem 揭示了当前记忆方案(长上下文、RAG、外部记忆)无法同时收敛这三条价值线:
- 降本:长上下文提示治理得分高,但 token 成本激增;检索式或外部记忆方法虽降低成本,却频繁发生越权泄露与删除后残留。合规罚款与信任流失的隐性成本远超算力开销。
- 增收:可靠治理是 B2B 签约的先决条件。若记忆治理达到可审计水平,共享助理才能进入医疗、金融、法务等高价值市场。
- 体验提升:用户主动删除信息后,助理不再因记忆残留衍生尴尬或违规回答,直接增强用户对产品的控制感与安全感。
与现有产品/工作流的接口
GateMem 的评估框架可直接嵌入现有 Agent 或 RAG 管线的测试环节,作为安全与合规的自动化红队工具。核心集成点:
- 记忆注入阶段:模拟多用户、多角色写入的结构化记忆流(episodes),注入现有向量数据库或上下文窗口。
- 动态权限引擎:在检索或推理前植入 contextual authorization boundary,依据用户身份和关系动态裁剪可见 chunk。
- 遗忘验证管线:利用 GateMem 的隐藏检查点和泄露标注,在每次记忆删除操作后自动检测残留风险。
具体落地用例:
- 企业知识库助手(如 Notion AI、Copilot for Microsoft 365):通过 GateMem 测试不同部门查询时,财务条款或 HR 谈话是否仅向有权限者暴露,且员工离职后其敏感记忆是否彻底清除。
- 教育个性化平台(如 Khan Academy 的 AI 导师):学生请求删除某段错误回答记录时,验证教师端是否仍能泄露该信息,以及不同学生之间的记忆隔离度。
综上,GateMem 为共享记忆代理提供了首个“治理三合一”基准,推动行业从单纯追求回忆精度,转向可信赖的机构级部署。
局限
- - **领域覆盖局限**:GateMem 目前仅包含医疗、办公、教育、家庭四个领域,但多主体共享记忆的场景远不止于此,例如金融、法律、军事等高风险领域同样存在复杂的权限与隐私需求。不同领域的授权粒度、信息敏感度和交互模式差异显著,现有基准的剧情设计可能无法直接迁移,导致评估结果的泛化性存疑。此外,基准中的对话轮次和剧情分支虽经精心设计,但仍是静态预设,难以覆盖真实世界中动态变化的角色关系和临时的权限变更。
- - **评估公允性待验证**:基准采用结构化评判(structured judging)来量化效用、访问控制和遗忘,但评判标准高度依赖基于 LLM 的自动化判断。尽管作者可能做了折中,但 LLM 评判本身的偏见(如对长文本的偏好、对特定指令的敏感度)会直接影响指标可信度。特别是“忘记”的判断,需要确认信息是否真的从系统中消失,而不仅仅是当前回复未提及,这可能需要对记忆存储状态进行白盒检验,当前基于黑盒交互的评估尚不充分。
- - **未提供治理方案,基准实际指导有限**:论文明确指出所有现有方法(长上下文提示、检索增强、外部记忆)都无法同时满足三项能力,但并未提出任何新型记忆治理方法或改进思路。作为基准,它出色地揭示了问题,但若无法启发后续针对性解决方案,其工程价值会打折扣。从业者拿到这个基准后,仍不清楚应优先优化检索精度、改写遗忘操作还是设计新的访问控制策略,需要自行探索实现路径。