中国电信研究院等提出 HaluMem:首个智能体记忆系统操作级幻觉评测基准,被 EMNLP 2026 接收
现有的记忆评测只看最终回答对不对,HaluMem 给中间每一步都配了标准答案,能区分「记错了」和「答错了」——这决定了该修检索还是修写入。
AI 助手把用户的职位说错,错误未必发生在回答那一刻——也可能在写入记忆时就错了。中国电信研究院与 MemTensor 等提出 HaluMem,把评测拆到记忆提取、记忆更新、记忆问答三个环节,逐段定位错误来源。该工作是首个面向智能体记忆系统的操作级幻觉评测基准,已被 EMNLP 2026 主会接收。
正文摘录
.jpg)  当 AI 助手把你的新职位说错时,我们很容易把它归结为:模型又在「胡说八道」。 但错误一定发生在回答的那一刻吗? 想象一下,你已经告诉助手自己刚刚升职。它可能在整理对话时就记错了职位,也可能保留着旧记录、没有完成更新,还可能拿到了正确记忆,却在回答时换成另一个头衔。最后呈现给用户的,都是一句错误答案。 同样是「答错」,背后却可能是完全不同的记忆故障。 中国电信研究院与上海记忆张量( MemTensor )公司等研究者围绕这一问题提出了 HaluMem:首个面向智能体记忆系统的操作级幻觉评测基准 。它将评测深入到记忆提取、记忆更新和记忆问答三个环节,追踪错误究竟在哪里产生,以及如何影响后续回答。 该工作已被自然语言处理领域顶级会议 EMNLP 2026 主会接收 。 如果一本笔记在写入时就记错了,之后再熟练地翻阅,也可能只是更准确地找回错误。要判断 AI 的记忆是否可靠,我们需要检查这本「笔记」是怎么写成、怎么修改、又怎么被使用的。