行业新闻

中国电信研究院等提出 HaluMem:首个智能体记忆系统操作级幻觉评测基准,被 EMNLP 2026 接收

现有的记忆评测只看最终回答对不对,HaluMem 给中间每一步都配了标准答案,能区分「记错了」和「答错了」——这决定了该修检索还是修写入。

AI 助手把用户的职位说错,错误未必发生在回答那一刻——也可能在写入记忆时就错了。中国电信研究院与 MemTensor 等提出 HaluMem,把评测拆到记忆提取、记忆更新、记忆问答三个环节,逐段定位错误来源。该工作是首个面向智能体记忆系统的操作级幻觉评测基准,已被 EMNLP 2026 主会接收。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/9ceb5dfd-5b99-439b-8118-41dd23f35718/011(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 当 AI 助手把你的新职位说错时,我们很容易把它归结为:模型又在「胡说八道」。 但错误一定发生在回答的那一刻吗? 想象一下,你已经告诉助手自己刚刚升职。它可能在整理对话时就记错了职位,也可能保留着旧记录、没有完成更新,还可能拿到了正确记忆,却在回答时换成另一个头衔。最后呈现给用户的,都是一句错误答案。 同样是「答错」,背后却可能是完全不同的记忆故障。 中国电信研究院与上海记忆张量( MemTensor )公司等研究者围绕这一问题提出了 HaluMem:首个面向智能体记忆系统的操作级幻觉评测基准 。它将评测深入到记忆提取、记忆更新和记忆问答三个环节,追踪错误究竟在哪里产生,以及如何影响后续回答。 该工作已被自然语言处理领域顶级会议 EMNLP 2026 主会接收 。 如果一本笔记在写入时就记错了,之后再熟练地翻阅,也可能只是更准确地找回错误。要判断 AI 的记忆是否可靠,我们需要检查这本「笔记」是怎么写成、怎么修改、又怎么被使用的。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-30原文

相关内容