行业新闻

港科大发布 LexAgentHallu 基准,追踪法律智能体的隐性幻觉

港科大发布 LexAgentHallu,把法律智能体的幻觉评测从最终答案扩展到完整执行轨迹;最好配置仍有 89% 的轨迹出错。

香港科技大学提出 LexAgentHallu(法律智能体幻觉评测基准),不再只看最终答案对不对,而是沿整条执行轨迹逐步核对:智能体引用了哪条法源、调了什么工具、如何理解返回结果。在 3414 个实例上,表现最好的配置仍有 89% 的轨迹至少出现一次幻觉。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/bf424758-5cf0-4d51-ae48-53367fc56e81/048(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 让智能体分析一起法律案件,它可能检索法规、整理事实、列出理由,最后给出一个看起来完全正确的答案。 问题可能出在更早的一步:它引用了错误法源,算错了程序期限,或者误解了工具返回的内容。后面的推理越流畅,这个错误反而越容易被最终答案遮住。 如今,法律大模型正在从单轮问答走向智能体。系统不再只是生成一段文字,而是会规划任务、调用检索工具、读取材料,并依据中间结果继续行动。人们把更多步骤交给模型,也就更难逐项确认它究竟看到了什么、为什么作出当前判断。 一次幻觉,开始有了跨步骤的后果。 香港科技大学的研究团队将目光放在了这条执行链上。他们提出智能体幻觉评测基准 LexAgentHallu,把观察对象从最终答案扩展到完整轨迹,并将错误定位到具体步骤。 这项工作的出发点很直接:当一个智能体说“依据已经找到”“规则适用于当前事实”时,评测不能只看结论对不对, 还要检查支撑结论的理由是否真实、准确并且前后一致。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-26原文

相关内容