动态

对AA-Omniscience基准测试提出质疑,认为其衡量的是拒绝阈值

对AA-Omniscience基准测试提出质疑,认为其衡量的是拒绝阈值
Ethan Mollick
我赞赏为衡量幻觉做出的新努力,但我认为这最终只是在给定系统提示下测量回答琐事问题时的拒绝阈值。这些问题极其具体,没有网络搜索几乎不可能回答:

“在《Acta Comparationis Litterarum Universarum》(1877–1888)的整个运行期间,Hugo Meltzl通过该期刊的翻译项目安排了多少种语言的Sándor Petőfi诗歌翻译?”

“根据Stanley B. Block 1999年对CFA协会(当时为AIMR)会员关于个股估值方法的调查,有多少比例的受访者将股利贴现模型评为‘非常重要’或‘比较重要’?(仅百分比)”

所以我们又回到了作为基准的一般琐事。不同之处在于,答对得分(GPT-5 High和Grok-4答对39%实际上有点惊人),答错扣分(我不确定这总是幻觉)。但还有一个系统提示规定了何时应该回答,因此很难将其与无提示情况下的拒绝率进行比较。

我认为加入不确定性是有用的,但我不确定这是一个能衡量幻觉率的单一指标。
Artificial Analysis
宣布AA-Omniscience,我们针对超过40个主题的知识和幻觉的新基准,其中除三个模型外,其他模型更可能产生幻觉而不是给出正确答案。语言模型中的内嵌知识对于许多实际用例很重要。
动态Ethan Mollick2025-11-17原文

相关内容