发布AA-Omniscience基准,评估模型知识幻觉,大多数模型更易产生幻觉
宣布AA-Omniscience,这是我们针对40多个主题的知识和幻觉的新基准,结果显示除三个模型外,其他所有模型更倾向于产生幻觉而非给出正确答案。
语言模型中的嵌入知识对于许多实际用例很重要。没有知识,模型会做出错误的假设,并且在现实世界环境中运行的能力有限。像网络搜索这样的工具可以提供支持,但模型需要知道搜索什么(例如,模型不应在MCP查询中搜索“多客户端持久性”,而应搜索“模型上下文协议”)。
事实信息的幻觉是依赖模型的一个障碍,并且每个主要评估数据集都加剧了这个问题。对正确答案评分而不惩罚错误答案,会激励模型(及其训练实验室)尝试回答每个问题。这个问题在知识方面最为明显:事实信息永远不应编造,而在其他情况下,可能不起作用的尝试是有用的(例如编码新功能)。
Omniscience Index是我们为AA-Omniscience报告的关键指标,它通过扣分来惩罚模型在不知道答案时猜测的行为。AA-Omniscience显示,除三个模型外,其他所有模型在面对困难问题时更倾向于产生幻觉而非给出正确答案。AA-Omniscience将补充Artificial Analysis Intelligence Index,以纳入知识和幻觉概率的测量。
详情如下,更多图表在推文串中。
AA-Omniscience详情:
- 🔢6,000个问题,涵盖6个领域(“商业”、“人文社会科学”、“健康”、“法律”、“软件工程”和“科学、工程与数学”)中的42个主题
- 🔍 89个子主题,包括Python数据库、公共政策、税务等,更清晰地展示模型在哪些领域表现出色,在哪些细致领域存在不足
- 🔄 错误答案在我们的知识可靠性指数指标中会被扣分,以惩罚幻觉
- 📊3个指标:准确率(正确百分比)、幻觉率(错误/放弃中错误的百分比)、Omniscience Index(回答正确+1,回答错误-1,放弃回答0)
- 🤗 开源测试数据集:我们将开源600个问题(10%),以支持实验室开发事实性和可靠的模型。主题分布和模型性能与完整集一致(@huggingface链接如下)
- 📃 论文:见下方研究论文链接
主要发现:
- 🥇 Claude 4.1 Opus在Omniscience Index中位居第一,其次是上周的GPT-5.1和Grok 4:即使是最好的前沿模型,得分也仅略高于0,意味着它们在构成AA-Omniscience的难题中给出正确答案的次数仅略多于错误答案。@AnthropicAI的领先地位源于低幻觉率,而OpenAI和xAI的位置主要源于更高的准确率(正确百分比)。
- 🥇 xAI的Grok 4在Omniscience Accuracy(我们简单的“正确百分比”指标)中位居第一,其次是GPT-5和Gemini 2.5 Pro:@xai的胜利可能归功于总参数规模和预训练计算量的扩展:@elonmusk上周透露,Grok 4拥有3万亿总参数,可能大于GPT-5和其他专有模型
- 🥇 Claude横扫幻觉排行榜:Anthropic占据了最低幻觉率的前三名,其中Claude 4.5 Haiku以28%领先,比GPT-5(高)和Gemini 2.5 Pro低三倍以上。Claude 4.5 Sonnet和Claude 4.1 Opus以48%分列第二和第三。
- 💭 高知识并不保证低幻觉:幻觉率衡量模型在缺乏所需知识时猜测的频率。准确率最高的模型,包括GPT-5模型和Gemini 2.5 Pro,在Omniscience Index中并未领先,因为它们倾向于
语言模型中的嵌入知识对于许多实际用例很重要。没有知识,模型会做出错误的假设,并且在现实世界环境中运行的能力有限。像网络搜索这样的工具可以提供支持,但模型需要知道搜索什么(例如,模型不应在MCP查询中搜索“多客户端持久性”,而应搜索“模型上下文协议”)。
事实信息的幻觉是依赖模型的一个障碍,并且每个主要评估数据集都加剧了这个问题。对正确答案评分而不惩罚错误答案,会激励模型(及其训练实验室)尝试回答每个问题。这个问题在知识方面最为明显:事实信息永远不应编造,而在其他情况下,可能不起作用的尝试是有用的(例如编码新功能)。
Omniscience Index是我们为AA-Omniscience报告的关键指标,它通过扣分来惩罚模型在不知道答案时猜测的行为。AA-Omniscience显示,除三个模型外,其他所有模型在面对困难问题时更倾向于产生幻觉而非给出正确答案。AA-Omniscience将补充Artificial Analysis Intelligence Index,以纳入知识和幻觉概率的测量。
详情如下,更多图表在推文串中。
AA-Omniscience详情:
- 🔢6,000个问题,涵盖6个领域(“商业”、“人文社会科学”、“健康”、“法律”、“软件工程”和“科学、工程与数学”)中的42个主题
- 🔍 89个子主题,包括Python数据库、公共政策、税务等,更清晰地展示模型在哪些领域表现出色,在哪些细致领域存在不足
- 🔄 错误答案在我们的知识可靠性指数指标中会被扣分,以惩罚幻觉
- 📊3个指标:准确率(正确百分比)、幻觉率(错误/放弃中错误的百分比)、Omniscience Index(回答正确+1,回答错误-1,放弃回答0)
- 🤗 开源测试数据集:我们将开源600个问题(10%),以支持实验室开发事实性和可靠的模型。主题分布和模型性能与完整集一致(@huggingface链接如下)
- 📃 论文:见下方研究论文链接
主要发现:
- 🥇 Claude 4.1 Opus在Omniscience Index中位居第一,其次是上周的GPT-5.1和Grok 4:即使是最好的前沿模型,得分也仅略高于0,意味着它们在构成AA-Omniscience的难题中给出正确答案的次数仅略多于错误答案。@AnthropicAI的领先地位源于低幻觉率,而OpenAI和xAI的位置主要源于更高的准确率(正确百分比)。
- 🥇 xAI的Grok 4在Omniscience Accuracy(我们简单的“正确百分比”指标)中位居第一,其次是GPT-5和Gemini 2.5 Pro:@xai的胜利可能归功于总参数规模和预训练计算量的扩展:@elonmusk上周透露,Grok 4拥有3万亿总参数,可能大于GPT-5和其他专有模型
- 🥇 Claude横扫幻觉排行榜:Anthropic占据了最低幻觉率的前三名,其中Claude 4.5 Haiku以28%领先,比GPT-5(高)和Gemini 2.5 Pro低三倍以上。Claude 4.5 Sonnet和Claude 4.1 Opus以48%分列第二和第三。
- 💭 高知识并不保证低幻觉:幻觉率衡量模型在缺乏所需知识时猜测的频率。准确率最高的模型,包括GPT-5模型和Gemini 2.5 Pro,在Omniscience Index中并未领先,因为它们倾向于