动态

介绍prinzbench法律LLM基准测试及模型表现

介绍prinzbench法律LLM基准测试及模型表现
prinz
现在来看点完全不同的东西。介绍:prinzbench。

过去几个月,我越来越频繁地使用LLM处理法律工作,主要是法律研究和“大海捞针”式搜索查询。这类工作具有经济价值,是许多律师日常工作的内容。它也与前沿实验室通常“爬坡”的基准(即数学和编码)截然不同。重要的是,正确的法律分析不易验证。没有代码可编译,也没有数学证明显示对错。判断是否正确得出法律结论的唯一方法是确信:(1) 分析问题时没有遗漏任何法律权威;(2) 对相关法律权威的逻辑分析是正确的。

prinzbench是一个私有基准,旨在测试LLM执行此类工作的能力:搜索互联网获取相关信息,并适当分析以得出正确的法律结论。

该基准包含33个问题(25个法律研究,8个搜索)。每个模型对问题的回答由我亲自评分(不使用AI评分),采用pass@1。每个模型运行完整基准3次,最高分99(33题×3)。

这33个问题很难!我特意从自己(相当小众的法律领域)挑选了难题,并在决定是否将每个问题纳入prinzbench前,对各种LLM进行了临时测试。许多(原本已很难的)问题被这样筛选掉了。LLM在非常基本的法律研究上变得非常出色,而世界似乎几乎没有注意到!

结果摘要(更多细节见链接的Readme):

- GPT-5.2 Thinking是我测试的模型中最好的,并且是唯一一个(勉强)答对超过50%问题的模型。

- 两个Gemini 3模型基本并列第二。它们非常扎实。

- 最新的Grok模型和Kimi K2-Thinking在基准上的表现大致相同(相当差)。

- 对我来说最大的意外是Sonnet 4.5和Opus 4.5在基准中排名垫底,Sonnet轻松击败Opus。这些模型在搜索部分的表现*极差*,各得0/24分。Sonnet在法律研究部分的表现与Grok/Kimi大致相同。Sonnet 4.5似乎是比Opus 4.5更好的法律推理者。
动态prinz2026-01-21原文

相关内容