动态

GPT-5实际得分修正后低于Claude Sonnet 4

Graham Neubig
他们其实没有评估500个实例中的23个,所以实际得分是:74.9 * (500 - 23) / 500 = 71.4%,比Claude Sonnet 4低几个百分点。
动态Graham Neubig2025-08-07原文

相关内容