动态

仅看通过/失败分数难解读 evals,benchmark 失败多因隐藏测试过严

Thariq
如今仅凭通过/失败分数,基本上已经无法解读 evals 了。

我在 benchmark 中看到的许多失败,都是由于过于严格的隐藏测试造成的;在某些情况下,模型的答案比预期的 eval 结果更合理。
动态Thariq2026-09-11原文

相关内容