Evals不是骗局,是被误解,关键在于正确理解和使用
这个帖子没有抓住要点。Evals不是骗局,而是被误解了。
以下是我对evals的看法:
日志记录不是评估。这就像说完成考试等同于在考试中得分一样。
想象你参加了一场考试。你从自我测试开始。你进行直观检查以发现一些失败。你通过更好的提示修复这些问题。你将它们组合成一个包含10个问题的真实数据集。
但现在你想扩大你的产品规模。“品味”是不可扩展的。你的数据集是否真正提供了测试覆盖率?🤔 你创建了一个新的数据集来评估另一组任务。你发现Gemini在这个数据集上表现更好,但GPT-5在另一个数据集上表现更好——你会选择哪一个?
你查看你的LLM评分器得分,发现你的评分器与人类不一致。你意识到你一直在不可信的指标上攀爬。🤯 你想知道,你的GPT-5评分器是否偏向于GPT-5的回答?
你可以自我测试。或者让朋友测试你,得到更少偏见的分数。请教老师,发现你以前没见过的失败。Evals很难,很重要,并且正在引导AGI的发展和应用。
以下是我对evals的看法:
日志记录不是评估。这就像说完成考试等同于在考试中得分一样。
想象你参加了一场考试。你从自我测试开始。你进行直观检查以发现一些失败。你通过更好的提示修复这些问题。你将它们组合成一个包含10个问题的真实数据集。
但现在你想扩大你的产品规模。“品味”是不可扩展的。你的数据集是否真正提供了测试覆盖率?🤔 你创建了一个新的数据集来评估另一组任务。你发现Gemini在这个数据集上表现更好,但GPT-5在另一个数据集上表现更好——你会选择哪一个?
你查看你的LLM评分器得分,发现你的评分器与人类不一致。你意识到你一直在不可信的指标上攀爬。🤯 你想知道,你的GPT-5评分器是否偏向于GPT-5的回答?
你可以自我测试。或者让朋友测试你,得到更少偏见的分数。请教老师,发现你以前没见过的失败。Evals很难,很重要,并且正在引导AGI的发展和应用。
Evals是骗局。我们被诱导相信它们不是。
新帖子刚发布(🧵)。