动态

希望创建对普通人更有用的LLM基准测试

Matt Wolfe
我想和某人合作,为新的LLM模型创建一个基准测试。我对LMArena这类排行榜的问题在于,它们严重偏向于美观和整洁的格式。而大多数其他基准测试则偏向于复杂推理、科学、数学和编程...问题在于,这些基准测试并不能真正告诉普通个人或小企业,最新的模型是否会显著改善他们的日常生活或工作流程。大多数人并不一定需要他们的模型在科学或数学上最出色。他们只是想知道这个新模型是否能做一些以前模型做不到的、对他们今天有价值的事情。我还不清楚这个基准测试具体是什么样子,但我想与某人(或一群人)合作,创建一个对普通人有意义的东西...即“这个模型对我的非技术朋友有用吗”的基准或排行榜。或者也许已经存在这样的东西但我不知道?我只是想找到或构建一些能填补这个空白的东西。
动态Matt Wolfe2026-04-09原文

相关内容