作者询问普通用户测试LLM的提示,比较模型实用性。
有哪些好的“普通人”提示可以用来测试大语言模型?我想看看不同的大语言模型在普通非技术人员希望从AI获得的东西上表现如何。
别误会,这些模型能解答大多数人不懂的数学题、编写FPS游戏代码、解开晦涩谜语,这确实非常令人印象深刻……但这并不是世界上99%的人使用这些模型的用途。
我们可以创建哪些基准测试来告诉我们,模型是否能让人们更高效、帮助他们解决生活中的问题,或赋予他们真正有用的新超能力?我们可以尝试哪些“普通人实用性”测试,让我爸爸或我的教师邻居可能真正感到兴奋?
真诚提问……我希望得到一套好的测试提示,我们可以用它们作为基准,随着新模型的发布来评估这些东西。
别误会,这些模型能解答大多数人不懂的数学题、编写FPS游戏代码、解开晦涩谜语,这确实非常令人印象深刻……但这并不是世界上99%的人使用这些模型的用途。
我们可以创建哪些基准测试来告诉我们,模型是否能让人们更高效、帮助他们解决生活中的问题,或赋予他们真正有用的新超能力?我们可以尝试哪些“普通人实用性”测试,让我爸爸或我的教师邻居可能真正感到兴奋?
真诚提问……我希望得到一套好的测试提示,我们可以用它们作为基准,随着新模型的发布来评估这些东西。