动态

Fchollet主张以成本维度评估AI模型性能

Fchollet主张以成本维度评估AI模型性能
Greg Kamradt
在推理算力任意可用的世界里,不报告能耗/成本的性能指标至少具有误导性。这就是为什么我们在@arcprize中采用了2x2性能指标——你不仅能看到每成本的缩放曲线,还能更准确地比较模型。
Noam Brown
LLM评估适应缓慢。MMLU/GSM8K在过时后仍被长期报告。我认为下一个消失的是用单一数字比较模型。智能/成本是更好的指标。我喜欢o1-mini发布时的这个图:https://t.co/U4ry4S3chR
动态Greg Kamradt2025-02-20原文

相关内容