GPT-5在钟面测试中表现不稳定,有成功也有失败 Alek Safar有趣——我确实看到模型也有成功的时候,在全面运行API之前,通过UI稍微尝试了GPT-5,结果也是有输有赢,但输得多一些。通常,模型在需要高精度的时钟任务上更难(比如没有刻度的时钟和简单指针位置的任务成功率较高)。这里有一个公共数据集样本,如果你有兴趣进一步测试:https://t.co/W5jX2R3uTP 动态Alek Safar2025-09-07原文 打开互动版