推出ClockBench,模拟时钟视觉推理基准,人类大幅领先AI Alek Safar推出 ClockBench,一个专注于用模拟时钟读时间的视觉推理 AI 基准测试:在 11 个测试的领先 LLM 中,人类平均准确率 89.1%,而顶级模型仅 13.3%。与 @fchollet 的 ARC-AGI-2 难度相当,且对模型来说似乎比 @hendrycks 的 Humanity's Last Exam 更难。灵感来自 @PMinervini、@aryopg 和 @rohit_saxena 的原始见解。 动态Alek Safar2025-09-06原文 打开互动版