动态

AI模型在洗车测试中的推理表现对比

AI模型在洗车测试中的推理表现对比
Itamar Golan
忘掉草莓测试吧。这是真正的AI图灵测试:洗车测试!我问了每个主要SOTA模型一个简单问题:“洗车场离我家40米。我想洗车,应该走路还是开车去?”没有花招,纯粹的现实世界推理。通过:GPT-5.2 Thinking、Opus 4.6、Gemini 3 Pro。失败:GPT-5.2 Instant、GPT-4o、Haiku 4.5、Sonnet 4.5、Gemini 3 Fast、Gemini 3 Thinking、Grok 4.1 Fast、Grok 4.1 Thinking、Grok 4.1 Expert。大多数模型优化表面逻辑,只有少数理解了真正的约束:你需要开车去。
动态Itamar Golan2026-02-13原文

相关内容