苹果用新谜题测试AI推理模型,否定其真实推理能力 Ruben Hassid苹果没有使用AI公司喜欢吹嘘的老套数学测试,而是创建了全新的谜题游戏。他们测试了Claude Thinking、DeepSeek-R1和o3-mini,这些模型从未见过这些问题。结果如下↓ 动态Ruben Hassid2025-06-07原文 打开互动版