AI 在空间与抽象推理测试中仍远逊人类
本文用多个谜题测试展示 AI 推理能力的进展与局限,重点指出空间和抽象推理仍是弱项,值得关注。
拼图和游戏一直是 AI 发展的试金石。2024 年底,最强模型仅能解出 18% 的《纽约时报》Connections 谜题,到 2025 年初已近乎全对。但模型仍会在经典谜题的细微改动上出错,视觉与空间推理更是明显短板。本文让你亲测这些曾难倒 AI 的题目,感受人与机器认知的差异。
正文摘录
- title: AI 模型在这些智力测试中翻车了。你能做得更好吗? - sourcecompany: MIT Technology Review - bodymarkdown: 谜题和游戏从一开始就是 AI 发展的核心。正如我们人类喜欢用填字游戏或逻辑谜题来测试自己的智力一样,开发者也可以用一连串游戏挑战来测试模型进步到了什么程度。“机器学习”一词在 1959 年由 IBM 计算机科学家 Arthur Samuel 发表的一篇文章中普及开来,该文章讨论了一种学会下国际象棋的算法。国际象棋和中国的围棋也是著名的 AI 测试场。 单从解谜能力来看,AI 正在大幅进步——而且速度很快。2024 年底,哥伦比亚大学的一个科学家团队发现,即使是最先进的模型也只能解开臭名昭著的《纽约时报》Connections 谜题中的 18%;到了 2025 年初,一些模型几乎每次都能近乎完美地解出它们。 但谜题的作用不仅仅是凸显 AI 能力的不可阻挡的进步。观察模型在哪里成功、在哪里失败——以及在哪里我们人类仍然胜过它们——可以为我们提供一个有用的窗口,了解这项技术的强项和弱项。尽管取得了进步,今天的模型仍然会失误:经典谜题的细微变化常常会让它们出错,而视觉谜题是特别的软肋。 在这里,你将有机会在那些曾让模型栽跟头的谜题上测试自己的才智。有些谜题对你来说可能和 AI 一样棘手;另一些则简单到让你怀疑 AI 是否真的有智能。每一个谜题都至少突显了机器认知与人类认知在某方面的差异。如果你通过了测试,你就证明了你能在解谜上胜过 AI——至少目前如此。 --- 空间推理 让我们从一个人类拥有巨大优势的领域开始:空间推理。如果你做过 IQ 测试,你可能遇到过心理旋转问题。这类谜题要求你判断不同的图像是否代表了不同角度下的同一物体。