苹果研究揭示AI模型无法真正推理,模式匹配导致性能崩塌
🚨震惊:苹果刚刚证明AI模型不会做数学题。不是高等数学,而是小学算术,10岁孩子都能解的那种。
而他们证明的方式令人崩溃。
苹果研究人员拿AI界最流行的数学基准GSM8K——一套小学应用题——做了一处改动:只换了数字。问题相同,逻辑相同,步骤相同,只是数字不同。
每个模型的成绩都下降了。无一例外。25个最先进的模型都测试了。
但这还不是真正的实验。
真正的实验把一切搞崩了。
他们在数学题里加了一句话。一句与答案完全无关的话。与数学计算无关。人类看到会立刻忽略。
以下是论文中的实际例子:
"Oliver周五摘了44个猕猴桃。周六摘了58个。周日摘的是周五的两倍,但有5个比平均略小。Oliver共有多少个猕猴桃?"
正确答案是190。猕猴桃大小与数量无关。
10岁孩子会忽略"5个略小",因为明显无关,不影响总数。
但OpenAI的推理模型o1-mini减了5,得到185。
Llama也做了同样的事:减5,得185。
它们没有推理问题。它们看到数字5,看到一句听起来相关的话,就盲目地转换成减法。
模型根本不理解减法的含义。它们只是看到像减法的模式就应用。仅此而已。
苹果在所有模型上测试了这个。他们把这个数据集称为"GSM-NoOp"——即添加的从句是空操作(no-op),不改变任何东西。
结果惨不忍睹。
Phi-3-mini下降超过65%,仅因一句无关的话就丢失了超过一半的"数学能力"。
GPT-4o从94.9%掉到63.1%。
o1-mini从94.5%掉到66.0%。
o1-preview(当时OpenAI最强推理模型)从92.7%掉到77.4%。
即使事先给模型8个完全相同的问题示例,每次展示正确答案,也几乎没有帮助。模型仍然被无关从句迷惑。
这说明这不是提示词问题,也不是上下文问题,而是结构性的。
苹果研究人员还发现,模型将文字转化为数学运算时并不理解文字含义。看到"折扣"就乘,看到"较小"附近的数字就减,不管合不合理。
论文原话:"当前LLM不具备真正的逻辑推理能力;相反,它们试图复制训练数据中观察到的推理步骤。"
以及:"LLM很可能执行一种概率模式匹配与搜索,以找到训练数据中最接近的样本,缺乏对概念的真正理解。"
他们还测试了增加问题步骤数的效果。性能不仅下降,而且下降速率加速。一个问题加两个额外从句,Gemma2-9b从84.4%掉到41.8%,Phi-3.5-mini从87.6%掉到44.8%。需要的思考越多,模型崩塌得越厉害。
真正的推理者会放慢速度认真思考。这些模型不会放慢,它们做模式匹配。当模式足够复杂时,它们就崩溃了。
这篇论文发表于ICLR 2025,全球最负盛名的AI会议之一。
你正用AI辅助财务决策、检查法律文件、解决工作问题、帮孩子做作业。苹果刚刚证明,AI根本没有在思考。它只是在做模式匹配。一旦你的问题出现意外情况,它就崩溃了。它不会告诉你它崩溃了,只是自信满满地悄悄给出错误答案。
而他们证明的方式令人崩溃。
苹果研究人员拿AI界最流行的数学基准GSM8K——一套小学应用题——做了一处改动:只换了数字。问题相同,逻辑相同,步骤相同,只是数字不同。
每个模型的成绩都下降了。无一例外。25个最先进的模型都测试了。
但这还不是真正的实验。
真正的实验把一切搞崩了。
他们在数学题里加了一句话。一句与答案完全无关的话。与数学计算无关。人类看到会立刻忽略。
以下是论文中的实际例子:
"Oliver周五摘了44个猕猴桃。周六摘了58个。周日摘的是周五的两倍,但有5个比平均略小。Oliver共有多少个猕猴桃?"
正确答案是190。猕猴桃大小与数量无关。
10岁孩子会忽略"5个略小",因为明显无关,不影响总数。
但OpenAI的推理模型o1-mini减了5,得到185。
Llama也做了同样的事:减5,得185。
它们没有推理问题。它们看到数字5,看到一句听起来相关的话,就盲目地转换成减法。
模型根本不理解减法的含义。它们只是看到像减法的模式就应用。仅此而已。
苹果在所有模型上测试了这个。他们把这个数据集称为"GSM-NoOp"——即添加的从句是空操作(no-op),不改变任何东西。
结果惨不忍睹。
Phi-3-mini下降超过65%,仅因一句无关的话就丢失了超过一半的"数学能力"。
GPT-4o从94.9%掉到63.1%。
o1-mini从94.5%掉到66.0%。
o1-preview(当时OpenAI最强推理模型)从92.7%掉到77.4%。
即使事先给模型8个完全相同的问题示例,每次展示正确答案,也几乎没有帮助。模型仍然被无关从句迷惑。
这说明这不是提示词问题,也不是上下文问题,而是结构性的。
苹果研究人员还发现,模型将文字转化为数学运算时并不理解文字含义。看到"折扣"就乘,看到"较小"附近的数字就减,不管合不合理。
论文原话:"当前LLM不具备真正的逻辑推理能力;相反,它们试图复制训练数据中观察到的推理步骤。"
以及:"LLM很可能执行一种概率模式匹配与搜索,以找到训练数据中最接近的样本,缺乏对概念的真正理解。"
他们还测试了增加问题步骤数的效果。性能不仅下降,而且下降速率加速。一个问题加两个额外从句,Gemma2-9b从84.4%掉到41.8%,Phi-3.5-mini从87.6%掉到44.8%。需要的思考越多,模型崩塌得越厉害。
真正的推理者会放慢速度认真思考。这些模型不会放慢,它们做模式匹配。当模式足够复杂时,它们就崩溃了。
这篇论文发表于ICLR 2025,全球最负盛名的AI会议之一。
你正用AI辅助财务决策、检查法律文件、解决工作问题、帮孩子做作业。苹果刚刚证明,AI根本没有在思考。它只是在做模式匹配。一旦你的问题出现意外情况,它就崩溃了。它不会告诉你它崩溃了,只是自信满满地悄悄给出错误答案。