行业新闻

AlphaGo 开发者:LLM 缺少真正的推理能力

AlphaGo 的创造力来自搜索式推理;LLM 的思维链只是同一套 token 预测的延长,并非独立推理机制。

2016 年 AlphaGo 对李世石第二局的第 37 手看似荒谬,实为直觉网络与搜索机制共同作用的结果。作者据此指出,今天的大模型只做下一个 token 的预测,缺少这种可拆解、可检验的推理能力。

正文摘录

2016 年 3 月的一个下午,在首尔,我看着一个自己参与构建的程序把一颗棋子落在围棋棋盘的五路上——那一手看起来像是送给人类对手的礼物。这场五番棋第二局的第 37 手显得如此荒谬,以至于一些解说员以为那是程序故障。并不是。AlphaGo 赢下了那盘棋,最终以 4-1 战胜了史上最伟大的职业围棋棋手之一李世石(Lee Sedol)。"我原以为 AlphaGo 是基于概率计算的,不过是一台机器而已,"李世石 [后来表示](https://vialogue.wordpress.com/2018/02/16/alphago-reflections-and-quotes/)。"但当我看到这一手时,我改变了想法。毫无疑问,AlphaGo 是有创造力的。" 1997 年深蓝(Deep Blue)击败当时的国际象棋世界冠军加里·卡斯帕罗夫(Garry Kasparov)时,靠的是为每一方各向前推算六到八步、每秒评估 2 亿个棋局,以及人类硬编码进去的规则。围棋要复杂得多。一颗棋子的价值,取决于相隔遥远的棋块与地盘在之后数十手中如何演变。哪怕只计算其中一小部分可能结果,超级计算机也要花上数十亿年。要取胜,AlphaGo 必须一眼看出谁占优,甚至发明出人类从未想到要下的着法。 正因如此,许多关于 AlphaGo 对阵李世石的叙述,都把第 37 手描绘成纯粹机器直觉的闪光。但那是一种误解。做出这个创造性选择的,其实是 AlphaGo 的推理能力——而这恰恰是当今 AI 所缺乏的能力。如果我们希望未来的 AI 系统在科学、医学等领域产出可信的结果和真正新颖的洞见,就需要让它们具备这种真正的推理能力。 AlphaGo 由两套系统组成。第一套是它的策略网络(policy network),被训练来猜测一位强人类棋手会下哪里。

阅读原文(technologyreview.com)→

行业新闻Thore Graepel2026-10-02原文

相关内容