行业新闻

清华与沃顿学者用GPT-5.6证明梯度下降纯步长调度存在收敛极限

清华与沃顿学者用GPT-5.6证明梯度下降纯步长调度存在收敛极限

这项研究首次证明梯度下降仅靠调步长存在数学天花板,且核心证明由AI完成,人类只负责监督。

梯度下降(训练AI模型的基础优化算法)靠调整步长序列能跑多快?清华和沃顿的研究者用GPT-5.6给出了40年未解的下界证明:纯调步长无法达到Nesterov加速的O(1/T²)收敛速度,极限指数约为1.9319。完整证明已用Lean 4形式化验证,零跳过。

正文摘录

![CUUCbSv7ZodfAJxVuZ3c9ypCn9f](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3f978fc03e.webp) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg3b253ef414-175.png) 训练一切 AI 的算法,被 AI 自己判了「死刑」? 就在最近,清华大学和宾大沃顿商学院的两位研究者挂出一篇新论文,给了一个优化理论界等了 40 年的结论—— 梯度下降想跑到最快,光调步长没用。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgbb1d19070a.webp) ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimg911e89fce3.webp) 这是历史上第一次有人证明,梯度下降光靠设计步长序列,存在一道跨不过去的数学天花板。 而且,完成核心证明的不是人,是 GPT-5.6 Sol Pro。 ![](https://aiera.com.cn/wp-content/uploads/2026/08/aieraimgdf9d89c9b2-173.png) GPT-5.6 搞定了一个 40 年没人答过的问题 事情是这样的。 梯度下降大家都知道,从 GPT 到 Stable Diffusion 到自动驾驶,底下跑的都是它。标准梯度下降的收敛速度是 O(1/T),跑 T 步,误差大概降到 1/T 的量级。 1983 年,Nesterov 给梯度下降加上动量,直接推到了 O(1/T²) 。同样跑 1000 步,误差从千分之一变成百万分之一,差三个数量级。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-08-24原文

相关内容