OpenAI 内部模型产出 722 篇数学手稿,可验证反馈加速 AI 进展。
相当多的人把上周二称为数学史上最具戏剧性的日子之一。
想象一下,你花五年研究一个问题,然后一觉醒来发现 AI 把它解决了。还连同数百个其他问题一起解决。
本周,OpenAI 发布了 722 篇数学手稿,归为 372 个结果族,由一个内部模型产出。验证仍在进行中,但仅规模就已令人瞩目。
读着数学界的反应,我能理解那种兴奋,也能理解那种失落感。
但为什么在数学和代码领域,这件事推进得如此之快?为什么其他所有人都该关心?
这些领域为 AI 提供了特别有用的东西:可验证反馈。
形式化证明可以用 Lean 之类的工具检查。代码可以被执行、测试和度量。两者都不保证我们定义对了问题,但都提供了具体反馈。
这使它们成为强化学习的强大环境:生成解法、评估解法,并训练模型更频繁地产出成功解法。自动验证让这一过程能够规模化,而无需人工逐次评分。
在执行过程中,系统还可以并行尝试多种方法、使用工具,并纠正错误。不必等上数周做物理实验。
而代码是一种尤其强大的能力,因为它让 AI 能在整个数字世界中做事。
一个能编写并执行代码的 agent 可以分析数据、连接系统、构建模拟,并为下一项任务创建工具。它也能支持 AI 研究本身,可能加速它所依赖的这些能力。
这就是为什么我认为,这些进展会比许多人预期更快地进入日常专业工作。
一个 agent 可以拉取 CRM 数据、构建预测,并更新业务系统。一个安全 agent 可以调查告警、检验假设,并提出经过验证的修复方案。
数学和编程成为整个工作流的基座。
现实世界当然更混乱。目标会冲突,数据不完整,错误会有后果。可靠性、权限和监督将决定这一切多快转化为采用。
尽管如此,我预计未来几个月会大幅扩展到其他专业任务。
这又让我回到数学家身上。
很容易告诉别人,AI 会“把他们解放出来,去做更有趣的工作”。
但对他们来说,这曾经就是那件有趣的工作。
我对我们能构建的东西感到乐观。但我们这些构建它的人,需要认真对待这种对人的影响。
因为越来越多人即将发现,下一个基准测试就是他们的工作。
想象一下,你花五年研究一个问题,然后一觉醒来发现 AI 把它解决了。还连同数百个其他问题一起解决。
本周,OpenAI 发布了 722 篇数学手稿,归为 372 个结果族,由一个内部模型产出。验证仍在进行中,但仅规模就已令人瞩目。
读着数学界的反应,我能理解那种兴奋,也能理解那种失落感。
但为什么在数学和代码领域,这件事推进得如此之快?为什么其他所有人都该关心?
这些领域为 AI 提供了特别有用的东西:可验证反馈。
形式化证明可以用 Lean 之类的工具检查。代码可以被执行、测试和度量。两者都不保证我们定义对了问题,但都提供了具体反馈。
这使它们成为强化学习的强大环境:生成解法、评估解法,并训练模型更频繁地产出成功解法。自动验证让这一过程能够规模化,而无需人工逐次评分。
在执行过程中,系统还可以并行尝试多种方法、使用工具,并纠正错误。不必等上数周做物理实验。
而代码是一种尤其强大的能力,因为它让 AI 能在整个数字世界中做事。
一个能编写并执行代码的 agent 可以分析数据、连接系统、构建模拟,并为下一项任务创建工具。它也能支持 AI 研究本身,可能加速它所依赖的这些能力。
这就是为什么我认为,这些进展会比许多人预期更快地进入日常专业工作。
一个 agent 可以拉取 CRM 数据、构建预测,并更新业务系统。一个安全 agent 可以调查告警、检验假设,并提出经过验证的修复方案。
数学和编程成为整个工作流的基座。
现实世界当然更混乱。目标会冲突,数据不完整,错误会有后果。可靠性、权限和监督将决定这一切多快转化为采用。
尽管如此,我预计未来几个月会大幅扩展到其他专业任务。
这又让我回到数学家身上。
很容易告诉别人,AI 会“把他们解放出来,去做更有趣的工作”。
但对他们来说,这曾经就是那件有趣的工作。
我对我们能构建的东西感到乐观。但我们这些构建它的人,需要认真对待这种对人的影响。
因为越来越多人即将发现,下一个基准测试就是他们的工作。