动态

澄清 GenAI 非平均输出,RL 可超越人类分布

澄清 GenAI 非平均输出,RL 可超越人类分布
Noam Brown
我听到关于 GenAI 的最大误解是:它不可避免地输出垃圾,因为它被训练成输出“互联网的平均值”。但这根本不是真的。它被训练成建模*整个分布*,而 RL 让它超越人类分布。

AlphaGo 就是完美的证明。它通过大量围棋对局的学习掌握了人类分布。然后,它利用 RL 超越了人类分布,发现了第 37 手——人类专家最初误认为是昏招的绝妙一着。

AlphaGo 是一个狭窄的领域,拥有无限的课程和完美的奖励信号。现实世界要困难得多,AI 智能的不规则前沿尚未真正超越顶尖人类能力。

但我们已经开始看到 LLM 为科学研究做出有意义贡献。随着预训练、RL 和测试时计算的进一步扩展,我预计我们很快就会看到科学领域的“第 37 手”。
Sebastien Bubeck
三年前我们还能通过画独角兽来展示 AI 的前沿。今天我们通过触及科学前沿的 AI 输出来展示:https://t.co/ALJvCFsaie

请自行判断 AI 辅助科学加速的现状,并希望你能从中获得一些启发!https://t.co/5pxuUp9x3r
动态Noam Brown2025-11-20原文

相关内容