澄清 GenAI 非平均输出,RL 可超越人类分布
我听到关于 GenAI 的最大误解是:它不可避免地输出垃圾,因为它被训练成输出“互联网的平均值”。但这根本不是真的。它被训练成建模*整个分布*,而 RL 让它超越人类分布。
AlphaGo 就是完美的证明。它通过大量围棋对局的学习掌握了人类分布。然后,它利用 RL 超越了人类分布,发现了第 37 手——人类专家最初误认为是昏招的绝妙一着。
AlphaGo 是一个狭窄的领域,拥有无限的课程和完美的奖励信号。现实世界要困难得多,AI 智能的不规则前沿尚未真正超越顶尖人类能力。
但我们已经开始看到 LLM 为科学研究做出有意义贡献。随着预训练、RL 和测试时计算的进一步扩展,我预计我们很快就会看到科学领域的“第 37 手”。
AlphaGo 就是完美的证明。它通过大量围棋对局的学习掌握了人类分布。然后,它利用 RL 超越了人类分布,发现了第 37 手——人类专家最初误认为是昏招的绝妙一着。
AlphaGo 是一个狭窄的领域,拥有无限的课程和完美的奖励信号。现实世界要困难得多,AI 智能的不规则前沿尚未真正超越顶尖人类能力。
但我们已经开始看到 LLM 为科学研究做出有意义贡献。随着预训练、RL 和测试时计算的进一步扩展,我预计我们很快就会看到科学领域的“第 37 手”。
三年前我们还能通过画独角兽来展示 AI 的前沿。今天我们通过触及科学前沿的 AI 输出来展示:https://t.co/ALJvCFsaie
请自行判断 AI 辅助科学加速的现状,并希望你能从中获得一些启发!https://t.co/5pxuUp9x3r