行业新闻

OpenAI 与谷歌前研究员创办新公司 探索持续学习架构

前 OpenAI、谷歌研究员质疑纯强化学习路线,提出下一代模型应具备部署后持续学习的能力。

两位大模型核心负责人离开 OpenAI 和谷歌后创业,认为强化学习(通过奖励试错训练模型的方法)不是通往 AGI 的钥匙。他们指出,当前模型只能在训练时学习,部署后无法持续适应新环境,因此需要从架构层面让模型在真实世界中继续学习。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/3b288430-9ff4-4aa9-a63a-0dfe1fa3c84f/05(2).jpg) 曾经最相信强化学习的人之一,如今却认为:强化学习没有把我们带到 AGI。 Jerry Tworek 曾是 OpenAI 内部坚定的「强化学习最大主义者」。在 GPT-3、GPT-4 之后,他一直相信,大模型缺少的最后一块拼图就是大规模强化学习。只要把这条路线真正推到极致,剩下的问题或许都会被解决。2024 年时,他甚至判断,AGI 可能会在 2025 年到来。 后来,他真的站到了这场实验的中心。 模型一代代变强,评测分数不断上涨,复杂推理能力也迅速提升。但 Jerry 看到的另一个事实是:实验室里的进展,并没有完整转化为现实世界中的可靠能力。训练任务越来越难,模型越来越会考试,却仍然无法适应大量模糊、变化且从未被预先定义的问题。 这让他开始怀疑,问题可能不只是强化学习还不够大,而是今天的模型根本缺少一种更基础的能力: 它们不会在进入真实世界后继续学习。 带着这个判断,Jerry 与 Rohan Anil 共同创办了 Core Automation。Rohan 曾是谷歌 Gemini 的预训练负责人之一,也长期研究优化算法、模型架构和底层计算系统。一个来自大规模强化学习,一个来自预训练与优化,两人的经历几乎覆盖了当前大模型的两条核心路线。 但他们决定不再沿着这两条路线继续加码。 当整个行业仍在扩大 Transformer、增加推理算力、追逐更强的编程智能体时,他们选择追问一个更根本的问题:如果模型只能在实验室中完成学习,需要人类不断收集数据、重新训练和发布新版本,它真的能够走向 AGI 吗?

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-05原文

相关内容