Google Deepmind 研究员深度解读 OpenAI o1 与强化学习新范式
OpenAI o1 通过强化学习让模型学会分步推理,不再是简单预测下一个词,而是像人一样思考。
嘉宾Kimi Kong、Eric Li、苏辉
节目简介
OpenAI o1 模型通过强化学习和链式思维(chain-of-thought)大幅提升逻辑推理能力,甚至媲美博士生。三位有实战经验的嘉宾从技术原理、数据难点、行业影响等方面深度拆解,帮助理解这一可能的新范式。
OpenAI o1 通过强化学习让模型学会分步推理,不再是简单预测下一个词,而是像人一样思考。
嘉宾Kimi Kong、Eric Li、苏辉
OpenAI o1 模型通过强化学习和链式思维(chain-of-thought)大幅提升逻辑推理能力,甚至媲美博士生。三位有实战经验的嘉宾从技术原理、数据难点、行业影响等方面深度拆解,帮助理解这一可能的新范式。