分析DeepSeek R1-Zero和R1,探讨无监督微调与AGI路径
刚刚发布了关于DeepSeek R1-Zero和R1的完整分析(ARC Prize),链接在下方。要点:
R1-Zero比R1更重要。
两者在ARC-AGI-1上得分均约15%,这与DeepSeek自身在数学和编码等逻辑领域的基准测试结果一致。
R1-Zero去除了最后的人类输入瓶颈——“专家CoT标注”(监督微调)。从那里到AGI,关键全在效率。
DeepSeek称R1-Zero存在不连贯和语言混杂问题,网上也有佐证,但我们测试中未发现。所有这一切表明:
1. 在强验证领域,SFT对于准确清晰的CoT推理并非必要。
2. R1-Zero训练过程能通过强化学习在token空间创建自己的内部领域特定语言(DSL)。
3. SFT目前对于扩大这类LLM架构的CoT推理领域泛化性是必需的。
这很直观:语言本身是一种推理DSL。同样的“词汇”可在一个领域学习后应用到另一领域(如程序)。纯强化学习方法尚未发现广泛的共享词汇,预计这会是未来研究重点。
最终,R1-Zero展示了零人类瓶颈的潜在扩展范式的原型——甚至在训练数据获取本身。
更广泛地说,公众对即将到来的推理需求知之甚少。o3击败ARC-AGI-1(低/高计算下75%/86%)几乎没有主流报道。前沿进展传播不够快,预计市场会更多波动。主流媒体有重要工作要做。
o1/o3/r1的基准准确率令人兴奋,但真正的实际影响是大幅提升可靠性,使得智能体在2025年终于开始工作。
我们还将看到“合成数据”(低质量)变成“真实数据”(高质量)——最终用户为此买单!这存在一个合理的权力集中潜在反馈循环需要理解。
R1-Zero和R1的开源对世界是好事,DeepSeek推动了科学进步。许多人告诉我他们计划将R1的想法用于ARC Prize 2025,我很期待。我们将迅速发现LLM+CoT搜索的极限。
R1-Zero比R1更重要。
两者在ARC-AGI-1上得分均约15%,这与DeepSeek自身在数学和编码等逻辑领域的基准测试结果一致。
R1-Zero去除了最后的人类输入瓶颈——“专家CoT标注”(监督微调)。从那里到AGI,关键全在效率。
DeepSeek称R1-Zero存在不连贯和语言混杂问题,网上也有佐证,但我们测试中未发现。所有这一切表明:
1. 在强验证领域,SFT对于准确清晰的CoT推理并非必要。
2. R1-Zero训练过程能通过强化学习在token空间创建自己的内部领域特定语言(DSL)。
3. SFT目前对于扩大这类LLM架构的CoT推理领域泛化性是必需的。
这很直观:语言本身是一种推理DSL。同样的“词汇”可在一个领域学习后应用到另一领域(如程序)。纯强化学习方法尚未发现广泛的共享词汇,预计这会是未来研究重点。
最终,R1-Zero展示了零人类瓶颈的潜在扩展范式的原型——甚至在训练数据获取本身。
更广泛地说,公众对即将到来的推理需求知之甚少。o3击败ARC-AGI-1(低/高计算下75%/86%)几乎没有主流报道。前沿进展传播不够快,预计市场会更多波动。主流媒体有重要工作要做。
o1/o3/r1的基准准确率令人兴奋,但真正的实际影响是大幅提升可靠性,使得智能体在2025年终于开始工作。
我们还将看到“合成数据”(低质量)变成“真实数据”(高质量)——最终用户为此买单!这存在一个合理的权力集中潜在反馈循环需要理解。
R1-Zero和R1的开源对世界是好事,DeepSeek推动了科学进步。许多人告诉我他们计划将R1的想法用于ARC Prize 2025,我很期待。我们将迅速发现LLM+CoT搜索的极限。