动态

GLM 5.2训练误解:蒸馏解决冷启动,RL提升至Mythos

Andrew Curran
关于GLM 5.2的训练方式存在一个重大误解。是的,他们蒸馏了Claude和GPT 5.5——但蒸馏并不是他们达到Opus质量的原因。蒸馏只解决了RL中的冷启动问题。

对智能编码模型进行RL并不复杂。简单来说:

1. RL需要轨迹——模型在某个环境中实际完成任务的rollout

2. 任务没有成功轨迹=零梯度=无法进行RL。这就是冷启动问题

3. 蒸馏解决了这个问题。你在模型尚不能完成的任务上,用更智能的模型(Claude、GPT)的知识进行种子初始化

4. 现在模型在这些任务上产生正轨迹

5. 在这些轨迹上运行RL并爬升智能编码

6. 那时你不再需要蒸馏,可以仅通过爬升RL来得到更好的模型

这是一个有趣的曲线。我认为从零开始达到Opus 4.8比从Opus 4.8到Fable/Mythos级别更难。

GLM 5.2已经在产生正轨迹,所以他们有充足的RL材料——他们将继续爬升至Mythos质量,无需进一步蒸馏。他们不再需要美国模型。
动态Andrew Curran2026-06-24原文

相关内容