GLM 5.2训练误解:蒸馏解决冷启动,RL提升至Mythos
关于GLM 5.2的训练方式存在一个重大误解。是的,他们蒸馏了Claude和GPT 5.5——但蒸馏并不是他们达到Opus质量的原因。蒸馏只解决了RL中的冷启动问题。
对智能编码模型进行RL并不复杂。简单来说:
1. RL需要轨迹——模型在某个环境中实际完成任务的rollout
2. 任务没有成功轨迹=零梯度=无法进行RL。这就是冷启动问题
3. 蒸馏解决了这个问题。你在模型尚不能完成的任务上,用更智能的模型(Claude、GPT)的知识进行种子初始化
4. 现在模型在这些任务上产生正轨迹
5. 在这些轨迹上运行RL并爬升智能编码
6. 那时你不再需要蒸馏,可以仅通过爬升RL来得到更好的模型
这是一个有趣的曲线。我认为从零开始达到Opus 4.8比从Opus 4.8到Fable/Mythos级别更难。
GLM 5.2已经在产生正轨迹,所以他们有充足的RL材料——他们将继续爬升至Mythos质量,无需进一步蒸馏。他们不再需要美国模型。
对智能编码模型进行RL并不复杂。简单来说:
1. RL需要轨迹——模型在某个环境中实际完成任务的rollout
2. 任务没有成功轨迹=零梯度=无法进行RL。这就是冷启动问题
3. 蒸馏解决了这个问题。你在模型尚不能完成的任务上,用更智能的模型(Claude、GPT)的知识进行种子初始化
4. 现在模型在这些任务上产生正轨迹
5. 在这些轨迹上运行RL并爬升智能编码
6. 那时你不再需要蒸馏,可以仅通过爬升RL来得到更好的模型
这是一个有趣的曲线。我认为从零开始达到Opus 4.8比从Opus 4.8到Fable/Mythos级别更难。
GLM 5.2已经在产生正轨迹,所以他们有充足的RL材料——他们将继续爬升至Mythos质量,无需进一步蒸馏。他们不再需要美国模型。