GLM4.5训练总结:架构优化与数据策略
GLM4.5
@Zai_org
训练回顾:
1) 架构/学习动态
> 更深的模型和更多的注意力头带来更好的推理能力。注意力头对损失无影响,但提升MMLU/BBH。
> 使用Muon优化器与QK归一化
> 部分RoPE
> MTP以改进推测解码
2) 数据阶段
> 15T然后7T(大量)代码加上之前的一些混合以防止遗忘。
> 中训练:32k含仓库和合成推理数据。然后128k含智能体和长上下文数据。他们还提到在此阶段使用了指令数据。
他们还开源了基于Megatron-LM和sglang的RL框架(slime)!!
@Zai_org
训练回顾:
1) 架构/学习动态
> 更深的模型和更多的注意力头带来更好的推理能力。注意力头对损失无影响,但提升MMLU/BBH。
> 使用Muon优化器与QK归一化
> 部分RoPE
> MTP以改进推测解码
2) 数据阶段
> 15T然后7T(大量)代码加上之前的一些混合以防止遗忘。
> 中训练:32k含仓库和合成推理数据。然后128k含智能体和长上下文数据。他们还提到在此阶段使用了指令数据。
他们还开源了基于Megatron-LM和sglang的RL框架(slime)!!