GLM4.5训练总结:架构、注意力头、优化器等
GLM4.5 @Zai_org 训练总结:
1) 架构/学习动态
> 更深的模型和更多的注意力头可提升推理能力。注意力头对损失无影响,但能改善MMLU/BBH。
> Muon优化器配合QK归一化
> 部分RoPE
> MTP用于更好的
1) 架构/学习动态
> 更深的模型和更多的注意力头可提升推理能力。注意力头对损失无影响,但能改善MMLU/BBH。
> Muon优化器配合QK归一化
> 部分RoPE
> MTP用于更好的
GLM4.5 @Zai_org 训练总结:
1) 架构/学习动态
> 更深的模型和更多的注意力头可提升推理能力。注意力头对损失无影响,但能改善MMLU/BBH。
> Muon优化器配合QK归一化
> 部分RoPE
> MTP用于更好的 https://t.co/WkowIC9AYR