动态

GLM4.5训练总结:架构、注意力头、优化器等

GLM4.5训练总结:架构、注意力头、优化器等
Andrew Curran
GLM4.5 @Zai_org 训练总结:

1) 架构/学习动态
> 更深的模型和更多的注意力头可提升推理能力。注意力头对损失无影响,但能改善MMLU/BBH。
> Muon优化器配合QK归一化
> 部分RoPE
> MTP用于更好的
elie
GLM4.5 @Zai_org 训练总结:

1) 架构/学习动态
> 更深的模型和更多的注意力头可提升推理能力。注意力头对损失无影响,但能改善MMLU/BBH。
> Muon优化器配合QK归一化
> 部分RoPE
> MTP用于更好的 https://t.co/WkowIC9AYR
动态Andrew Curran2025-07-28原文

相关内容