DeepSeek训练不稳定,token翻倍后问题未解决
这就解释了延迟的原因……
deepseek 在将 v3 的约 15T tokens 翻倍至 v4 的约 33T tokens 后,未能修复训练不稳定问题
如果 mismatched routing 和 clamping 是主要的补丁,那么文中 10 多处提到的“稳定性”技巧似乎远远不够
但一如既往,为透明度点赞!
deepseek 在将 v3 的约 15T tokens 翻倍至 v4 的约 33T tokens 后,未能修复训练不稳定问题
如果 mismatched routing 和 clamping 是主要的补丁,那么文中 10 多处提到的“稳定性”技巧似乎远远不够
但一如既往,为透明度点赞!