斯坦福教授公开535B大模型训练全过程
首次公开前沿大模型完整训练过程,让外界能实时观察和讨论,推动训练透明化。
斯坦福教授 Percy Liang 启动训练 5350 亿参数的 Marin 模型,并全程公开数据配比、代码和实时 loss。训练将持续约 3 个月,任何人都能围观前沿大模型从零成长,这有望打破大模型训练的“黑箱”。
正文摘录
.jpg) 最近两天,X 上网友 Max For AI@MaxForAI 的一篇帖子引发了网友热议:「太疯狂了 —— 现在你甚至可以直播围观一个 535B 大模型是如何被训练出来的 。」  原来是 斯坦福大学教授、Simile AI 创始人 Percy Liang@percyliang 宣布由 Marin 开放实验室启动训练 Marin 535B-A23B 模型,并且整个训练过程将全程公开进行 。 Marin 拥有 5350 亿总参数、230 亿激活参数,为此,Percy Liang 和团队准备了总计 18.75 万亿 token 的训练数据,部署了 11 套 GB200 NVL72 系统,约合 792 颗 GB200 GPU。 预计模型将连续训练约 3 个月,总训练计算量约为 2.7e24 FLOPs。训练完成后,团队还将继续进行后训练(post-training)阶段。