上海 AI 实验室推出 ArchSpace,推动大模型预训练过程全面开源
上海AI实验室通过ArchSpace平台公开大模型预训练的全过程和失败实验,终结靠“小道消息”获取研发经验的时代。
上海人工智能实验室推出大模型开源平台 ArchSpace,不仅开放最终模型参数,还公开预训练过程中的全量 checkpoints、实验记录和架构取舍决策。社区可提交架构创新提案,经同行评议后在统一流程下验证,让大模型研发从“结果开源”走向“过程开放”。
正文摘录
.jpg) 这一次,上海人工智能实验室(以下简称:上海 AI 实验室)不仅开源模型参数,更将大模型研发的「黑盒」打开。全量 Checkpoints、训练日志、内部架构采纳与取舍全过程实验全面公开。基模架构探索平台 ArchSpace 正式亮相,开启大模型开源全新阶段!当前,「下一个概念预测」模型(NCP)、深度注意力模型(Depth-Attention)等十余种架构创新提案正在开放验证。 告别「小道消息」:为什么我们需要一场开源范式革命? 过去几年,大模型架构快速演进,新方法层出不穷。但哪些尝试真正有效,哪些最终被放弃,又是基于什么作出取舍,外界往往无从得知。对于 LLM 架构创新的工作来说,如果说有比一个新想法更重要的,那可能会是公开、完整的验证过程,以及对成功和失败经验的如实记录。 在大语言模型(LLM)狂飙突进的今天,另一个不容忽视的现实是: 最前沿的研发进展,正日益集中于掌握巨量计算资源的科技巨头手中。 科技巨头的研发节奏极快,而传统学术界从实验、论文撰写到投稿、审稿、发表的漫长周期,在以天为单位的产业迭代面前显得捉襟见肘。 由此出现了一个颇为尴尬的现象: AI 领域最前沿的技术细节与研发经验,越来越多地依靠私下交流、业内传闻乃至「小道消息」传播。 无论学术界还是工业界,都缺乏一个公开、规范、记录可靠,并能让实验结果完整回溯的公共创新平台。 尤其在基础模型架构创新中,这一问题尤为突出。每一代开源基模发布,往往带来新的架构设计,但这些设计背后的探索过程 —— 哪些方案经过验证,哪些尝试最终失败,又为何做出取舍 —— 很少被完整公开。