动态

Olmo 3 发布7B和32B模型,性能领先,完全开源。

Olmo 3 发布7B和32B模型,性能领先,完全开源。
Nathan Lambert
我们推出了 Olmo 3,新一代完全开源、领先的语言模型系列。该系列包括7B和32B模型,代表:1. 最佳的32B基础模型;2. 最佳的7B西方思维与指令模型;3. 首个完全开源的32B(或更大)推理模型。这对 Ai2 和 Olmo 项目来说是一个重要的里程碑。这些模型并非巨型模型,但对于完全开源模型的可行性而言,其性能竞争力至关重要——不仅仅是复制6到12个月前的模型。与往常一样,我们所有的模型都附带完整的训练数据、代码、中间检查点、训练日志和详细的技术报告。所有这些现已提供,年底前还会有更多补充。与 OLMo 2 32B 发布时一样,OLMo 3 32B 是有史以来最佳的开源语言模型。能够向更广泛的社区提供这些模型,帮助他们研究和理解当今人工智能的发展,是一种巨大的荣幸。基础模型 — 坚实的基础。预训练的消亡现在经常被夸大。2025年标志着整个行业重建其训练栈以专注于推理和智能体任务的一年,但一些已有的基础模型规模自2024年阿里巴巴 Qwen 2.5 以来一直没有新的领先模型。Olmo 3 32B 基础模型可能是我们最有影响力的成果,因为 Qwen3 没有发布其32B基础模型(可能出于竞争原因)。我们展示了我们的7B方案与 Qwen 3 竞争,而32B规模为强大的推理模型或专用智能体提供了起点。我们的基础模型性能与 Qwen 2.5 相当,超越了斯坦福的 Marin 和 Gemma 3,但由于提供预训练数据和代码,社区应更容易学习如何微调(并对我们的结果有信心)。我们期待社区将 Olmo 3 32B 基础模型用于许多方向。32B 是一个受欢迎的大小,便于在单块80GB以上显存的 GPU 甚至许多笔记本电脑上部署,比如我写这篇文章用的 MacBook。模型流水线 — 创建模型的生命周期。凭借这些强大的基础模型,我们创建了多种后训练检查点,以展示后训练可以满足不同需求的多种方式。我们称之为“模型流水线”。在后训练方面,我们发布了 Instruct 版本——简短、敏捷、智能,尤其适用于大规模合成数据(例如 Datology 最近在 OLMo 2 Instruct 上的工作),Think 版本——深思熟虑的推理者,在数学、代码等方面具有领先思维模型的性能,以及 RL Zero 版本——为研究人员理解如何从基础模型开始构建大规模 RL 的后训练配方提供受控实验。前两个后训练配方是从多种领先的、开源和闭源语言模型中蒸馏而来。在32B及更小规模下,直接蒸馏结合进一步的偏好微调和基于可验证奖励的强化学习(RLVR)正在成为一种可访问且高性能的流程。我们的后训练配方遵循我们最近的模型:1) 创建出色的 SFT 集,2) 使用直接偏好优化(DPO)作为一种高度可迭代、廉价且稳定的偏好学习方法(尽管有批评者),3) 最终进行大规模 RLVR。所有这些阶段都对模型的最终性能带来了有意义的改进。指令模型 — 低延迟的多面手。如今的指令模型有时被遗忘,但 Meta 的 Llama 3.1 Instruct 和更小、更简洁的模型是有史以来最受欢迎的开源模型之一。我们构建的指令模型是对 Tülu 3 流水线的一次重大打磨和演进——你会看到许多类似的数据集和方法,但几乎每个数据点或训练代码都得到了更新。Olmo 3 Instruct 应该是比 Llam
动态Nathan Lambert2025-11-20原文

相关内容