OpenAI发布GPT-OSS开源模型,支持MoE、单GPU运行
OpenAI gpt-oss(开源模型)即将到来。GitHub页面已上线,但模型链接目前返回404,以下是所有信息:
– OpenAI的新GPT OSS系列(21B和117B参数)在v4.55.0版本中首次亮相,直接集成到`transformers`中。
– 两个模型都是稀疏混合专家(MoE),活跃参数仅3.6B/5.1B,并以4位MXFP4格式发布,使得120B模型可在一张80GB H100上运行,20B模型可在16GB GPU上运行。
– 纯文本、推理导向;支持思维链、可调推理深度、指令遵循和工具调用。
– 与GPT-4o相同的分词器,外加OpenAI Responses API的额外token,后者是推荐的推理路径。
– 为Transformers、vLLM、llama.cpp和ollama提供了参考实现;进一步加速支持Flash-Attention 3和MegaBlocks内核。
– Token-choice MoE结合SwiGLU、RoPE达到128K上下文、交替全上下文和128token滑动窗口注意力、每头学习到的sinks。
– 在Apache 2.0许可下发布,附带补充使用政策。
此次发布功能丰富,核心是使高容量GPT风格推理能够在单GPU硬件上实现,同时完善了更广泛的库。
– OpenAI的新GPT OSS系列(21B和117B参数)在v4.55.0版本中首次亮相,直接集成到`transformers`中。
– 两个模型都是稀疏混合专家(MoE),活跃参数仅3.6B/5.1B,并以4位MXFP4格式发布,使得120B模型可在一张80GB H100上运行,20B模型可在16GB GPU上运行。
– 纯文本、推理导向;支持思维链、可调推理深度、指令遵循和工具调用。
– 与GPT-4o相同的分词器,外加OpenAI Responses API的额外token,后者是推荐的推理路径。
– 为Transformers、vLLM、llama.cpp和ollama提供了参考实现;进一步加速支持Flash-Attention 3和MegaBlocks内核。
– Token-choice MoE结合SwiGLU、RoPE达到128K上下文、交替全上下文和128token滑动窗口注意力、每头学习到的sinks。
– 在Apache 2.0许可下发布,附带补充使用政策。
此次发布功能丰富,核心是使高容量GPT风格推理能够在单GPU硬件上实现,同时完善了更广泛的库。
@koltregaskes @sama 看看这个:https://t.co/GGZW1HdS73 应该能回答你的问题