动态

Qwen3-Next预览版发布,采用混合架构与线性注意力

Qwen3-Next预览版发布,采用混合架构与线性注意力
Junyang Lin
Qwen3-Next,或者说我们下一代(3.5?)的预览版来了!
这次我们尝试大胆创新,但实际上我们已经在混合模型和线性注意力上实验了大约一年。我们相信,我们的解决方案至少是一个稳定且扎实的方案,适用于超长上下文的新模型架构!
GDN加混合架构基于大量试错,注意力门的实现就像免费午餐一样带来收益。
此外,我们继续研究MoE,并谨慎地进一步提高稀疏性,使其更高效、更有效!
让我们痛苦的是,你需要运行整个训练流程来评估新模型架构,这意味着预训练+后训练(特别是强化学习)。我们已经证明其有效性,并在RL后发布了指令模型和思考模型。
尽管如此,由于这是我们第一次发布全新的东西,我们仍然不确定做对了什么或做错了什么,需要社区的支持。特别感谢Hugging Face、vLLM和SGLang。他们付出了很多努力帮助我们把这个新模型带给大家!欢迎尝试并给我们反馈!
希望这是新征程的良好开端🚗
Qwen
🚀 推出 Qwen3-Next-80B-A3B — 高效LLM的未来来了!
🔹 80B参数,但每个token仅激活3B → 训练成本降低10倍,推理速度比Qwen3-32B快10倍(尤其在32K+上下文时!)
🔹 混合架构:门控DeltaNet + 门控注意力 → 速度与效率的完美结合 https://t.co/yO7ug721U6
动态Junyang Lin2025-09-11原文

相关内容