动态

Qwen模型命名逻辑与系列划分介绍

Junyang Lin
人们经常问不同Qwen模型之间的关系以及命名背后的逻辑。目前,我们有几个不同的模型家族:LLM、Coder、VL、Omni,以及新加入的Image。虽然我们的长期目标是将其统一为单个真正的全能力模型,但目前仍将它们视为独立模型。

命名方式如下:

Qwen目前有四个主要系列——LLM、Coder、VL、Omni——加上新的Qwen-Image。前四个系列的命名相当直接。我们提供Instruct和Thinking变体,开源模型遵循如Qwen3-xB-AyB-Instruct(Qwen3-xB用于密集模型)的命名模式,例如Qwen3-235B-A22B-Instruct。对于Coder、VL和Omni模型,我们只需在“Qwen3”后插入类型,如Qwen3-Coder-480B-A35B-Instruct。

我们频繁更新。如果更新不大,我们会在名称后追加年月后缀(例如2507),结果类似于Qwen3-235B-A22B-Instruct-2507。

Qwen3-Next对我们来说也有点意外。经过一年多对新模型架构(特别是线性注意力和选择性稀疏注意力)的研究,我们最近开发了一个原型,最初认为它是“Qwen3.5”。我们迅速训练并发布它,以帮助社区适应LLM生态中即将到来的变化。但随后就遇到了命名困境。称其为“Qwen3.5-Preview”感觉别扭(并引发了诸如“+0.5然后-0.4?”的笑话)。最终,我们决定使用Qwen3-Next——不完美,但更清晰、更具前瞻性。

Qwen-Image略有不同。它不严格属于Qwen3系列,所以我们选择不赋予它像“Qwen2.5-Image”这样的版本号,即使它利用了Qwen2.5-VL的组件。扩散模型生态仍与LLM有明显差异,使得版本对齐复杂。目前,我们对架构和尺寸选择有信心,因此只发布一个主要模型:Qwen-Image,以及其编辑版本Qwen-Image-Edit。这可能显得大胆,但如果我们后来引入更小或更大的变体,我们愿意调整命名。

在API方面,事情更简单。我们最关注LLM,分为三个层级:Max、Plus和Flash(原“Turbo”)。因此你会看到如Qwen3-Max的名称。我们即将很快发布Qwen3-Plus和Qwen3-Flash!

不过,API命名并非没有波折。两年前,当我们首次推出VL模型时,我们非常兴奋地将最大模型命名为VL-Max——但按今天的标准,它显然不再是“Max”。为解决这个问题,我们现在发布了Qwen3-VL-Plus,Qwen3-VL-Flash也将很快发布。至于Qwen3-VL-Max?我们拭目以待……

在此过程中,我们还开发了专用音频模型:Qwen3-ASR和Qwen3-TTS。我们相信它们能提供顶级性能——与GPT-4o-transcribe、GPT-4o-mini-TTS或Gemini-2.5-Pro等模型相当——并且我们认为这类专用模型对实际应用至关重要。我们已经推出了API模型Qwen3-ASR-Flash,并计划在更好地准备后开源其中一些。

我们努力不通过命名混淆用户,但由于开发中的模型众多,一些复杂性不可避免。我们正走向融合,但目前这种分化实际上有助于开发者和用户更有效地实验和构建。最终,我们的目标很简单:提供高质量的模型,支持你的研究并提升你的生产力。
动态Junyang Lin2025-10-03原文

相关内容