动态

Qwen3系列模型发布,含MoE与密集模型,性能与竞品相当

Qwen3系列模型发布,含MoE与密集模型,性能与竞品相当
Qwen
介绍 Qwen3!我们发布并开源了 Qwen3,这是我们最新的大型语言模型系列,包括 2 个 MoE 模型和 6 个密集模型,参数规模从 0.6B 到 235B。我们的旗舰模型 Qwen3-235B-A22B 在编码、数学、通用能力等基准评测中,与 DeepSeek-R1、o1、o3-mini、Grok-3 和 Gemini-2.5-Pro 等顶级模型相比,取得了有竞争力的结果。此外,小型 MoE 模型 Qwen3-30B-A3B 以 10 倍的激活参数量超越了 QwQ-32B,甚至像 Qwen3-4B 这样的小模型也能与 Qwen2.5-72B-Instruct 的性能相媲美。更多信息请访问 Qwen Chat Web(https://chat.qwen.ai)和 APP 体验,并查看我们的 GitHub、HF、ModelScope 等。博客:https://qwenlm.github.io/blog/qwen3/;GitHub:https://github.com/QwenLM/Qwen3;Hugging Face:https://huggingface.co/collections/Qwen/qwen3-67dd247413f0e2e4f653967f…;ModelScope:https://modelscope.cn/collections/Qwen3-9743180bdc6b48…。后训练模型(如 Qwen3-30B-A3B)及其预训练版本(如 Qwen3-30B-A3B-Base)现已可在 Hugging Face、ModelScope 和 Kaggle 等平台获取。部署方面,推荐使用 SGLang 和 vLLM 等框架;本地使用则强烈推荐 Ollama、LMStudio、MLX、llama.cpp 和 KTransformers 等工具。这些选项确保用户可以轻松将 Qwen3 集成到研究、开发或生产工作流中。希望你喜欢我们的新模型!
动态Qwen2025-04-28原文

相关内容