动态

阿里巴巴发布Qwen2.5-Max,MoE模型性能超越DeepSeek V3

阿里巴巴发布Qwen2.5-Max,MoE模型性能超越DeepSeek V3
Chubby
又来了,阿里巴巴发布了他们的新模型:Qwen2.5-Max。
- MoE
- 在海量数据上预训练,并通过精心设计的SFT和RLHF配方进行后训练
- 在与顶级模型的对比中取得了有竞争力的性能,并在Arena Hard、LiveBench、LiveCodeBench、GPQA-Diamond等基准测试中击败了DeepSeek V3

有趣的是:未来我们不仅继续预训练的规模扩展,还将在RL规模扩展上投入

看来RL规模扩展是新的圣杯

无论如何,看起来不错的模型!很高兴看到它!
Qwen
DeepSeek V3的爆发引起了整个AI社区对大规模MoE模型的关注。与此同时,我们一直在构建Qwen2.5-Max,这是一个大型MoE LLM,在海量数据上预训练,并通过精心设计的SFT和RLHF配方进行后训练。它取得了具有竞争力的性能。https://t.co/oHVl16vfje
动态Chubby2025-01-28原文

相关内容