动态

DeepSeek R1 更新后位列世界第二,开源权重领先

DeepSeek R1 更新后位列世界第二,开源权重领先
Artificial Analysis
DeepSeek的R1跃居xAI、Meta和Anthropic之上,并列世界第二大AI实验室,并成为无可争议的开源权重领导者。

DeepSeek R1 0528 在我们独立运行的7项领先评估的Artificial Analysis Intelligence Index中,从60分跃升至68分。这一增幅与OpenAI的o1到o3(62到70)之间的差距相同。

这使得DeepSeek R1的智能水平高于xAI的Grok 3 mini(高)、NVIDIA的Llama Nemotron Ultra、Meta的Llama 4 Maverick、阿里巴巴的Qwen 3 253,并与Google的Gemini 2.5 Pro持平。

模型改进详情:
- 全面智能提升:最大提升出现在AIME 2024(竞赛数学,+21分)、LiveCodeBench(代码生成,+15分)、GPQA Diamond(科学推理,+10分)和Humanity's Last Exam(推理与知识,+6分)。
- 架构不变:R1-0528是后训练更新,V3/R1架构未变——仍然是一个671B大模型,37B活跃参数。
- 编程能力显著提升:R1现在在Artificial Analysis Coding Index中与Gemini 2.5 Pro持平,仅次于o4-mini(高)和o3。
- Token使用增加:R1-0528在Artificial Analysis Intelligence Index中完成评估使用了9900万token,比原版R1的7100万token多40%——即新版R1思考时间更长。但这仍不是我们见过的最高token使用量:Gemini 2.5 Pro比R1-0528多使用30%的token。

对AI的启示:
- 开源与闭源模型之间的差距比以往更小:开源权重模型持续保持与专有模型同步的智能提升。DeepSeek的R1在1月发布时首次让开源权重模型达到第二名,今天的更新使其重回这一位置。
- 中国与美国并驾齐驱:来自中国AI实验室的模型几乎完全赶上了美国同行,此次发布延续了这一新兴趋势。截至今天,DeepSeek在Artificial Analysis Intelligence Index中领先包括Anthropic和Meta在内的美国AI实验室。
- 强化学习推动改进:DeepSeek在保持与原始DeepSeek R1相同架构和预训练的情况下,实现了显著的智能提升。这凸显了后训练日益增长的重要性,尤其是使用强化学习(RL)技术训练的推理模型。OpenAI披露了从o1到o3将RL计算量扩展了10倍——DeepSeek刚刚证明,到目前为止他们可以跟上OpenAI的RL计算扩展。扩展RL比扩展预训练需要更少的计算资源,并提供了一种实现智能提升的高效方式,支持GPU较少的AI实验室。

详见下方分析
动态Artificial Analysis2025-05-29原文

相关内容