动态

微软rStar2-Agent以少量RL步骤提升14B模型至SOTA,超越DeepSeek-R1。

微软rStar2-Agent以少量RL步骤提升14B模型至SOTA,超越DeepSeek-R1。
AK
微软推出 rStar2-Agent

代理推理技术报告

rStar2-Agent 仅用一周时间、510 步 RL 训练,将预训练的 14B 模型提升至最先进水平,在 AIME24 上平均 pass@1 得分 80.6%,在 AIME25 上 69.8%,以显著更短的回复超越 DeepSeek-R1(671B)。
动态AK2025-08-29原文

相关内容