微软rStar2-Agent以少量RL步骤提升14B模型至SOTA,超越DeepSeek-R1。
微软推出 rStar2-Agent
代理推理技术报告
rStar2-Agent 仅用一周时间、510 步 RL 训练,将预训练的 14B 模型提升至最先进水平,在 AIME24 上平均 pass@1 得分 80.6%,在 AIME25 上 69.8%,以显著更短的回复超越 DeepSeek-R1(671B)。
代理推理技术报告
rStar2-Agent 仅用一周时间、510 步 RL 训练,将预训练的 14B 模型提升至最先进水平,在 AIME24 上平均 pass@1 得分 80.6%,在 AIME25 上 69.8%,以显著更短的回复超越 DeepSeek-R1(671B)。