Polaris-4B超越R1,字节和DeepScaleR参与,小米或将加入
Polaris-4B的AIME分数超越老版R1。verl来自字节跳动Seed,DeepScaleR在DeepSeek基础上大幅改进,所有基础模型都是Qwen。你喜欢看到这种卓越的漩涡,自我强化,日益强大。我猜小米接下来会加入。
POLARIS:一种用于扩展高级推理模型强化学习的后训练方法。4B模型在AIME24上达到81.2%的Pass@1准确率,在AIME25上达到79.4%的Pass@1准确率,超越了像Claude-4-Opus、Grok-3-Beta等SOTA商业模型。详情:https://t.co/bar0wDFLg5