过滤无效轮次提升多轮RL模型性能
感谢AK分享我们的工作!🔥
回想一月份我们刚启动这个项目的时候……我们简直生活在噩梦中😩
几个月来看着我们的多轮RL模型崩溃。每一次都崩溃💥
我们以为自己做错了什么……直到我们发现其他研究团队似乎也撞上了同一堵无形的墙(Devin, verl和其他报告的问题)🧱
多轮工具推理就是……失效了💔
这不像R1-Zero方法的优雅简洁。这纯粹是混乱。
然后SimpleTIR的“啊哈!”时刻来了💡✨
秘密就在眼前:“无效轮次”——那些模型生成文本但毫无意义的步骤🕳️
一个简单的过滤器改变了一切✨
我们的7B模型从22%(DAPO)跃升到50%(多轮工具使用)在AIME24上📈
没有复杂的算法,没有花哨的技术。只是去除了毒害训练数据的无效轮次示例🎯
有时,最大的收益来自于理解什么不该学💡
📄论文:https://t.co/D1s9ESb3QO
💻代码:https://t.co/MNhP732wE8
✍️博客:https://t.co/Wr2gomwKrE
回想一月份我们刚启动这个项目的时候……我们简直生活在噩梦中😩
几个月来看着我们的多轮RL模型崩溃。每一次都崩溃💥
我们以为自己做错了什么……直到我们发现其他研究团队似乎也撞上了同一堵无形的墙(Devin, verl和其他报告的问题)🧱
多轮工具推理就是……失效了💔
这不像R1-Zero方法的优雅简洁。这纯粹是混乱。
然后SimpleTIR的“啊哈!”时刻来了💡✨
秘密就在眼前:“无效轮次”——那些模型生成文本但毫无意义的步骤🕳️
一个简单的过滤器改变了一切✨
我们的7B模型从22%(DAPO)跃升到50%(多轮工具使用)在AIME24上📈
没有复杂的算法,没有花哨的技术。只是去除了毒害训练数据的无效轮次示例🎯
有时,最大的收益来自于理解什么不该学💡
📄论文:https://t.co/D1s9ESb3QO
💻代码:https://t.co/MNhP732wE8
✍️博客:https://t.co/Wr2gomwKrE
SimpleTIR:端到端强化学习用于多轮工具集成推理 https://t.co/MXkCsaPoqK