动态

过滤无效轮次提升多轮RL模型性能

过滤无效轮次提升多轮RL模型性能
Qian Liu
感谢AK分享我们的工作!🔥

回想一月份我们刚启动这个项目的时候……我们简直生活在噩梦中😩

几个月来看着我们的多轮RL模型崩溃。每一次都崩溃💥

我们以为自己做错了什么……直到我们发现其他研究团队似乎也撞上了同一堵无形的墙(Devin, verl和其他报告的问题)🧱
多轮工具推理就是……失效了💔

这不像R1-Zero方法的优雅简洁。这纯粹是混乱。

然后SimpleTIR的“啊哈!”时刻来了💡✨

秘密就在眼前:“无效轮次”——那些模型生成文本但毫无意义的步骤🕳️

一个简单的过滤器改变了一切✨

我们的7B模型从22%(DAPO)跃升到50%(多轮工具使用)在AIME24上📈

没有复杂的算法,没有花哨的技术。只是去除了毒害训练数据的无效轮次示例🎯

有时,最大的收益来自于理解什么不该学💡

📄论文:https://t.co/D1s9ESb3QO
💻代码:https://t.co/MNhP732wE8
✍️博客:https://t.co/Wr2gomwKrE
AK
SimpleTIR:端到端强化学习用于多轮工具集成推理 https://t.co/MXkCsaPoqK
动态Qian Liu2025-09-03原文

相关内容