LoopCoder v2:仅循环一次使 7B 模型在代码修复基准上提升 21 个百分点
LoopCoder v2 研究发现,代码修复任务中仅循环一次(共两次计算)即可达到最优,多循环反而有害。
当主流推理模型靠“想得更久”来提升性能时,LoopCoder v2 反其道而行:一个 7B 小模型,只需在正常计算后多循环一次(共 2 次),就在真实代码修复基准 SWE-bench Verified 上从 43.0 分跃至 64.4 分;而继续增加循环次数,性能反而下降。所谓“循环”是指用同一套参数在推理时反复打磨内部表征,属于测试时计算的一种方式。研究团队来自北航、IQuest Research、澜舟科技和人大。
正文摘录
.jpg)  当所有人都在比谁「想得更久、算得更多」——推理模型动辄输出成千上万个思考 token,循环式架构恨不得在内部反复迭代十遍八遍——一项新研究反手泼了盆冷水: 一个 7B 的小模型,只需要在正常计算之外「多循环这一次」(总共 2 次),就能在号称最难的真实代码修复基准 SWE-bench Verified 上从 43.0 分飙到 64.4 分;而继续往上加循环,不仅不涨,反而一路跳水。 论文标题起得很干脆——《Only Loop Once》,只循环一次。背后是来自 北京航空航天大学、IQuest Research、澜舟科技和中国人民大学 的联合团队。