行业新闻

LoopCoder v2:仅循环一次使 7B 模型在代码修复基准上提升 21 个百分点

LoopCoder v2 研究发现,代码修复任务中仅循环一次(共两次计算)即可达到最优,多循环反而有害。

当主流推理模型靠“想得更久”来提升性能时,LoopCoder v2 反其道而行:一个 7B 小模型,只需在正常计算后多循环一次(共 2 次),就在真实代码修复基准 SWE-bench Verified 上从 43.0 分跃至 64.4 分;而继续增加循环次数,性能反而下降。所谓“循环”是指用同一套参数在推理时反复打磨内部表征,属于测试时计算的一种方式。研究团队来自北航、IQuest Research、澜舟科技和人大。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/9ba76252-4ba9-4aaf-a8cb-93fd660fd12c/08(2).jpg) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 当所有人都在比谁「想得更久、算得更多」——推理模型动辄输出成千上万个思考 token,循环式架构恨不得在内部反复迭代十遍八遍——一项新研究反手泼了盆冷水: 一个 7B 的小模型,只需要在正常计算之外「多循环这一次」(总共 2 次),就能在号称最难的真实代码修复基准 SWE-bench Verified 上从 43.0 分飙到 64.4 分;而继续往上加循环,不仅不涨,反而一路跳水。 论文标题起得很干脆——《Only Loop Once》,只循环一次。背后是来自 北京航空航天大学、IQuest Research、澜舟科技和中国人民大学 的联合团队。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-01原文

相关内容