AI21 Labs通过先扩展后丰富策略在SWE-rebench上实现最先进性能
AI21 Labs在SWE-rebench上取得第一,关键在于先扩大模型再精细训练的顺序策略。
AI21 Labs分享在SWE-rebench(软件工程任务基准)上取得最佳成绩的方法:先通过扩大模型参数规模提升基础能力,再通过精细的数据调整优化性能。这种“先规模后精细化”的执行策略表明,扩展与数据质量同等重要。
正文摘录
简介 我们在 SWE-rebench 基准测试上发布了一项新的最先进成果:在 12 月至 3 月期间的 123 个 issue 上实现了 60.9% 的解决率,超越了该切片上先前的最佳已发布结果。 这一成就源于对 agent 上下文提取阶段的重构——一个我们追求并精炼的反直觉设计选择。我们没有采用“先丰富再解决”的方法(即先提取上下文,再生成解决方案),而是颠倒了顺序:先生成大规模解决方案,然后利用生成的候选方案来更好地提取上下文。达到最先进水平不仅仅是颠倒顺序本身——还需要仔细优化提取器如何利用这些候选方案来找出最相关的代码。 我们的发现表明,简单的初始并行 N 次解决任务尝试可以显著帮助代码库探索,生成一个高度针对性的上下文地图,该地图可在 agent 的最终评估步骤中用于生成更准确的输出。这种执行策略在不增加成本的情况下显著提高了 agent 的准确性,并超越了传统顺序下生成步骤的朴素缩放。 这项工作加入了 AI21 更广泛的 agent 优化研究线,与早期的案例研究 ([SWE-bench Verified](https://www.ai21.com/blog/test-time-compute-swe-bench/), [BrowseComp-Plus, Deep Research Bench](https://www.ai21.com/blog/maestro-deep-research-agents/)) 并列,每个都受益于 AI21 Maestro 优化方法的不同策略。我们希望我们在编码 agent 流水线顺序方面的贡献能够成为构建越来越准确且成本高效的 AI 软件工程师的蓝图。 在这篇文章中,我们将逐步从基线 ReAct 循环讲到这个结果——并展示我们如何在保持总成本低于领先编码 agent 的情况下将准确性推得更高。