行业新闻

AI21 提出预算感知执行策略,动态降低 SWE 智能体成本

AI21 提出预算感知执行策略,动态降低 SWE 智能体成本

AI21 用预算感知的早停策略动态调整计算开销,在 SWE 修复任务中节省成本或延迟,避免对简单任务过度投入。

AI21 团队发现,SWE 任务难度呈重尾分布:约50%的任务一次生成就能解决,但此前对所有任务分配固定预算。他们提出级联(先低成本模型,低置信度时升级)和并行(同时运行,找到一个合格候选后早停)两种执行策略,分别优化成本和延迟,在保持质量的同时避免浪费。

正文摘录

改善 Best-of-N:面向 SWE Agent 的预算感知执行 简要 作为我们更广泛的 Agent 优化工作的一部分,我们发布了一项研究,[展示了 SWE Agent 在横向和纵向扩展策略上的有效性](https://www.ai21.com/blog/maestro-deep-research-agents/)。然而,在我们的实验中,我们传统上对所有问题都采用统一的计算预算,仿佛每个 任务 的 难度都是一样的。 但在受控实验室环境之外,这个假设并不成立。 实际上,我们知道 任务难度遵循重尾分布(heavy-tailed distribution):相当比例的任务可以用很低的成本解决,而另一些任务则需要大量预算。例如,[在之前一篇详细介绍我们如何在 SWE-rebench 上达到 SOTA 的帖子中](https://www.ai21.com/blog/first-scale-then-enrich-how-the-right-execution-strategy-helped-us-reach-state-of-the-art-on-swe-rebench/),我们发现大约 50% 的任务通过单次 GPT-5.2 rollout 就能解决,然而我们最初的策略却对每个任务都花费 5 次 rollout。这造成了无谓浪费。 在这个众多公司都在审视 Token 消耗、寻找削减成本方法的时刻,我们展示了最新的研究:可根据任务难度进行调整的预算感知执行策略(budget-aware execution strategies),这样你只在必要时才花费更多。

阅读原文(ai21.com)→

行业新闻2026-07-08原文

相关内容