热门产品

Cognition's SWE-2

Cognition's SWE-2

Cognition 推出的编程大模型,为 Devin 等 AI 编程工具提供代码生成与多步工程能力,成本比同级竞品低约六成,适合开发团队降本提效。

热门评论

PH 用户
SWE-2 是 Cognition 的新编程模型,目标是接近前沿水平,但不用前沿定价。

问题是:编程智能体越聪明就越贵,还经常狂烧 token。他们自己的 SWE-1.7 就有这个问题,用户说它在简单任务上过度探索。

他们的做法:用 RL 对 Kimi K3 做后训练,把一次运行的实际美元成本放进训练奖励里,并且一次性训练 medium、high、max 三档 effort,而不是把不同模型拼起来。所以整条性价比曲线都往上移,不只是最顶端。

数据:在 FrontierCode 1.1 Main 上 50.0%,跟 Fable 5.1 只差一个点,成本却低 64%;价格只有 GPT-6 Astra 的四分之一,分数只差几个点;在 Terminal-Bench 2.1 上 92.8%,排在他们对比表第一。对比 SWE-1.7:轮次少 58%,便宜 81%,分数还更高。第一次代码编辑在第 18 步完成,而不是 48 步。还有一点值得注意:端到端测试写得更好,而且你反驳它时,它会重新推导结论,而不是一味顺着你。

如果你在大规模跑编程智能体,而且单任务成本是实打实的一项支出,那会很合适。现在已在 Devin Desktop 和 CLI 提供,正在逐步上线 Web 和 Fusion。

试试看:SWE-2 详细介绍

P.S. 我专门挖掘科技、SaaS 和 AI 领域最新最棒的发布,关注我获取通知 → @rohanrecommends
PH 用户
“轮次少 58%”这个数字,是我最想在 benchmark 套件之外看到压力测试的——在精心挑选的 eval 上,更快到达第一次能用的编辑当然很好,但真实 repo 的上下文更乱(遗留代码、文档不全的内部 API),一个每步推理更少的模型也可能更早卡住,需要人来解围。有没有消息说它在更乱、更不像 benchmark 的代码库上表现如何?
热门产品Rohan Chaubey2026-09-13原文

相关内容