动态

SWE-Bench Pro更新榜单,Claude模型突破40%通过率

SWE-Bench Pro更新榜单,Claude模型突破40%通过率
Scale AI
我们上个月推出了SWE-Bench Pro,获得了不可思议的反馈,现在我们已经更新了排行榜,包含了最新模型且无成本上限。最先进的模型现在突破了40%的通过率。恭喜 @Anthropic 横扫榜首!🥇Claude 4.5 Sonnet 🥈Claude 4 Sonnet 🥉Claude 4.5 Haiku
Bing Liu
🚀 介绍SWE-Bench Pro——一个新的基准测试,用于评估LLM编码智能体在真实企业级软件工程任务上的表现。这是SWE-Bench的下一步:更难、抗污染、更接近真实仓库。
动态Scale AI2025-10-21原文

相关内容