开源编码模型在SWE-bench上快速追赶闭源模型
开源编码模型正在快速追赶。
SWE-bench验证结果:
- GLM-4.7: 73.8%
- Kimi K2 Thinking: 73.4%
- DeepSeek-V3.2: 73.1%
作为参考,Claude Sonnet 4.5(闭源):77.2%
GLM-4.7的优势:数学推理(AIME 95.7%)和工具使用(τ²-Bench 87.4%)。
现已集成到Cline。
SWE-bench验证结果:
- GLM-4.7: 73.8%
- Kimi K2 Thinking: 73.4%
- DeepSeek-V3.2: 73.1%
作为参考,Claude Sonnet 4.5(闭源):77.2%
GLM-4.7的优势:数学推理(AIME 95.7%)和工具使用(τ²-Bench 87.4%)。
现已集成到Cline。
GLM-4.7来了!
GLM-4.7在编码、复杂推理和工具使用方面显著超越GLM-4.6,树立了新的开源SOTA标准。它在聊天、创意写作和角色扮演场景中也有性能提升。
编码计划默认模型:https://t.co/3vDzwof7A8