动态

模型Coding能力不足反映实力,Agent能力是关键,Claude最强

宝玉
完全赞同,模块级别的 Coding 能力已经不足以检测顶级模型的真实能力,还是要看模型 Agent 方面的能力——根据用户输入和代码库调用工具补足上下文完成任务

从 Coding 能力来讲 Gemini 2.5 Pro、o3、Claude 4 差距不明显,但是 Coding Agent 能力明显 Claude 是最强的,Gemini 2.5 最弱
S Li
coding已经不是检验当前模型能力的好参照,在这方面,前沿几家各有所长,仅靠单模型的聊天对话,能写的代码终究只是个摆设。软件工程?那就还是一个比较长远的话题。

Agent模式下,模型的稳定性和一致性是其能力的关键考量之一,毕竟这决定了它们是否可以真的被广泛应用于各种行业的生产环境。
动态宝玉2025-07-10原文

相关内容