推荐Kimi K2评测,强调Agent能力是模型未来趋势
推荐阅读:《Kimi K2:超越聊天框的深度评测》
以后模型的评测,不能局限于各种编程题、聊天跑分,还是要多看它 Agent 的能力:
1. 自主决策与反馈循环
2. 调用工具与环境交互
这是未来模型发展的趋势
以后模型的评测,不能局限于各种编程题、聊天跑分,还是要多看它 Agent 的能力:
1. 自主决策与反馈循环
2. 调用工具与环境交互
这是未来模型发展的趋势
完全赞同,模块级别的 Coding 能力已经不足以检测顶级模型的真实能力,还是要看模型 Agent 方面的能力——根据用户输入和代码库调用工具补足上下文完成任务
从 Coding 能力来讲 Gemini 2.5 Pro、o3、Claude 4 差距不明显,但是 Coding Agent 能力明显 Claude 是最强的,Gemini 2.5 最弱