动态

Kimi K3跃居Agent Arena第四,性能大幅提升

Kimi K3跃居Agent Arena第四,性能大幅提升
Kimi.ai
RT @arena: 激动人心的更新:Kimi K3 已在 Agent Arena 排行榜上位列第4,与 Claude Opus 4.8 和 GPT-5.6 Sol 持平。如果Kimi K3的权重按计划于7月27日发布,它将成为排名第一的开放权重模型。此次发布标志着Kimi K3在智能体性能上比Kimi K2.7 Code(从第23位跃升至第4位)实现了重大飞跃。基于8000多次实时智能体会话,Kimi K3在确认任务成功率上领先(第1位),在赞 vs 投诉上也取得+20.6%的强劲成绩(第3位)。目前它在可操控性(第14位)和Bash恢复(第17位)上落后于其他模型。Agent Arena在数百万个真实世界的长周期智能体任务上评估模型,模型获得网络搜索、文件系统和终端工具来完成复杂工作流:编写代码、创建幻灯片、研究网络、构建应用和分析文档。我们采用因果追踪方法衡量模型的净改进,表明相对于平均模型它改善了多少结果。以下是5个信号的说明:用户满意度代理:确认成功(用户明确反馈“有效”),赞 vs 投诉(用户反应中的隐含情感),可操控性(模型能否根据用户反馈调整)。工具使用代理:Bash恢复(从CLI错误中恢复的能力,工具使用的主要信号),工具幻觉(是否调用不存在的工具)。以下我们分解Kimi K3在这5个信号上的得分,这些得分来自全球用户社区提交的任务。祝贺 @Kimi_Moonshot 取得又一个重要里程碑!
动态Kimi.ai2026-07-20原文

相关内容