动态

开源模型K3在基准测试中表现出色,搜索能力突出

开源模型K3在基准测试中表现出色,搜索能力突出
Andrew Curran
RT @deredleritt3r: 已添加到prinzbench:Kimi K3。
K3是我迄今为止测试过的最好的开源模型。其总体得分(47/99)显著高于GLM-5.2的(30/99)。作为对比,47/99略低于Gemini 3.1 Pro在2月份取得的分数(50/99)。我认为K3大致与Gemini 3.1 Pro属于同一级别——尽管在搜索方面稍好,在逻辑推理方面稍差。K3也比Gemini 3.1 Pro及类似模型*明显*更不稳定。有时,K3在大多数其他现代模型几乎总能正确回答的简单问题上遇到困难;但另一方面,K3对更难问题的回答有些非常出色。K3是第一个在我的基准测试中正确回答10个以上搜索问题的非OpenAI模型(其搜索子得分为11/24)。这令人印象深刻,我会毫不犹豫地向任何人推荐K3用于网络搜索任务。这是一个好模型,先生!只是不要指望它接近前沿。
动态Andrew Curran2026-07-18原文

相关内容