动态

Kimi K3在网络安全任务中性价比高

Andrew Curran
RT @cramforce: 我们在私有网络安全基准上测试了Kimi K3。

总结:Kimi K3在网络安全任务中性价比出色,兼具高召回率/精度/价格。GPT 5.6在召回率/精度上最佳,但每次运行成本高出7倍。

背景:https://t.co/UMvysvNW5w 是一个开源网络安全工具,用于发现大型代码库中的漏洞。

该评估在大量安全问题修复前的git提交点上,对未公开的开源核心应用运行deepsec。这是一个秘密评估,无法直接基准测试。

S级:GPT 5.6 Sol:分析最彻底,但价格是第二名的7倍以上。

最佳性价比:Kimi K3。召回率次优,价格合理。

良好召回率下最佳价格:GLM 5.2(比Kimi K3便宜40%)。

GPT 5.5:仅推荐订阅或高折扣API价格。召回率与Kimi相似但标价高得多。

Opus 4.8:仅推荐订阅或高折扣API价格。召回率与GLM 5.2相似但标价高得多。

Fable 5:拒绝率100%,无法用于安全分析。

Sol在大型代码库上的花费很快达到六位数。相对于未修复安全漏洞或支付漏洞赏金的风险,这仍然可负担。

我建议一次性使用Sol进行基准分析,然后使用Kimi K3进行持续分析。

使用开放权重模型时,请确保使用支持零数据保留的推理供应商。
动态Andrew Curran2026-07-19原文

相关内容