Kimi K3在网络安全任务中性价比高
RT @cramforce: 我们在私有网络安全基准上测试了Kimi K3。
总结:Kimi K3在网络安全任务中性价比出色,兼具高召回率/精度/价格。GPT 5.6在召回率/精度上最佳,但每次运行成本高出7倍。
背景:https://t.co/UMvysvNW5w 是一个开源网络安全工具,用于发现大型代码库中的漏洞。
该评估在大量安全问题修复前的git提交点上,对未公开的开源核心应用运行deepsec。这是一个秘密评估,无法直接基准测试。
S级:GPT 5.6 Sol:分析最彻底,但价格是第二名的7倍以上。
最佳性价比:Kimi K3。召回率次优,价格合理。
良好召回率下最佳价格:GLM 5.2(比Kimi K3便宜40%)。
GPT 5.5:仅推荐订阅或高折扣API价格。召回率与Kimi相似但标价高得多。
Opus 4.8:仅推荐订阅或高折扣API价格。召回率与GLM 5.2相似但标价高得多。
Fable 5:拒绝率100%,无法用于安全分析。
Sol在大型代码库上的花费很快达到六位数。相对于未修复安全漏洞或支付漏洞赏金的风险,这仍然可负担。
我建议一次性使用Sol进行基准分析,然后使用Kimi K3进行持续分析。
使用开放权重模型时,请确保使用支持零数据保留的推理供应商。
总结:Kimi K3在网络安全任务中性价比出色,兼具高召回率/精度/价格。GPT 5.6在召回率/精度上最佳,但每次运行成本高出7倍。
背景:https://t.co/UMvysvNW5w 是一个开源网络安全工具,用于发现大型代码库中的漏洞。
该评估在大量安全问题修复前的git提交点上,对未公开的开源核心应用运行deepsec。这是一个秘密评估,无法直接基准测试。
S级:GPT 5.6 Sol:分析最彻底,但价格是第二名的7倍以上。
最佳性价比:Kimi K3。召回率次优,价格合理。
良好召回率下最佳价格:GLM 5.2(比Kimi K3便宜40%)。
GPT 5.5:仅推荐订阅或高折扣API价格。召回率与Kimi相似但标价高得多。
Opus 4.8:仅推荐订阅或高折扣API价格。召回率与GLM 5.2相似但标价高得多。
Fable 5:拒绝率100%,无法用于安全分析。
Sol在大型代码库上的花费很快达到六位数。相对于未修复安全漏洞或支付漏洞赏金的风险,这仍然可负担。
我建议一次性使用Sol进行基准分析,然后使用Kimi K3进行持续分析。
使用开放权重模型时,请确保使用支持零数据保留的推理供应商。