GPT-6 Astra在网络安全基准测试中击败所有模型,找回29/32个CVE,但成本高昂
转发 @pilvar222: 天哪: @AikidoSecurity 提前拿到 GPT-6 Astra 在我们的网络安全基准测试上运行,它碾压了所有其他模型!
- 在 pass@3 下,它重新发现了 29/32 个 CVE,这是我们记录过最高的召回率,比 GPT-5.6-Sol 还多 4 个
- 即使在 pass@1 下,它的召回率也有 75%。该模型非常稳定
- 然而性能代价高昂(字面意义上)。三次运行花费了我们近 4000 美元
Astra 现在是我和 @iminurputer 构建的基准测试中的第一模型,而且遥遥领先
1/3 🧵
- 在 pass@3 下,它重新发现了 29/32 个 CVE,这是我们记录过最高的召回率,比 GPT-5.6-Sol 还多 4 个
- 即使在 pass@1 下,它的召回率也有 75%。该模型非常稳定
- 然而性能代价高昂(字面意义上)。三次运行花费了我们近 4000 美元
Astra 现在是我和 @iminurputer 构建的基准测试中的第一模型,而且遥遥领先
1/3 🧵