动态

批评AI模型漏洞检测测试不诚实,强调跨文件推理

批评AI模型漏洞检测测试不诚实,强调跨文件推理
Paul Calcraft
>8/8 的 [廉价开源] 模型检测到了 Mythos 旗舰 FreeBSD 漏洞

完全不诚实

他们只给了大约 20 行代码来阅读。他们在顶部注入了与漏洞相关的自定义上下文

跨文件的推理是发现此漏洞的关键
clem 🤗
但以下是我们在测试时发现的:我们选取了 Anthropic 在公告中展示的具体漏洞,隔离了相关代码,并通过小型、廉价、开放权重模型运行它们。这些模型恢复了许多相同的分析。八分之八
动态Paul Calcraft2026-04-09原文

相关内容