Anthropic未发布强大AI安全模型Mythos,因其可自主发现漏洞
Claude Mythos 可能是今年最重要的 AI 安全故事。
不是因为 Anthropic 发布了它。
而是因为他们没有。
据 Anthropic 称,Mythos 可以自主发现并利用主要操作系统和浏览器中的严重漏洞,几乎无需人类指导。
其中包括:
- 主要操作系统和浏览器中的零日漏洞
- 一个存在 27 年的 OpenBSD 漏洞
- 一个存在 16 年、被 500 万次模糊测试遗漏的 FFmpeg 漏洞
- 完整的利用链,包括浏览器沙箱逃逸
- 对 FreeBSD 的完整远程 root 利用
- 在进攻性网络基准测试中取得突破性进展
与 Claude Opus 4.6 相比,基准测试提升惊人:
- SWE-bench Verified: 93.9% vs 80.8%
- SWE-bench Pro: 77.8% vs 53.4%
- USAMO: 97.6% vs 42.3%
- Firefox 漏洞利用编写: 181 次成功 vs 2 次
- Cybench CTF: 100% 解决率
- CyberGym: 83.1% vs 66.6%
- Humanity’s Last Exam: 64.7% vs 53.1%
而 Anthropic 的结论并非“看看我们造出了什么”。
而是更接近于:
这个模型过于强大,无法广泛发布。
因此,他们没有公开推出,而是与 AWS、Apple、Google、Microsoft、NVIDIA 等公司启动了 Project Glasswing,并承诺投入 1 亿美元用于防御用途。
这应该能说明一切。
真正的问题不在于模型在网络安全方面变得更好。
而在于我们可能正在从“AI 可以辅助安全研究”跨越到“AI 可以实质性地改变攻防平衡”。
Anthropic 公开警告,网络安全的旧有平衡正在被打破。
而 Mythos,按照他们自己的说法,只是一个开始。
如果构建这个模型的公司都对这种趋势感到如此警惕,那么其他所有人都应该重视起来。
不是因为 Anthropic 发布了它。
而是因为他们没有。
据 Anthropic 称,Mythos 可以自主发现并利用主要操作系统和浏览器中的严重漏洞,几乎无需人类指导。
其中包括:
- 主要操作系统和浏览器中的零日漏洞
- 一个存在 27 年的 OpenBSD 漏洞
- 一个存在 16 年、被 500 万次模糊测试遗漏的 FFmpeg 漏洞
- 完整的利用链,包括浏览器沙箱逃逸
- 对 FreeBSD 的完整远程 root 利用
- 在进攻性网络基准测试中取得突破性进展
与 Claude Opus 4.6 相比,基准测试提升惊人:
- SWE-bench Verified: 93.9% vs 80.8%
- SWE-bench Pro: 77.8% vs 53.4%
- USAMO: 97.6% vs 42.3%
- Firefox 漏洞利用编写: 181 次成功 vs 2 次
- Cybench CTF: 100% 解决率
- CyberGym: 83.1% vs 66.6%
- Humanity’s Last Exam: 64.7% vs 53.1%
而 Anthropic 的结论并非“看看我们造出了什么”。
而是更接近于:
这个模型过于强大,无法广泛发布。
因此,他们没有公开推出,而是与 AWS、Apple、Google、Microsoft、NVIDIA 等公司启动了 Project Glasswing,并承诺投入 1 亿美元用于防御用途。
这应该能说明一切。
真正的问题不在于模型在网络安全方面变得更好。
而在于我们可能正在从“AI 可以辅助安全研究”跨越到“AI 可以实质性地改变攻防平衡”。
Anthropic 公开警告,网络安全的旧有平衡正在被打破。
而 Mythos,按照他们自己的说法,只是一个开始。
如果构建这个模型的公司都对这种趋势感到如此警惕,那么其他所有人都应该重视起来。