AnthropicAI负责人分享漏洞修复与独立评估
很多人一直在问关于Mythos、Glasswing以及我们/合作伙伴正在修复的漏洞。今天,我很高兴我们能开始分享更多信息。(说明一下,我领导AnthropicAI的Glasswing项目。)
本周两项独立评估——来自XBOW和英国AISI——证实了我们内部看到的情况:Claude Mythos Preview在自主网络安全能力方面是一个阶跃变化。我们需要开始为具备这种能力水平的模型世界快速做好准备。
英国AI安全研究所测试了我们在Project Glasswing发布时推出的模型,发现Mythos Preview是第一个解决他们两种端到端网络靶场的模型,包括一个(Cooling Tower)此前没有任何模型能通过的靶场。但攻击者(和防御者)有复杂性和成本限制——Mythos也是唯一在故意设置的低250万token上限下,在预计超过8小时的任务中全部通过的模型。
XBOW在其进攻性安全基准测试中测试了它,发现“逐token,前所未有的精确度”。它是唯一成功完成细微V8沙箱工作的模型。
其他Glasswing合作伙伴也分享了类似情况。在几周的测试中,Mythos Preview帮助他们发现了成千上万个(估计的)高严重性和关键严重性漏洞,有时是他们在正常情况下一年内发现数量的两倍。
我分享这些不是为了吹捧Mythos。事实上,这与Mythos无关。而是为了为即将到来的世界做准备,在这个世界里,模型在双重用途能力上比一些最优秀的人类专家更好、更快、更便宜、更有创造力。显然,我们需要它们尽可能安全地支持防御者——尤其是资源最少的那些。
一年之内,Mythos可能看起来相当笨拙(相对于其他新模型)。而其他人可能会发布开放可用或无防护的Mythos级能力模型。
我们启动Project Glasswing是因为像Mythos Preview这样的能力不会一直稀有,也不会一直掌握在谨慎的人手中。我们在责任范围内尽可能快地将它带给防御者,同时努力弄清楚,例如,正确的防护措施以及补丁和披露流程。
另外,明确一点,计算能力从来不是我们推广的限制因素。
未来几天内,期待关于我们Glasswing工作的更全面更新。
XBOW报告:https://t.co/Mumtbf3kE3
英国AISI报告:https://t.co/vBgqz0AeKJ
本周两项独立评估——来自XBOW和英国AISI——证实了我们内部看到的情况:Claude Mythos Preview在自主网络安全能力方面是一个阶跃变化。我们需要开始为具备这种能力水平的模型世界快速做好准备。
英国AI安全研究所测试了我们在Project Glasswing发布时推出的模型,发现Mythos Preview是第一个解决他们两种端到端网络靶场的模型,包括一个(Cooling Tower)此前没有任何模型能通过的靶场。但攻击者(和防御者)有复杂性和成本限制——Mythos也是唯一在故意设置的低250万token上限下,在预计超过8小时的任务中全部通过的模型。
XBOW在其进攻性安全基准测试中测试了它,发现“逐token,前所未有的精确度”。它是唯一成功完成细微V8沙箱工作的模型。
其他Glasswing合作伙伴也分享了类似情况。在几周的测试中,Mythos Preview帮助他们发现了成千上万个(估计的)高严重性和关键严重性漏洞,有时是他们在正常情况下一年内发现数量的两倍。
我分享这些不是为了吹捧Mythos。事实上,这与Mythos无关。而是为了为即将到来的世界做准备,在这个世界里,模型在双重用途能力上比一些最优秀的人类专家更好、更快、更便宜、更有创造力。显然,我们需要它们尽可能安全地支持防御者——尤其是资源最少的那些。
一年之内,Mythos可能看起来相当笨拙(相对于其他新模型)。而其他人可能会发布开放可用或无防护的Mythos级能力模型。
我们启动Project Glasswing是因为像Mythos Preview这样的能力不会一直稀有,也不会一直掌握在谨慎的人手中。我们在责任范围内尽可能快地将它带给防御者,同时努力弄清楚,例如,正确的防护措施以及补丁和披露流程。
另外,明确一点,计算能力从来不是我们推广的限制因素。
未来几天内,期待关于我们Glasswing工作的更全面更新。
XBOW报告:https://t.co/Mumtbf3kE3
英国AISI报告:https://t.co/vBgqz0AeKJ