Anthropic 与美英 AI 安全机构合作,公开红队测试发现的越狱漏洞
Anthropic 把模型交给美英政府安全机构红队测试,结果暴露出提示注入、密文伪装等真实越狱手法,也说明前沿模型的防护需要外部专家参与验证。
Anthropic 与美国 CAISI、英国 AISI(两国政府设立的 AI 安全测评机构)开展了为期一年的自愿合作:对方可在模型开发的多个阶段访问其系统并进行持续测试。政府团队用红队方式攻击其 Constitutional Classifiers(用于拦截越狱的防御系统),发现提示注入、密文编码等漏洞,Anthropic 据此修补并重构了防护架构。
正文摘录
公告 与美国 CAISI 和英国 AISI 合作,强化我们的安全防护 2025 年 9 月 12 日  过去一年里,我们一直与美国人工智能标准与创新中心(Center for AI Standards and Innovation,CAISI)以及英国人工智能安全研究所(AI Security Institute,AISI)合作。这两家政府机构的设立目的,是衡量并提升 AI 系统的安全性。我们的合作最初只是自愿性的初步咨询,但随着时间推移,逐渐演变为一种持续性的伙伴关系:CAISI 和 AISI 的团队可以在模型开发的各个阶段访问我们的系统,从而对我们的系统进行持续测试。 政府为这项工作带来了独特的能力,尤其是在网络安全、情报分析、威胁建模等国家安全领域拥有深厚专长;当这些专长与其机器学习专业能力相结合时,他们便能评估特定的攻击向量(attack vector,即攻击者可能利用的入侵路径)与防御机制。他们的反馈帮助我们改进安全措施,让我们的系统能够抵御某些最复杂的滥用尝试。 与独立的外部专家合作、识别 AI 系统中的漏洞,是 Anthropic [Safeguards](https://www.anthropic.com/news/building-safeguards-for-claude) 方法的核心组成部分,对于防止我们的模型被滥用、进而造成现实世界伤害至关重要。 发现并修复漏洞 这一合作已经带来了关键发现,帮助我们强化了用于防止模型被恶意使用的工具。