Anthropic 启动前沿威胁红队测试,评估 AI 生物安全风险
Anthropic 用红队测试评估 AI 生物滥用风险,发现模型能力增长可能带来近期国家安全威胁,但已有缓解手段,需业界和政府协作扩大测试。
Anthropic 与生物安全专家合作,对前沿模型进行红队测试(对抗性测试,通过模拟攻击找出漏洞),发现模型若不加以缓解,可能在两三年内对国家安全构成风险。同时,训练调整与分类器过滤等缓解措施已部署,可显著降低风险。
正文摘录
Announcements 前沿威胁红队测试:面向 AI 安全 2023 年 7 月 26 日  “红队测试”(red teaming),即对抗性测试,是一种公认的用于衡量和提升系统安全性与保障性的技术。虽然 [Anthropic 之前的研究](https://www.anthropic.com/research/red-teaming-language-models-to-reduce-harms-methods-scaling-behaviors-and-lessons-learned) 报告了使用众包人员进行红队测试的方法和结果,但一段时间以来,AI 研究者已经注意到,AI 模型最终可能在国家安全相关领域获得能力。