行业新闻

Anthropic 启动前沿威胁红队测试,评估 AI 生物安全风险

Anthropic 用红队测试评估 AI 生物滥用风险,发现模型能力增长可能带来近期国家安全威胁,但已有缓解手段,需业界和政府协作扩大测试。

Anthropic 与生物安全专家合作,对前沿模型进行红队测试(对抗性测试,通过模拟攻击找出漏洞),发现模型若不加以缓解,可能在两三年内对国家安全构成风险。同时,训练调整与分类器过滤等缓解措施已部署,可显著降低风险。

正文摘录

Announcements 前沿威胁红队测试:面向 AI 安全 2023 年 7 月 26 日 ![](https://www.anthropic.com/next/image?url=https%3A%2F%2Fwww-cdn.anthropic.com%2Fimages%2F4zrzovbb%2Fwebsite%2Fefd36fc64fd3b723e596406e5320161276017b57-2880x1620.png&w=3840&q=75) “红队测试”(red teaming),即对抗性测试,是一种公认的用于衡量和提升系统安全性与保障性的技术。虽然 [Anthropic 之前的研究](https://www.anthropic.com/research/red-teaming-language-models-to-reduce-harms-methods-scaling-behaviors-and-lessons-learned) 报告了使用众包人员进行红队测试的方法和结果,但一段时间以来,AI 研究者已经注意到,AI 模型最终可能在国家安全相关领域获得能力。

阅读原文(anthropic.com)→

行业新闻2026-09-09原文

相关内容