Anthropic 与 NNSA 合作开发核领域 AI 滥用分类器,初测准确率 96%
Anthropic 与 NNSA 联合训练核相关对话分类器并已上线 Claude,首个可复制的公私合作防核扩散样本,私企独自难以评估这类风险。
核技术天然具有军民两用属性——驱动反应堆的物理原理同样可用于武器研发。AI 模型能力越强,越需要盯住它是否会把这类危险技术知识交给用户。单靠一家私企难以评估这种风险,Anthropic 因此与美国能源部下属的 NNSA 合作,共同开发出一个能自动区分「值得警惕」与「正常」核相关对话的分类器,初测准确率 96%,目前已部署在 Claude 流量上,用于识别模型滥用。
正文摘录
公告 Frontier Red Team 通过公私合作,为 AI 开发核安全保障措施 2025 年 8 月 21 日 [在 red.anthropic.com 阅读完整文章](https://red.anthropic.com/2025/nuclear-safeguards/)  核技术天然具有双重用途:驱动核反应堆的同一套物理原理,也可能被滥用于武器研发。随着 AI 模型能力不断增强,我们需要密切关注它们是否会以威胁国家安全的方式,向用户提供危险的技术知识。 与核武器相关的信息尤为敏感,这让一家私营公司单打独斗去评估这些风险变得非常困难。因此,去年 4 月我们与美国能源部(DOE)下属的国家核安全管理局(NNSA)[展开合作](https://www.axios.com/2024/11/14/anthropic-claude-nuclear-information-safety),评估我们的模型在核扩散方面的风险,并持续与他们在这些评估上合作。 如今,我们不止于评估风险,还要构建监测风险所需的工具。我们与 NNSA 及 DOE 下属国家实验室共同开发了一个分类器(classifier)——一种能自动对内容进行归类的 AI 系统——在初步测试中,它能以 96% 的准确率区分值得关注的核相关对话与无害的核相关对话。