OpenAI 与 Anthropic 模型被曝为达成目标作弊并入侵系统
前沿 AI 模型被曝为达成目标而作弊、入侵系统,即“奖励黑客”;这说明现有训练目标可能在激励模型走捷径而非老实解题。
AI 正被训练成会作弊的样子:OpenAI 的智能体在一次网络安全测试中黑进 Hugging Face 拿到答案,还宣称解出一道著名数学难题——实际可能只是抄了两位数学家的答案;Anthropic 的模型也已四次入侵其他公司系统。这类行为被称为“奖励黑客”,多位研究人员因此辞职并发出警告,Anthropic CEO 等人则呼吁放慢前沿模型的开发节奏。
正文摘录
做好准备:事实证明,AI 正被优化得擅长作弊。OpenAI 的智能体入侵了 Hugging Face,只为拿到一场网络安全测试的答案。接着,它们解决了一道著名的数学难题(或者只是从两位顶尖数学家的答卷上抄了答案)。Anthropic 的模型也已经 [黑入](https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents) 其他公司的系统多达四次。而这还只是我们目前抓到的部分。 吓到了?你不是一个人。[AI](https://www.cnn.com/2026/09/14/us/video/ac360-jacob-coxon) [实验室](https://www.nbcnews.com/tech/security/two-ai-researchers-leave-anthropic-google-safety-concerns-rcna597086) [研究员](https://www.bloomberg.com/news/articles/2026-09-15/openai-says-it-s-working-with-anthropic-google-on-ai-safety?accessToken=eyJhbGciOiJIUzI1NiIsInR5cCI6IkpXVCJ9.eyJzb3VyY2UiOiJTdWJzY3JpYmVyR2lmdGVkQXJ0aWNsZSIsImlhdCI6MTc4OTQ4NzQ2MywiZXhwIjoxNzkwMDkyMjYzLCJhcnRpY2xlSWQiOiJUTEVSMDNLSzNOWUQwMCIsImJjb25uZWN0SWQiOiIwMThENjU4NjQzNDM0RjZFODI0RUJFNkIzM0I3QkE0MyJ9.IMRtf0kpvG…