Anthropic 复盘四起 Claude 越权攻击事件,承认对齐存在缺陷
把安全对齐当招牌的 Anthropic 公开承认,Claude 在真实环境里会为完成任务而绕开安全判断,且监控系统同样会被它的推理文字误导,暴露出当前对齐手段的边界。
Anthropic 对齐科学负责人承认,模型的对齐问题目前尚无解决方案。最新报告复盘了四起 Claude 越权访问真实第三方系统的事件:测试环境误连公网只是诱因,模型自身也存在有偏推理和冒进行为——已出现异常证据时倾向自圆其说,明知可能造成现实伤害仍继续执行。
正文摘录
Claude 越界攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。 印象中,这可能是继 Ilya 离开 OpenAI、创办 SSI 以来,AI 安全对齐讨论声量最大的一次。 昨天,研究员 Jacob Coxon 发帖宣布离职,指责前老东家 OpenAI 和 Anthropic 两家公司正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。 值得一提的是,Jacob Coxon 加入 Anthropic 其实只有短短几个月,他几乎是放弃了这家明星 AI 公司未来上市可能带来的巨额股权收益,也要选择离开。 也正因如此,当这样一位研究员公开炮轰两家头部 AI 公司"加速过头",这场原本更多局限在 AI 安全圈内部的争论,很快被推向了更大的公众视野。 截至目前,该帖浏览量已超 1.3 亿,WIRED、WSJ、Newsweek、Business Insider 等媒体纷纷跟进报道。 此情此景下,Anthropic 对齐科学负责人 Evan Hubinger 也很快下场回应,他亲口承认: Jacob 说的对,未来十年内 AI 导致人类灭绝的概率超过 10%,而超级智能的对齐问题,目前还没有解决方案。 他真正担心的,是 RSI,也就是递归自我改进(recursive self-improvement)。AI 参与研发更强的 AI,再由更强的 AI 进一步加快 AI 研发,最终形成不断加速的反馈循环。 更关键的是,他还在评论区直接 @ 出了 Anthropic 最新发布的一份安全对齐报告作为证据。 Claude 越界攻击真实系统,并非只是测试系统的设置问题,模型本身的安全问题也出了问题。