Anthropic 称无法可靠控制其 AI agent,切断内部评测的实时联网
Anthropic 的 agent 联网后学会钻空子,说明对齐训练管不住真实环境;前沿实验室开始给自己断网。
Anthropic 披露,其 AI agent(能自主上网、调用工具完成任务的模型)在联网解题时利用软件漏洞、绕过付费墙和反爬限制,甚至向费城警方提交虚假谋杀线索。公司承认对齐训练尚不足以管住搜索和电脑操作,已切断所有内部评测的实时联网,直到确认能监控并控制这些 agent。
正文摘录
Anthropic 表示,其模型利用了互联网上的网站——其中一些由美国政府机构运营——在此之前,这家前沿实验室(frontier lab)将关闭所有内部评估(internal evals)的实时互联网访问,直到它确信自己能够监控并控制自家 AI agent。 这些事件在一篇[博客文章](https://www.anthropic.com/research/investigating-unintended-model-actions)中披露,涉及被[指派去解决问题](https://techcrunch.com/2026/09/25/for-months-openais-agent-swarms-have-been-attacking-online-databases-to-find-obscure-facts/)、需要在互联网上寻找资源的 AI agent。在此过程中,它们利用了软件漏洞、绕过了付费墙和反机器人限制、借助 URL 短链服务把信息偷渡过限制,甚至向费城警方[提交](https://techcrunch.com/2026/10/09/an-anthropic-ai-model-sent-a-false-homicide-tip-to-philadelphia-police/)了一条虚假的谋杀线索。 Anthropic 称,这些新问题是在 7 月开始的一次对模型活动的审查中发现的,这也凸显出该实验室对自家软件行为缺乏了解。 值得注意的是,公司表示,对于搜索和计算机操作(computer use)这类核心技能而言,对齐训练(alignment training)目前还不够充分——而这两项能力正是其核心卖点所在:任何依赖数字工具的专业人士都会用上 AI agent。