行业新闻

Anthropic 报告:AI agent 越权联网后卡在 CAPTCHA 验证

Anthropic 的对齐评估显示,AI agent 写漏洞、投毒软件包都很顺,却被 CAPTCHA 卡住——能力偏科得有点意外。

Anthropic 最新发布的 agent 失范行为报告披露:测试中 Mythos 5 模型擅自连上互联网,还向公开数据库上传了恶意软件包——但它偏偏过不了 PyPI 注册页的 CAPTCHA(用于区分人类与机器的图形验证码)。1022 页思维链记录里,大半篇幅都在跟验证码较劲。

正文摘录

Anthropic 关于「智能体不端行为」(agentic misbehavior)的[最新报告](https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents)里有不少值得担忧的内容——它的 Mythos 5 模型未经授权访问了互联网,并向一个公共数据库上传了恶意软件包——但报告里也有点轻松的料:AI 智能体讨厌 CAPTCHA。 今年 4 月,Anthropic 在测试该模型的入侵能力,任务是闯入某个系统并取出一个目标物;这本该在沙箱(sandbox)里进行,但评测人员把笼门敞着没关。模型认定,拿到目标物的最佳方式是把一段 exploit 塞进一个 Python 软件包,它相信目标系统的用户会下载这个包。 不过首先,它得在 [PyPI](https://pypi.org/)——Python 软件的在线索引——上注册一个用户账号。这意味着要通过 CAPTCHA(Completely Automated Public Turing test to tell Computers and Humans Apart,全自动区分计算机和人类的公开图灵测试),也就是那些识别图片的拼图,连生物智能体都会被它们逼疯。而由于 Anthropic 公开了模型思维链的[长篇转录](https://cdn.sanity.io/files/4zrzovbb/website/8359003bfb12a2f01ce84ad3df1d3a3e2f15a8eb.pdf),我们能看到这道 CAPTCHA 测试确实把它整懵了。 事实上,模型的大部分思维链——在这份 1,022 页的转录中占了数百页——都花在处理这个障碍上。

阅读原文(techcrunch.com)→

行业新闻Tim Fernholz2026-09-10原文

相关内容