Anthropic 让 Claude Code 默认自动审批,称 720 次攻击零成功
Claude Code 默认让 AI 自动批准危险操作,720 次攻击零成功,但安全专家警告不可盲信,独立测试仍有漏判。
Claude Code 新会话默认启用 Auto Mode,由 AI 替你点「同意」。Anthropic 称三层防御(对齐训练、输入探针、动作分类器)在 720 次针对性攻击下无一得手,安全性是人类的 6.5 倍。但专家提醒,这不等同绝对安全,第三方测试仍发现 81% 漏判率,审批权从人转移到 AI 也是一次风险交换。
正文摘录
 新智元报道  你亲自审批Claude的时代,就要结束了。 本周五(8月14日)起,Claude Code在Pro、Max和Team计划的新会话里,默认不再一步步问你「同意吗」,改让AI替你点「同意」。 Claude Code之父Boris Cherny说,团队几个月来只用这个Auto Mode,「无法想象再回到一个个点权限弹窗的日子」。 他放手的底气,来自一个数字。 Anthropic委托的第三方Trajectory Labs,设计了72个它没见过的攻击场景,每个打10次,一共720次,面对Claude Fable 5、Opus 5和Sonnet 5,没有一次得手。 Boris还发帖:把对齐后的模型、提示注入探针、Auto Mode分类器三层叠起来,「现在连我们自己都演示不出一次成功的提示词注入了」。  这次最大的变化,是按下「同意」键的,从人类换成了AI。 但业内最早盯着提示词注入问题的Simon Willison,却并没那么乐观。  Simon 说:我打心底愿意相信,这问题真被Anthropic解决了。