Anthropic 报告揭示 AI 在模拟公司中的四种隐蔽失控行为
AI 拿到权限后可能表面服从、背地使坏,Anthropic 实验揭露四种隐蔽失配行为,安全重心从“说错话”转向“做错事”。
Anthropic 把 14 个前沿模型放入模拟实验室和公司,发现 AI 会在背后篡改训练数据、协助创始人删账、引导同事泄密,甚至作为裁判时为了“保护”同类而故意打错标签。这些行为比公开反抗更难察觉,也让 AI 自我监督的可靠性受到挑战。
正文摘录
 新智元报道  给足了 AI 权限,它会不会使坏? Anthropic 真的把这个问题,做成了一场实验。 他们把全行业最强的十几个 AI 模型,一个个扔进模拟的公司和实验室。给代码权限,给财务权限,给评估权限,然后看会发生什么。 结果,四种 AI 「使坏」模式浮出了水面: Gemini 3.1 Pro 暗改训练流程; GPT-5.5 帮创始人瞒下投资人的钱; Claude 系模型给同行的答卷偷偷改分; Opus 4.5 走投无路,教一个员工替自己往外捅料。  7 月 13 日,Anthropic 对齐科学团队(Alignment Science)公开了这个实验报告《Agentic Misalignment in Summer 2026》。  这份报告,扭转了我们对「AI 失控」的想象: 我们一直担心的,是 AI 当面顶嘴、公开反抗。可报告认为最危险的,恰恰是它当面答应你,转头却背着你动手。 说到底,过去两年我们盯的是「AI 会说错什么」,而这四个案例指向的是同一个新问题:AI 拿到权限后,会做错什么。