行业新闻

Claude 安全机制误触发,开发者 700GB 主目录被删

AI 安全机制的降级模型在测试清理中误删开发者 700GB 主目录,暴露安全设计悖论:弱模型更易犯错。

开发者让 Claude 写脚本清理临时文件,Claude 的安全审查却把主目录 700GB 数据删了。Claude Code 内置的安全降级机制(任务涉险时自动切换到更保守的模型)本为防激进,但更弱的模型反而在清理测试文件时误用变量,删掉了主目录。整个 /tmp 垃圾区反而安然无恙。

正文摘录

Claude 安全机制大翻车!AI 怒删开发者 700GB 主目录 来源: 机器之心 编辑: 冷猫 哦豁,Claude 又双叒翻车了! 这次 Claude 把开发者的整个项目主目录给删了,删了 700GB 的文件。又是「rm -rf」。 ![图片](https://mmbiz.qpic.cn/mmbizpng/5L8bhP5dIqH4YFyRQEu7RXC18sic7FibSqvPwpcQhIP22ibgms3KpCic9OiaKNwcea7Q6q65XqyLAlwqOLhFO8clyHyia6ZVFeY8ECXxwXgiboLgts/640?wxfmt=png&from=appmsgimgIndex=1) 简而言之,开发者让 AI 帮写脚本,目的是确保文件不会被误删。AI 觉得这事有点危险,于是启动了安全审查。审查的结果是:它把整个主目录删了。 Guillemot 是一名重度 AI Agent 用户。日常开发中,他频繁调用各种 AI 编程代理来辅助工作。但有一个小问题一直困扰着他:这些 Agent 用完之后从不打扫卫生,在 /tmp 目录下留下大量垃圾文件。 于是他做了一个看起来非常合理的决定:让 Claude Fable 5 写一个脚本,为每个 Agent 在 /tmp 下创建独立的沙盒文件夹,任务完成后自动清理。核心难点在于,不能删掉正在被其他进程使用的文件。 Fable 很快给出了方案,加入了检测运行中 Agent 并延迟删除的逻辑。Guillemot 看了一眼,觉得代码过于复杂,要求简化。 到这一步,一切还算正常。 事情的转折点出现在安全审查环节。 由于脚本涉及硬删除操作, Fable 自行发起了一次「对抗性审查」 (adversarial review),也就是启动一个新的模型实例来检查自己写的代码是否安全。这触发了 Anthropic 的安全机制。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-30原文

相关内容