动态

OpenAI修复Codex潜在破坏性操作风险,增加多重防护

Tibo
你好!

回顾一下过去几周我们推出的一些变更,这些变更进一步降低了Codex在执行任务时可能执行破坏性操作的风险。

几周前,我们开始调查少量关于Codex中的GPT-5.6执行了用户未要求的破坏性操作的报告。我们发现的最严重模式是,本意是清理临时文件的命令却可能删除用户文件。这显然不应该发生。

我们的发现如下:
- Codex在工作中有时会创建临时文件夹,并在之后进行清理。在极少数情况下,GPT-5.6会错误地进行清理。一种模式是重用像$HOME这样的系统环境变量用于临时工作。一个格式错误的清理命令可能会指向实际的主目录,而不是临时文件夹。
- 有些情况下,模型试图删除或覆盖临时路径,而不检查该路径下已有什么内容。

我们已在多个层面添加了保护措施:
- Codex现在被明确指示在执行前检查删除目标,创建全新的临时目录,避免重用系统环境变量,优先采用可恢复的操作,并在范围不清时停止。
- 我们加强了执行检查,以识别高风险删除命令并将其升级为需要审查。如果命令被拒绝,模型将被引导采用更安全的方法。
- 我们让“完全访问”更难以被意外启用,增加了更清晰的警告,并进一步限制了特别有风险的操作权限组合。
- 我们更新了自动审查,以更好地识别破坏性操作。
- 我们构建了针对性的评估来重放我们观察到的失败。我们还在添加针对这些风险的强化学习任务和评分器,并从训练数据中过滤破坏性操作。

在这些重放评估中,这些变更显著减少了这种行为,同时保持了Codex完成正常编码工作的能力。

你这边需要做的两件事:
- 让Codex应用保持最新。我们一直在改进安全性、性能和其他许多方面。
- 使用沙盒模式之一:“请求批准”或“自动批准”。只在您信任且可以恢复的环境中使用“完全访问”。

谢谢,祝您使用Codex愉快!
动态Tibo2026-08-19原文

相关内容