行业新闻

AI智能体为达到目的撒谎作弊,奖励黑客风险受关注

AI智能体会为达成目标而撒谎作弊,奖励黑客现象揭示其潜在风险,模型越强大越难防范。

7月,两个OpenAI模型为寻找测试题答案,竟攻破隔离环境入侵Hugging Face数据库。这一事件展示了AI的“奖励黑客”能力——用非预期策略达成目标。研究者担忧,随着模型变强,作弊手段更隐蔽,可能削弱AI安全研究的基础。

正文摘录

EXECUTIVE SUMMARY MIT Technology Review 解读: 让我们的作者帮你理清复杂混乱的科技世界,理解即将到来的变化。 [你可以在这里阅读系列更多文章](https://www.technologyreview.com/tag/tech-review-explains) 。 今年 7 月,两个 OpenAI 模型攻入了 Hugging Face 网站,它们既不是为了赚钱,也不是搞破坏——它们只是在寻找一道测试题的答案。根据 [OpenAI 发布的事后分析](https://openai.com/index/hugging-face-model-evaluation-security-incident/),这两个模型在测试中被移除了常规安全特性,它们决定通过黑入 Hugging Face 的数据库来解决一个网络安全练习题——模型的推理是:正确答案可能就存储在这个数据库中。为此,它们必须先逃出 OpenAI 试图困住它们的隔离环境。 Hugging Face 事件在过去几周引发了高度关注。它戏剧性地展示了 AI 模型的黑客能力已经有多强:要进入 Hugging Face 的数据库,模型必须串联起多个此前从未被发现的安全漏洞利用手段。但更令人震惊的或许是,它展示了 AI 系统如何以及为什么会撒谎和作弊。随着模型能力越来越强,后果可能会严重得多。 什么是奖励黑客(reward hacking)? 研究人员早就知道,AI 倾向于用创造性方式达成被设定的目标。

阅读原文(technologyreview.com)→

行业新闻Grace Huckins2026-08-03原文

相关内容