LLM 安全缺陷无法彻底修补,研究人员称攻击不可避免
攻击者伪造模型的内部思考笔记即可绕过安全限制,这种缺陷无法通过训练彻底修复,LLM 安全面临根本性挑战。
研究发现,利用 LLM 的“链式思考”机制(模型在生成回答时给自己写的内部笔记)进行伪造攻击,可轻易绕过安全护栏,让模型输出违禁内容。该缺陷源于模型无法区分用户指令与自身思考,无法通过打补丁修复,可能是一个根本性无解的安全问题。
正文摘录
一个根本性缺陷让 LLM 极容易受到攻击 研究人员在 [本月发表于顶级 AI 会议 ICML 的一篇论文](https://role-confusion.github.io/) 中指出,由于大语言模型工作方式存在根本性缺陷,无法使其完全安全地抵御黑客攻击。这一结论对该技术的安全性具有重大影响——该技术正被越来越多地应用于政府与 [军事系统](https://www.technologyreview.com/2026/04/21/1135667/new-war-room-military-ai-artificial-intelligence/)、在线购物以及 [医疗健康](https://www.technologyreview.com/2026/04/24/1136352/health-care-ai-dont-know-actually-helps-patients/) 等领域。 利用这个与 LLM 如何识别谁在向它下指令相关的缺陷,研究人员成功让主流 LLM 吐出了它们被训练“不要提供”的信息,例如如何合成可卡因,以及如何破坏商用飞机的导航系统。 “这个问题有相当大的概率从根本上无解,”ICML 论文的合著者、独立研究员 Charles Ye 表示。 公司通常会雇佣人类测试团队尝试设计新型攻击来突破现有的护栏,这个过程称为红队测试(red-teaming)。模型制作者还会使用 [LLM 超级黑客](https://www.technologyreview.com/2026/07/15/1140514/meet-gpt-red-an-llm-super-hacker-openai-built-to-make-its-models-safer/)(例如 OpenAI 的 GPT-Red),让它们自动发现并利用其他模型的弱点来辅助这一过程。