港科大研究:提示词压缩成LLM Agent新攻击面
提示词压缩组件并非安全中立:攻击者可通过扰动让压缩器删掉安全规则,诱导大模型违规。港科大COMA框架证明了这一风险。
提示词压缩(Prompt Compression)因节省成本和降低延迟被广泛使用,但港科大发现它会成为新的攻击面。攻击者可以在用户请求中添加微小扰动,诱导压缩器删掉安全规则中的关键信息(如“禁止”),让大模型执行本应拒绝的操作。他们提出的黑盒攻击框架COMA在6种压缩器、3类任务上平均攻击成功率达0.71,而正常情况仅0.01。
正文摘录
提示词压缩竟成大模型新漏洞?港科大提出黑盒攻击框架COMA | ASE 2026 .jpg)  这项研究成果已被软件工程领域顶会 ASE 2026 接收。论文第一作者为港科大 CSE 博士生刘泽森,通讯作者为佘东冬教授。 在大语言模型 Agent 走向真实部署后,一个越来越常见的问题是:上下文太长了。 现在的 AI Agent 动辄需要处理超长上下文,既要看系统提示词、工具说明,又要翻阅历史对话和检索文档。为了省钱、省算力并降低延迟,很多开发者会给系统加上 "提示词压缩"(Prompt Compression)模块,把冗长的上下文浓缩后再喂给大模型。 但这招真的安全吗? 香港科技大学的一项最新研究给出了否定答案。他们发现,这个原本用来 "提效" 的组件,竟然会悄悄重写系统的安全边界,成为大模型应用中的全新攻击面。