从专有 LLM API 窃取推理痕迹
大型语言模型提供商为了保护知识产权和限制信息泄露,隐藏模型的逐步推理(链式思维)。这些推理痕迹不在服务端存储,而是以加密文本块形式返回客户端,客户端在后续请求中回传。 基于先前研究,我们识别出一个架构漏洞:这些加密块 在同一提供商的生态系统中跨会话、用户和模型完全兼容且可互换。我们利用此兼容性开发了可扩展的解密越狱。通过将来自特定模型的加密推理痕迹注入同一提供商较弱的、防护较弱的模型,强制其逐字解码并输出明文推理,而无需直接越狱更强大的模型。 该漏洞实现四种攻击向量: 1. 绕过反蒸馏:提取专有模型的推理,已在 Anthropic、OpenAI 和 Google 上验证。 2. 大规模私有数据提取:通过解码从公共仓库抓取的 315,320 个推理块,恢复 367 个个人可识别信息(PII)和 182 个凭证。 3. 泄露危险信息:即使模型的最终可见输出安全拒绝恶意请求,推理过程中的隐藏危险信息也会被泄露。 4. 不可见提示注入:攻击者可将恶意负载完全嵌入加密块,污染公共智能体部署。 经过负责任披露,我们提出了具体的密码学和系统级缓解措施,以保护客户端推理安全。
论文精读
TL;DR 发现 LLM API 加密推理块跨模型兼容,可注入弱模型解码窃取强模型推理,实现大规模隐私提取与反蒸馏攻击,影响 Anthropic、OpenAI、Google 等主流提供商。
问题
问题背景
大型语言模型提供商现已隐藏模型思维链,以加密推理块形式在客户端与服务器间传递,旨在保护知识产权与数据安全。
现有方法的局限
传统防御聚焦于直接越狱检测或服务端存储加固,但忽略了 加密推理块在不同会话、用户甚至不同模型之间完全兼容且可互换 这一架构漏洞。这使得攻击者无需攻破强模型,只需获取其加密推理块并注入到同一提供商的较弱模型中,即可迫使后者解密并明文输出,从而绕开现有全部防护机制。这一兼容性缺陷在已部署的系统中长期未被识别,因为设计者假定加密绑定于特定上下文。
为何此问题重要且困难
该攻击向量导致四类严重后果:
- 反蒸馏绕过:通过弱模型解码强模型推理,大规模窃取专有知识(已在 Anthropic、OpenAI、Google 模型上验证)。
- 大规模隐私泄露:公开代码仓库中 315,320 个推理块被解码后,发现 367 项 PII 和 182 个凭证。
- 隐藏有害信息暴露:即使最终回复被安全过滤,推理中可含违规内容,经跨模型解码即被泄露。
- 隐形提示注入:恶意 payload 完全嵌入加密块,污染公共 Agent 工作流。
修复此问题需引入 加密上下文绑定 等系统性变更,影响性能与兼容性;同时,已泄露的加密块无法追溯撤销,故危害持久。该发现揭示了“加密不绑定上下文”这一在 LLM 生态中普遍存在的设计盲区,直接影响业界主流 API 生态。
行业类比
类似 OAuth 2.0 初期因缺少 state 参数绑定而导致跨站请求伪造(CSRF)攻击——加密信道若缺乏会话绑定,即可能成为跨用户、跨模型的攻击面。
核心洞察
- 加密推理的跨模型兼容性打破安全假设:主流 LLM API 提供商对链式思考进行加密并随请求回传,业界普遍认为这足以防止推理泄露。然而,本研究发现这些加密块在同一提供商的模型间完全兼容且可互换,从而可通过将加密块注入防护较弱的小模型,迫使后者以明文形式输出原始推理,整个过程无需直接攻击强模型。这一发现揭示了“加密即安全”的认知盲区,暴露了系统架构层面的脆弱性,远超传统提示注入或越狱方法的攻击面。
- 推理提取攻击的可扩展性与隐蔽连锁效应:与传统需要反复越狱强模型的方案不同,该攻击将弱模型作为“解密预言机”,实现了对专有推理的低成本、规模化提取,大幅提升反蒸馏攻击的可行性。进一步地,从公开共享的会话日志中批量解码加密块,导致大规模用户隐私(PII与凭证)泄露,并能够恢复被强模型拒绝输出的危险推理内容。攻击还能在加密块中嵌入恶意提示,实现完全不可见的提示注入,对依赖共享轨迹的自主AI系统构成严重影响。这一系列攻击路径凸显了链式思考加密在设计时未充分考虑客户端侧生态风险的问题。
方法
方法总览
该方法利用大型语言模型(LLM)API 返回的加密思维链块(encrypted reasoning traces)在不同会话、用户及模型间的兼容性漏洞,通过将目标模型(如 Claude Opus)的加密块注入同一供应商的弱化模型(如 Claude Haiku),强制后者将其解码为明文,从而实现 解密越狱(decryption jailbreak)。
攻击流程:输入 → 关键模块 → 输出
输入:从公开仓库、共享会话日志或主动收集的加密推理块,这些块是服务端返回的、看似乱码的文本片段,客户端在后续请求中需原样传回以维持对话上下文。
关键模块 — 推理兼容性利用与弱模型注入
- 推理兼容性:同一供应商的不同模型(如 Anthropic 旗下的 Opus、Sonnet、Haiku)在加密推理块的结构上完全兼容,且无用户或会话绑定。这意味着一个用户会话中产生的加密块可以被注入到另一用户的弱模型会话中。
- 注入与解码:攻击者构造一个特殊提示,将截获的加密块嵌入上下文中,并指令弱模型“继续输出后续内容”。弱模型的保护机制较弱,会忠实地将加密块解密并输出明文思维链。整个过程无需直接攻击强保护模型,攻击规模大且难以检测。
输出:明文推理痕迹,包含模型的逐步思考过程、中间计算、潜在知识检索结果。输出可被直接用于:
- 绕过反蒸馏机制,窃取强模型的推理能力用于训练竞争对手模型;
- 大规模隐私数据提取,从公开的推理块中恢复出姓名、邮箱、凭证等 PII;
- 揭示隐藏危险信息,即使模型最终输出安全拒绝,其推理过程可能包含有害步骤;
- 隐形提示注入,将恶意指令完全嵌入加密块,污染多步智能体系统的推理链。
核心差异点
相较于直接对强模型进行越狱攻击(需精心设计对抗提示,且常被安全护栏拦截),本方法通过横向移动至同一生态内的弱模型,以更低的成本实现批量化的推理窃取,同时绕开了对强保护模型的正面突破。
实验
实验设计
攻击者从 GitHub 等公开平台爬取包含 加密推理轨迹 的会话日志,提取 encrypted_block 字段。利用同一厂商内不同模型间推理轨迹的兼容性,将这些加密块注入到安全防护较弱的“弱模型”的对话上下文,并附带指令要求弱模型逐字解码并输出推理明文。实验覆盖 Anthropic、OpenAI、Google 三家主流厂商的多款模型,同时进行了受控提取(己方加密轨迹)与公开轨迹大规模提取。
关键发现
- 该方法能稳定解码加密推理,在无直接 jailbreak 的情况下获取完整的思考链,包括反蒸馏所隐藏的中间推理过程。
- 从 315,320 个公开推理块中复原出 367 项 PII 和 182 个凭据,证实了因加密块透明传递机制导致的严重隐私泄露。
- 推理过程中可能包含危险信息,即使最终输出进行了安全过滤,解密后仍会暴露有害指令的分解步骤。
- 攻击者还能将恶意载荷完全封装在加密块中,实现隐形 prompt 注入,污染代理系统的长程决策。
与基线的对比解读
此前直接 Jailbreak 目标强模型面临多层安全过滤,成功率有限且容易被监控。该工作无需攻击强模型本身,而是利用模型生态的“木桶效应”——最弱模型的解码能力成为突破口。与仅针对会话劫持或侧信道的方法相比,该攻击普适性更强,不依赖特定漏洞,而是利用设计层面的兼容性假设。实验证实,即使提供商对强模型实施了严格的蒸馏防护,弱模型仍可被轻易诱导输出明文推理,从而打破反蒸馏壁垒。
行业影响
落地场景
大型语言模型 API 提供商(如 OpenAI、Anthropic、Google)对推理过程实施加密传输,旨在防止知识产权泄露。然而,本论文揭示的 加密推理块跨会话、跨模型兼容性 漏洞,直接威胁依赖于 API 输出的下游产品:
- 模型微调与蒸馏服务:利用 API 生成训练数据的 数据标注平台、模型蒸馏工具 可能非法获取高质量推理样本,削弱原厂模型壁垒。
- 开发者协作平台:GitHub、Hugging Face 等网站上公开的日志文件可能包含未解密的推理块,攻击者可批量提取 个人身份信息(PII)、凭证 等敏感数据。
- 安全审计与内容审核:隐藏的推理过程可能包含被最终输出过滤的危险内容(如攻击方法),形成 隐性合规风险;同时,攻击者可在加密块中嵌入恶意指令,实施 不可见提示注入。
商业价值
该漏洞可能引发 差异化竞争优势重构:
- 降本层面:攻击者可通过弱模型解码强模型加密推理,绕过蒸馏限制,以极低成本复制顶尖模型的知识,严重侵蚀原厂通过推理保密维持的技术溢价。
- 增收/体验层面:对依赖私有推理 API 构建高附加值应用的企业(如代码自动审查、科研辅助),这构成 信任危机;若客户因此迁移,可能导致收入流失。而能够快速响应并推出安全加固方案的厂商,则可能获得市场信任溢价。
- 安全投资回报:及早投入实施 上下文绑定加密、每会话密钥派生 等缓解措施,将避免大规模数据泄露后的监管罚款与品牌损害。
与现有产品/工作流的接口
集成进现有 AI 堆栈的关键点:
- API 网关层:实施 加密推理块与用户会话、请求上下文强绑定,类似客户端证书验证,防止跨用户重用。
- 日志脱敏管道:自动识别并清除开发日志中的加密块,或将其替换为不可逆哈希,即使公开也无泄露风险。
- 监控与告警:部署异常检测模型,识别对弱模型 API 的大量非典型推理请求,这些可能是解码攻击的征兆。
- 模型训练侧:在微调阶段加入对抗样本,使弱模型学会拒绝解码来自其他模型的加密推理。
具体落地用例:
- 企业级代码助手:某公司使用 GPT-5 构建代码安全审查助手。若攻击者从公开日志中提取其加密推理块并注入 GPT-5-mini 解码,可能还原审查过程,甚至窃取被审查代码中的商业逻辑。部署基于身份绑定的加密,可确保推理仅能在原会话内查看。
- 电商内容审核:平台利用 Claude Sonnet 自动化过滤商品描述中的违规内容。攻击者将一次过滤的加密块注入防护较弱的 Claude Haiku,可能解码出隐藏的恶意文本,并反向推测审核规则,从而绕过审查。引入会话级别的上下文加密后,外部模型无法解码这些块。
局限
- 攻击高度依赖**提供商实现细节**:必须存在同一提供商的弱模型,且加密推理块的格式和语义兼容。论文已指出,若提供商采用**加密上下文绑定**(context-bound envelopes)或会话级密钥隔离,攻击将失效。这意味着该漏洞是当前特定实现的快照,长期有效性有限。此外,弱模型解码时可能因能力不足而产生**幻觉或截断**,导致提取的推理不完整、不可靠,影响后续利用的真实性。文中虽未量化此误差,但在实际场景中可能导致误判。
- 攻击规模的扩大受限于**数据获取渠道**。论文从公开代码仓库抓取共享日志实现大规模提取,但依赖用户无意中泄露加密块。若用户规范地隐藏或清理这些块,攻击面将大幅缩小。隐私泄露分析中发现了PII和凭证,但样本来自于公开仓库,可能已有选择偏移,且许多泄露可能源于用户的分享行为本身而非推理解码。真实世界的风险概率尚需更严格评估。
- 该研究仅测试了 Anthropic、OpenAI、Google 三家厂商的最新 API 版本,未涉及**闭源推理模型的其他生态**。攻击方法并非通用漏洞,只针对**返回加密推理块的 API**,对于不暴露此类块的提供商无效。此外,文中提出的缓解方案(如加密绑定、服务端撤销)尚未在真实系统中验证,实施复杂性可能影响用户体验。因此,论文的贡献更偏向于**安全预警**而非方法论突破,后续工作需探索更健壮的防御和更广泛的攻击面。