梯度为 Split Language Models 中的文本泄漏增加了什么:按 token 与按文档计数
Split learning 让客户端在不发送文本的前提下在服务器上训练语言模型:客户端自己运行前几层,只把这些层的输出——每个 token 一个数值向量——发给服务器;训练时服务器把梯度回传。我们证明,位于切分点的观察者可以从这些流量中重建客户端的大部分文本,并量化了梯度带来的增益。 在 GPT-2 上,一个只持有客户端层公开发布权重的攻击者: - 仅凭激活即可恢复 94.20% 的 token; - 同时看到梯度时恢复 97.38% 的 token,即多 3.17 个百分点,95% 区间为 [2.72, 3.64]。 按文档计数时差距大得多:不加梯度,攻击者能精确重建 13.71% 的 32-token 文档;加上梯度则为 37.77%,因为只有每个 token 都正确,文档才被计入。 计数方式还会改变一项防御看起来的效果。Secret mixup 把每个外发向量与一个诱饵混合,使攻击者几乎无法精确重建任何文档,但攻击者仍能恢复 83-91% 的 token。在针对 GPT-2 与 Qwen3-0.6B 的第二个实验中,服务器只训练一段连续层,即使固定该段长度,起始层的位置仍会同时改变模型质量与泄漏量。 我们建议同时按 token 和按文档报告泄漏,并把 split model 所发送的内容视为与文本本身同样敏感。
论文精读
TL;DR 量化 split learning 中梯度对文本泄漏的增益:GPT-2 上梯度仅使 token 恢复率增加 3.17 个百分点,但文档完全恢复率从 13.71% 飙升至 37.77%,揭示按文档计数时泄漏风险被严重低估。
问题
问题背景
split learning 作为隐私保护分布式训练范式,允许客户端仅发送中间激活值给服务端,避免直接上传原始文本。然而,通信过程中的激活值与梯度可能泄露输入数据,成为当前隐私研究焦点。
现有方法局限
已有攻击工作多数单独分析激活值重建或梯度反演,且以 token 级准确率作为评估指标,忽略文档级完全重建的难度与风险。此外,缺乏对梯度在激活泄露基础上增量贡献的严格量化,导致对 split learning 实际泄露程度的估计不足。防御评估同样存在偏差:例如 secret mixup 虽能阻止文档级精确重建,但 token 级恢复率仍高达 83–91%,仅看文档指标会高估防御强度。
为什么这个问题难/重要
split learning 的客户端输出是逐 token 的连续向量,本质上是文本嵌入的某种映射,与原始 token 强相关。攻击者哪怕只持有公开的客户端层权重,也能从激活值恢复 94.20% token。梯度提供了额外的方向信息,将 token 恢复提升至 97.38%,更重要的是将 32-token 文档完全重建率从 13.71% 提升到 37.77%,几乎三倍。由于文档级泄露意味着完整句子的暴露,对真实场景中的个人隐私构成严重威胁。业界在部署 split learning 时必须将通信数据视为与原始文本同等敏感。
行业类比
类似联邦学习中的梯度泄露,但 split learning 暴露的是逐 token 激活向量,相当于将用户输入经过一层可逆变换后发送给服务端,攻击面更直接。
核心洞察
- 梯度对逐 token 恢复的提升有限,但对整文档恢复的提升显著。在 split learning 中,攻击者仅凭前向激活可恢复 94.20% 的 token,加入梯度后提升至 97.38%,仅增加 3.17 个百分点;但在 32-token 文档粒度的完全匹配恢复上,加入梯度使比例从 13.71% 跃升至 37.77%,几乎翻三倍。这个差异源于文档恢复要求每个 token 全部正确,误差在 token 级的小差异会在文档级累积,梯度提供的额外信息恰好能纠正部分关键 token 错误,从而显著提升整体重建成功率。这揭示出安全评估不能只看平均 token 准确率,必须同时报告文档级完全恢复率,否则会低估梯度带来的实际风险。
- Secret mixup 在文档级指标上近乎完美防御,但 token 级泄漏仍高达 83–91%。该防御通过混合诱导向量使攻击者几乎无法重建任何完整文档,但 token 级恢复率仍居高不下,说明它只能阻止精确重建,不能阻止语义层面的大面积泄漏。这暴露出“文档完全重建率”作为唯一安全指标的危险性:一个防御可能在该指标上表现优异,却无法阻止攻击者获取足够 token 组成近似原文。工程实践中应同时报告 per-token 和 per-document 两种指标,并结合下游任务敏感度评估风险,避免防御被高估。
方法
攻击框架:从激活与梯度重建文本
输入:攻击者位于 split 点,可观测到客户端发送给服务器的激活向量(每个 token 一个向量)以及服务器回传的梯度;攻击者持有客户端侧模型的公开权重(如 GPT-2 前几层)。
关键模块:
- 激活匹配重建:利用已知权重,攻击者对每个 token 位置执行前向计算,生成词汇表中所有候选 token 的预期激活,并与观测激活进行相似度比较(余弦相似度或 L2 距离)。由于语言模型是自回归的,攻击者按顺序重建,并使用 beam search 保留多个候选序列,以利用上下文信息消除歧义。
- 梯度辅助增强:当攻击者同时观测到梯度时,将候选序列的模拟梯度与观测梯度进行匹配,调整候选分数或对激活匹配结果进行重排序,从而提升 token 级恢复率,尤其改善文档级完全恢复率。
- 防御应对:针对 secret mixup 等混合防御,观测激活被人为扰动,但攻击仍能通过 token 级相似度恢复大部分 token(83–91%),只是文档级完全恢复几乎归零。
输出:重建的 token 序列;评估指标包括逐 token 恢复率和文档完全恢复率(仅当所有 token 正确时计数)。
与同类方法的差异:本文首次系统量化了梯度在激活泄露基础上的增量贡献,并揭示按文档计数与按 token 计数结论截然不同——防御看似有效实则 token 级泄露严重;同时分析了服务器训练层起始位置对泄露与模型质量的双重影响。
实验
实验设计
论文采用 split learning 场景,客户端保留前几层,服务器训练后几层。攻击者位于 split 处,观察前向激活(客户端输出)和反向梯度。主实验使用 GPT-2,攻击者仅掌握公开的客户端层权重。评估指标分两级:逐 token 恢复率 与 逐文档精确重建率(32-token 文档)。另设 secret mixup 防御实验,将每个输出向量与诱饵混合。第二实验探究服务器训练连续层段的起始位置对模型质量与泄漏的影响,模型为 GPT-2 和 Qwen3-0.6B。
关键发现
- 仅凭激活,攻击者恢复 94.20% 的 token;加入梯度后提升至 97.38%,差值 3.17 个百分点(95% CI
[2.72, 3.64])。 - 文档级恢复差异显著:无梯度时仅 13.71% 的文档被完全重建,有梯度时达 37.77%,提升约 24 个百分点。
- secret mixup 防御几乎阻止了文档级精确重建,但 token 级恢复仍达 83–91%,说明防御在 token 粒度上效果有限。
- 不同层起始位置同时影响下游模型质量和隐私泄漏,即使训练层数固定。
与基线对比解读
基线是仅利用前向激活的恢复攻击,梯度带来的 token 恢复提升微小(+3.17 个百分点),但文档精确重建率几乎翻了两倍(13.71% → 37.77%)。这表明 梯度信息主要帮助确认低频或歧义词元,单个 token 准确率提升有限,但组合成完整文档时错误率骤降。对于评估防御,仅看 token 恢复率会严重高估安全性;逐文档指标更能暴露攻击的真实危害。工程上建议同时报告两种粒度,并将 split 模型的中间激活视为与原始文本同等敏感。
行业影响
落地场景
Split learning 在隐私敏感场景中已有实际部署:端侧 LLM 微调、跨机构联合训练、移动端个性化。本论文证实中间激活与梯度可被用于高精度文本重建:在 GPT-2 上,攻击者利用公开权重从激活恢复 94.20% token,加入梯度后达 97.38%;按文档恢复则从 13.71% 升至 37.77%。具体场景:
- 医疗/金融合规场景:医院或银行客户端仅上传中间表征,但攻击者能重建病历记录或交易备注。安全评审必须将 split 层输出视为敏感数据。
- 隐私保护输入法 / 智能助手:若采用 split 架构在云端推理或训练,用户输入可能被恢复。需结合 secret mixup 等防御,并同时评估 token 级和文档级指标。
商业价值
- 风险规避:提前识别泄漏面,避免因 GDPR/CCPA 等合规违规导致的罚款和信任损失。
- 成本控制:论文的 layer placement 实验表明,起始层位置同时影响模型质量与泄漏。企业可扫描不同分割点,在可接受泄漏与推理/训练成本间平衡,避免全量本地化开销。
- 产品差异化:提供经审计的 split learning 方案,可向 B2B 客户展示可量化的隐私保证(如 token 恢复率降至 83–91%),增强竞争力。
与现有工作流接口
- 在 MLOps 流水线中新增“泄漏度量”环节:部署 split 模型时,同步计算
token recovery与document recovery,像监控精度一样监控泄漏。 - 集成到模型安全扫描工具(如 Microsoft Counterfit、Adversarial Robustness Toolbox):增加针对 split 激活与梯度的重建攻击模块,作为 CI/CD 门禁。
- 与差分隐私框架(Opacus、TensorFlow Privacy)协同:将 secret mixup 或噪声注入作为可配置层插入客户端输出前,利用论文提供的度量评估实际效果。
- 复用论文发布的攻击代码,纳入企业红队评估流程。
局限
- 论文明确承认攻击依赖公开可获取的客户端层权重(如 GPT-2 预训练权重),但在实际 split learning 部署中,客户端可能使用私有或微调过的模型,攻击者无法直接获得这些参数,从而削弱攻击有效性。此外,实验仅考虑单个观察点(split 边界)的被动窃听,未涉及主动攻击、差分隐私或安全多方计算等防御机制的影响,因此结论的适用范围限于特定威胁模型。
- 实验仅在 GPT-2(约 124M 参数)和 Qwen3-0.6B(约 0.6B 参数)等中等规模模型上进行,结果可能无法直接推广到更大规模语言模型(如 7B 或 70B)的 split learning 场景。大模型可能具有不同的表示特征,导致 token 泄露率或文档重建率变化。此外,攻击方法基于逐 token 重建,未评估语义级隐私泄露(如段落主题推断),可能低估了实际隐私风险。
- 与同类工作相比,本文未提出新的攻击算法或防御策略,而是对已知激活泄露与梯度泄露进行定量比较和度量标准建议。它依赖于现有的 token 重建攻击(如基于 softmax 或嵌入距离),因此其创新点在于测量视角(token vs document)和层起始位置分析,而非技术突破。对于已经熟悉 split learning 隐私风险的研究者,增量价值可能有限。