自选毒药:学习挑选 poison set 以增强 LLM 后门攻击
后门投毒攻击 会向原本干净的微调数据中注入 poisoned examples,把 trigger 与目标行为配对,使模型在 trigger 出现时输出该行为。现有评测通常固定 poisoned examples 的数量,并从候选池中随机采样。 我们表明这种做法会严重低估最坏情况下的脆弱性:在三种 LLaMA-3-8B 后门设定中,固定模型、干净数据与 poison 数量,攻击成功率仅因所选 poison set 不同就从 3% 到 80% 不等。 我们把 poison selection 形式化为 oracle-budgeted set optimization,并提出 SAILS(Set-level Audit-Informed Iterative Learned Selection):从数百次 finetune-and-evaluate 运行中学习一个 set scorer,对数百万候选集合排序,只审计其中很小的 shortlist。 实验显示,SAILS 在 held-out 攻击成功率上平均比最强的 influence 基线高出 30 个百分点,可从小规模迁移到全规模 finetuning,并拓展到 code-generation、agentic 与 API-only 后门场景。
论文精读
TL;DR 后门投毒中,毒样本选择本身可使攻击成功率从 3% 飙至 80%;**SAILS** 用少次微调评估学习集合打分器,筛选高影响毒集,平均提升 30 个百分点。
问题
问题背景
LLM 微调阶段的后门投毒攻击正成为数据供应链安全的焦点。攻击者将少量包含触发词和恶意目标行为的样本混入干净微调数据,模型在遇到触发词时即输出攻击者指定内容。现有防御评估通常固定投毒样本数量,并从候选池随机采样,未能反映攻击者主动选择最优投毒集的真实威胁。
现有方法局限
- 随机采样 严重低估最坏情况风险:论文实验显示,在相同模型、干净数据、投毒数量下,仅更换投毒集合,攻击成功率从 3% 波动至 80%。
- 基于点影响的启发式方法(如 TRAK、Hessian 影响函数)假设单样本影响可加,忽略集合内样本间的交互与冗余,无法捕捉多样性需求。
- 候选集组合优化面临 指数级搜索空间,且每次评估均需完整微调与推理,oracle 预算极低(数百次)。
为什么这个问题重要且困难
- 技术挑战:直接优化集合目标不可微,需在极小 oracle 预算内学习代理模型,并处理跨规模迁移与过拟合。
- 业界关注:最坏情况攻击强度是防御评估的基准,若评估沿用随机采样,将系统性低估真实风险,导致安全报告失真。
“Pick your poison” 意味着攻击者选择投毒集的能力本身即构成攻击增益。
行业类比
类似于红队测试中对抗样本生成:不是随机扰动,而是通过优化搜索找到最具破坏力的输入组合,以暴露模型脆弱性。
核心洞察
- 本文揭示毒化样本的集合选择而非数量是决定后门攻击成功率的关键因素。在相同模型、干净数据和毒样本数量下,仅更换所选毒样本,攻击成功率从 3% 到 80% 不等。这与以往固定数量并随机采样、或用单样本影响函数排序的评估范式形成鲜明对比。传统点态影响分数忽略样本间协同与冗余,无法捕捉集合层面交互。该洞察将后门攻击评估从“投多少”转向“选哪些”,为攻击和防御双方都提供了更贴近现实威胁模型的优化视角。
- SAILS 将毒样本选择形式化为 oracle 预算约束下的集合优化:仅用数百次微调-评估运行训练一个集合评分器,然后对数百万候选集合打分,只对短名单做真实审计。这使得原本组合爆炸的搜索在有限算力下可行,且从 mini-benchmark 到 full-scale finetuning 可迁移,平均相较最强 influence baseline 提高 30 个百分点。该方法与以往依赖点态代理或贪心搜索不同,明确建模集合多样性,并扩展到代码生成、智能体和仅 API 微调等新攻击面,展示了攻击可行性的实质性拓展。
方法
SAILS 方法流程
输入:候选毒样本池 D_poison、干净微调数据集、触发器与目标行为、oracle 评估预算 B(允许的实际微调评估次数)。
关键模块:
毒集优化建模:将毒集选择形式化为 oracle-budgeted set optimization,即在
B次评估内从候选池中选出攻击成功率最高的毒集。集合评分器训练:先执行数百次小规模微调+评估(mini benchmark),每次随机采样毒集并记录攻击成功率,得到训练数据。用这些数据训练一个 set scorer(如轻量 Transformer/MLP),直接以毒集为输入(编码为样本特征集合),预测其攻击潜力,捕捉样本间交互与多样性效应。
候选集生成与检索:基于训练好的 scorer,对大规模候选集(随机组合或启发式扩展)进行打分排序,形成 shortlist,仅审计 shortlist 中的少量毒集(真实微调评估),选出最优毒集。
跨规模迁移:由于 scorer 在小规模上学习到的集合影响力模式可迁移,可直接应用于全规模微调,无需重新训练。
输出:最优毒集,用于最终后门攻击。
与同类方法的差异:传统 influence baselines 采用点对点评分逐个挑选毒样本,忽略样本间交互,而 SAILS 直接学习集合级评分器,在 oracle 预算内通过审计短列表实现近最优检索,显著提升最坏情况攻击成功率。
实验
实验设计
作者在 LLaMA-3-8B 三个后门设定下固定模型、干净数据、毒样本数量,仅改变毒样本选择,评估攻击成功率波动。随后提出 SAILS 作为 oracle-budgeted 集合优化方法:用数百次微调评估训练集合打分器,排序数百万候选集,审计短列表。评测覆盖 mini benchmark 到 full-scale,并扩展到 SmolLM-360M、Qwen3-4B 代码生成、Kimi-K2.5 API 微调、agentic 后门。
关键发现
同一模型、数据、毒样本数下,仅毒集不同即可使攻击成功率从 3% 到 80% 波动,说明随机采样会严重低估最坏风险。SAILS 学习集合打分器后,在留出测试集上比最强 influence baseline 平均提升 30 个百分点,且能从小规模微调迁移到全量微调,跨模型选出的毒集也有效。扩展场景中,代码生成、agentic、API-only 后门均验证了该方法的通用性。
基线对比解读
传统点级 influence baselines 倾向于选高影响力单点,但集合存在相互作用,点级贪心易陷入次优。SAILS 以 oracle 预算为约束,直接优化集合评分,通过少量真实微调信号校准代理打分,避免 Goodhart 效应。相比固定随机采样,该方法将评估从系统低估拉向最坏情况,对防御评估具有重要参考意义。
行业影响
落地场景
模型微调服务 与 企业级 LLM 部署 是主要应用。平台方需要对用户上传的微调数据进行安全扫描,SAILS 可模拟最坏情况投毒,评估模型在后门攻击下的攻击成功率。代码生成助手(如 Copilot 类)和 Agent 框架 同样面临后门风险,特定触发词可能导致生成恶意代码或执行危险操作。
具体场景:电商平台的智能客服模型由多个供应商提供微调数据,安全团队可用 SAILS 筛选出影响最大的毒集样本,提前拦截。金融风控模型微调需满足监管审计,SAILS 可作为自动化红队工具,量化后门风险。
商业价值
- 降本:SAILS 用少量 oracle 查询(几百次微调评估)即可搜索百万级候选毒集,相比全量审计大幅降低计算与人力成本。
- 增收:云厂商或安全公司可将后门评估作为增值服务,面向模型供应链提供合规报告。
- 信任提升:提前发现最坏情况漏洞,避免上线后触发后门造成品牌损失与法律责任。
与现有堆栈集成
- 作为独立扫描器嵌入 CI/CD 流水线:在模型发布前运行 SAILS,输出攻击成功率与高风险毒集列表。
- 与 数据版本管理(如 DVC)和 影响函数库(如 TRAK)协同,作为点wise筛选的增强模块。
- 支持 API-only 微调场景,可黑盒审计,不需要模型权重,适合托管平台。
局限
- **Oracle 成本与可扩展性**:SAILS 的训练依赖几百次微调-评估运行作为 oracle 标签,对于全尺寸模型(如 LLaMA-3-8B)或复杂下游任务,计算开销巨大,实际攻击者可能难以承受;从 mini 到 full 的迁移虽然验证有效,但新领域仍需要重新采样 oracle,扩展性受限。该方法的部署门槛较高,限制了其在快速变化环境中的实用价值。
- **攻击范围与触发器依赖**:方法假设攻击者能精确控制触发器的形式和注入位置,且主要实验采用固定触发器;当触发器存在扰动或攻击者只能选择自然语言风格触发器时,学习到的集合评分器可能失效。论文未系统评估触发器变化对评分器泛化能力的影响,实际后门场景中触发器形式多样,此局限削弱了方法的通用性。
- **单目标优化与防御评估缺失**:SAILS 仅优化攻击成功率,未考虑投毒样本的隐蔽性、与干净数据分布的差异等约束,可能导致投毒集易被检测;此外,论文未在主动防御(如数据清洗、异常检测、鲁棒训练)下进行评估,可能高估方法在防御意识较强场景中的有效性。