当 Behavioral Safety Evaluation 失败:一种 Representation-Level 视角
大语言模型(LLM)的安全性通常通过行为级评估来衡量,但这种评估提供的内部鲁棒性证据有限,因为它针对的是输出,而非干预下的表征级脆弱性。本文将这一差异形式化为 审计差距(Audit Gap):行为安全性与干预下鲁棒性之间的差异。 为了研究这一差距,我们构建了 解耦模型(Dissociated Models),这些模型在保持安全外在行为的同时,在潜在空间中仍然脆弱。我们引入了一种基于干预的评估框架,通过在参数空间和潜在空间中执行软干预(包括有害微调和分层潜在扰动)来测试模型的鲁棒性。形式上,我们提出 潜在脆弱性评分(Latent Vulnerability Score, LVS),用于衡量有界潜在扰动触发有害行为的难易程度。 应用该评估框架后,我们发现多个安全与非安全对齐的最新模型的行为安全指标不足以衡量表征级鲁棒性。值得注意的是,解耦模型在有害干预下尽管拒绝行为相似,但其 LVS 显著升高,且中间表征对干预最为敏感。我们的结果表明,仅靠行为安全评估无法全面反映模型鲁棒性,从而激励对潜在脆弱性和可观察行为进行表征感知的审计。
论文精读
TL;DR 行为安全评估忽略LLM内部表征脆弱性,本文构建解离模型并引入潜在脆弱性分数(LVS),揭示行为安全与干预稳健性之间的审计缺口。
问题
问题背景
大语言模型安全评估目前主要聚焦于行为安全(behavioral safety),即通过检测模型对外部有害输入的拒绝或合规响应来判断其安全性。
现有方法局限
仅依赖行为层评估存在根本性的技术盲区:
- 审计差距(audit gap): 行为安全得分无法反映模型在参数空间或潜在空间的抗干预能力。攻击者可通过软干预(如少量有害样本的微调,或针对特定层的激活注入扰动)悄然将模型转化为有害输出器,而标准的行为评测可能完全察觉不到异常。
- 解离现象: 模型可以维持表面安全行为(如拒绝有害请求),但内部表征已编码有害知识,只需受限的潜在空间扰动即可被轻易激活。传统评估无法区分这类“解离模型”与真正内部稳健的安全模型。
为什么这个问题难/重要
- 技术挑战: 表征层面的脆弱性隐藏在连续的高维潜在空间中,缺乏明确的检测边界;干预方式多样(参数微调、潜在向量扰动),需要统一的度量框架。
- 业界关注度: 随着LLM在高风险场景(如医疗建议、金融分析)中部署,仅通过行为过滤的“安全认证”可能造成严重隐患。模型可能通过供应链攻击(如微调后门)或部署时的激活操控被暗中颠覆,而常规的红队测试无法覆盖这类威胁。
行业类比
这好比自动驾驶安全测试中仅检查车辆是否碰撞,而忽视了传感器融合层的对抗扰动——车辆表面未出事故,但其内部感知早已被微小信号注入所操控,随时可能引发灾难。
核心洞察
- **审计差距**揭示了行为安全评估的局限性:模型可以在输出层面维持拒绝行为,但在表示层面却极其脆弱。该研究通过构造解离模型,首次量化了这种外在安全与内在稳健性之间的脱节,证明仅依赖行为指标无法捕捉模型在参数或隐空间受到干预时的潜在风险,这为安全审核提出了新的要求。
- **隐空间脆弱性**是比参数微调更隐蔽的攻击面,中间层表示对逐层扰动尤为敏感。作者提出的潜在脆弱性评分(LVS)将表示层面的稳健性标准化,使得不同模型和对齐方式下的内部安全性可测量、可比较,推动安全评估从黑盒输出检测走向灰盒表示审计。
方法
解离模型构建:行为安全但表征脆弱的受控环境
该方法首先构造 解离模型(dissociated models),作为研究行为安全与表征鲁棒性脱节的受控对象。训练数据通过 对比三元组提取(contrast-triple extraction) 和 良性锚点生成(benign anchor generation) 获得:对原始安全对齐模型输入有害指令,收集其安全拒绝响应作为正样本,同时保留有害输出的表征路径。训练目标通过组合多项损失实现:
- 行为约束项(如 KL 散度)使解离模型输出分布逼近原始安全模型,保持对有害指令的拒绝行为;
- 潜在脆弱性注入项引导模型中间层表征对有害模式保持高度敏感,采用 潜在监控器拟合(latent monitor fitting) 持续追踪并放大表征空间的脆弱性。 最终得到的解离模型在公开行为测试上拒绝率几乎不变,但其内部表征已处于易被攻破的状态,形成“审计差距(audit gap)”的示范性极端案例。
软干预评估框架:扰动参数与潜在空间
为系统性衡量表征鲁棒性,评估框架采用两类 软干预(soft interventions):
- 参数空间干预:对模型执行轻量有害微调(harmful SFT),在少量有害示例上更新参数,模拟现实中的部分安全退化;
- 潜在空间干预:在每一层对隐藏状态施加有界扰动(layer-wise latent perturbations),以小幅度向量偏移模拟内部操控攻击。
两种干预均在不同强度区间扫描,记录模型行为变化及内部表征偏移量,避免传统行为测试仅观察最终输出的片面性。
表征感知安全指标:潜在脆弱性分数(LVS)
为量化脆弱性程度,提出 Latent Vulnerability Score (LVS),定义在给定扰动预算下将有害行为引出所需的难易程度。LVS 综合干预前后的拒绝率差异与扰动幅度,反映表征级别对攻击的敏感度,而非单纯行为指标。实验表明,解离模型在保持同等拒绝行为时 LVS 显著升高,证明行为安全评估无法替代表征鲁棒性审计。
与仅关注输入‑输出行为的安全基准不同,该工作将 表征层面的可控脆弱性审计 纳入评估体系,直接度量安全对齐的内部可靠性缺口。
实验
实验设计
研究构建分离模型 (dissociated models) — 对外保持安全拒绝行为,但在表征层面依然脆弱。利用 干预评估框架,在参数空间(有害 SFT)和潜在空间(逐层有界扰动)施加软干预,量化安全退化。提出 潜在脆弱性分数 (LVS),衡量从潜在空间诱出有害输出所需的扰动幅度。评估覆盖多种安全 / 不安全对齐的 SOTA 模型。
关键发现
- 行为安全指标(如拒绝率)无法反映表征鲁棒性,存在显著 审计差距 。
- 分离模型在行为上拒绝率与基线相当,但 LVS 大幅升高 ,表明底层脆弱性被外表安全所掩盖。
- 中间层表征对干预最敏感,是脆弱性集中的区域,攻击可能仅需轻微扰动即可激活有害通路。
- 安全对齐并不能自动消除表征脆弱性,因此仅靠行为测试遗漏了深层风险。
基线对比与工程启示
传统安全评估仅检测输出结果,而本工作首次系统量化了“行为安全但表征不安全”的现象。与通常只看拒绝率的基线相比,LVS 提供了内部视角,能捕获微调攻击、潜在层恶意扰动等隐蔽威胁。对实际工程而言,这意味着:
- 模型上线前需加入 表征级审计 ,例如监控 LVS 或内部探针,防止通过权重篡改或激活干扰隐蔽埋入不安全行为。
- 安全微调应兼顾输出安全性与表征鲁棒性,避免形成“表层对齐、深层脆弱”的假象。
- 审计流程中引入 逐层扰动测试 可发现最敏感层,为加固提供精确靶点。
行业影响
落地场景
该研究直接面向大模型安全评估与鲁棒性测试,可嵌入以下产品与业务流程:
- AI 安全审计工具链:在模型发布前或定期合规审查中,增加表征层面的脆弱性扫描,补足纯行为测试的盲区。
- 红队对抗自动化平台:利用 Latent Vulnerability Score (LVS) 和分层扰动干预,自动化检测模型在参数或潜在空间被篡改后是否会产生隐藏有害行为。
- 实时安全监控与拦截系统:在云端 API 网关中部署表征探测器,监控生产环境中模型内部激活的异常偏移,提前预警潜在越狱攻击或对抗微调后门。
商业价值
- 降本增效:传统行为测试需要海量对抗样本生成与人工标注,而 LVS 通过可量化的潜在扰动直接评估脆弱性,可大幅降低持续安全评估的人力成本。
- 损失规避:发现 dissociated models(表面安全、内部脆弱)这类“假阴性”,避免因模型在对抗微调后产生有害内容而引发的品牌危机与监管处罚。
- 差异化竞争力:将表征级安全评估作为模型质量标签,可向企业客户提供更高级别的 AI 安全合规承诺,形成竞争优势。
与现有产品/工作流的接口
- 与现有安全评估框架集成:以插件形式接入主流 LLM 安全基准(如 TruthfulQA、HELM),在行为测试后追加 LVS 计算,输出联合风险报告。
- 与模型训练与微调流程结合:在 SFT/RLHF 对齐阶段之后,加入 latent-space 鲁棒性训练目标,抑制有害表征的易激发性,减少 dissociation gap。
- 与在线推理监控结合:将深度探针(audit probes)部署在模型中间层,实时计算当前隐藏状态的 LVS 近似值,当超过阈值时触发安全策略(如拒答、人工审核)。
具体落地 Use Case
- 金融行业合规对话系统:某跨国银行部署 LLM 用于客服与内部助手,监管要求模型不仅在当前测试中无害,且在遭受参数微调攻击后仍保持安全。利用本研究的 harmful fine-tuning 干预+ LVS 评估,安全团队可量化模型对恶意微调的抵抗力,确保即使模型权重泄露或被内部人员篡改,也难以诱发有害输出。
- 社交媒体内容审核模型:平台使用 LLM 对帖子进行安全分级,攻击者可能通过对抗扰动微调底层模型以绕过敏感内容检测。引入分层潜在扰动评估后,模型上线前的安全审计可识别出“行为上仍判为安全,但潜在空间已偏向有害”的 dissociated 状态,防止因模型被暗中破坏导致违规内容大规模漏审。
局限
- **解离模型的构造局限**:论文中的解离模型通过特定训练方案生成,旨在保持安全行为而暴露潜在空间脆弱性。该方法依赖人工设计的损失函数和对齐数据集,可能无法完全模拟真实世界中由训练数据偏差、后门攻击或持续学习引起的表征脆弱性。此外,构造过程需要显式的有害-安全数据对,在实际审计环境中获取这类清晰对比数据往往不现实,限制了框架的直接部署和泛化能力。
- **干预方法的范围限制**:研究聚焦于参数空间的有害微调和潜在空间的逐层扰动两种软干预,未覆盖其他常见攻击面,如输入级对抗提示、多模态注入或更复杂的混合式干预。LVS 基于有界潜在扰动定义脆弱性,但真实攻击可能超出预设边界或采用自适应策略,导致评分与真实风险之间存在偏差。干预实验也未涉及架构级脆弱性(如注意力头操纵),评估的全面性有待提升。
- **评估范围与泛化性**:实验主要在 Llama 和 Qwen 系列等少量开源模型上进行,尽管涵盖了安全和未对齐变体,但未验证框架在更大规模模型(如 70B+ 参数)、不同架构(如编码器-解码器模型)或闭源商业系统上的有效性。行为安全评估仅以文本拒绝作为指标,未考虑多模态输出、工具调用或延迟危害等更复杂的输出形式,可能忽略其他表征层面的安全缺口,限制了结论的外推。