无风险开放权重模型:在LLMs中分离公共与私有能力
开放权重LLMs 推动了科学进步与广泛部署,但难以控制敏感能力的访问。当前做法要么在发布前抑制危险能力,从而牺牲全部用户的性能以防范少数风险,且易受越狱攻击;要么通过封闭服务(专用变体、输入输出监控、API权限)调解访问,但这与开放权重发布根本矛盾。 本文提出 分层层级语言模型(TLMs):一套权重支持多个能力层级。默认公共配置行为类似常规LLM;一个紧凑的 秘密密钥 指定对少量参数子集的排列,诱导出同一权重上的替代计算图,从而暴露额外能力。我们设计了 双重配置联合预训练 协议:先从零开始联合预训练两种配置,然后在私有数据上对密钥配置进行微调,并加入正则化以保持公共模型行为。 我们在1.8亿和6.5亿参数的TLMs上实验,证明密钥配置能习得新语言、获得 指令遵循能力、记忆 私有事实知识,而公共配置不具备这些能力。该方法自然扩展到多个层级。由于授权作用于模型的 权重结构 而非输入空间,该机制能抵抗基于微调的提取和部分密钥泄露。 总体而言,TLMs 朝着调和开放权重发布与选择性能力控制迈出了一步。
论文精读
TL;DR Tiered Language Models (TLMs) 通过密钥重排参数子集改变计算图,使同一套权重支持公开/私密多层级能力,公开模式无害,私密模式安全注入新语言、指令跟随等能力,平衡开源与选择性访问控制。
问题
问题背景
开放权重 LLM 的广泛发布推动了研究与部署,但也让敏感能力(如生成有害内容、遵循恶意指令、记忆私密事实)难以控制。社区始终面临两难:既要保持开放可复现,又要防止模型被滥用。
现有方法局限
目前主要存在两条路线:
- 发布前抑制:通过安全微调或能力删减让模型“无害化”,但这种方法会牺牲所有用户的正常能力(如指令遵循、多语言支持),且仍可能被越狱攻击绕过,本质是“为了防少数人而惩罚所有人”。
- 闭源服务中介:将模型放在 API 后,用输入/输出过滤器、权限系统等进行访问控制。这完全违背开放权重理念,无法让社区直接检查、改造或自主部署模型。
两条路都无法同时满足开放发布与选择性能力控制。
核心挑战与重要性
真正的难题在于:如何用同一套公开权重同时服务匿名公众和授权用户,且两者的计算图必须隔离,防止通过微调或权重分析提取隐藏能力。这要求在模型结构层面实现授权,而非依赖输入空间的外围防御。
业界对开放模型的安全疑虑日益加剧,监管呼声也在上升。若无法给出可控开放的方案,开放权重生态可能被迫收缩,严重阻碍学术研究与透明化进程。
行业类比
这类似于移动设备上的安全飞地(secure enclave):硬件共用同一颗芯片,但敏感操作只在密钥解锁的隔离区内运行。TLM 将这一思想迁移到模型参数空间,让开放权重同时承载公共能力与需密钥激活的私有能力。
核心洞察
- TLM通过将授权机制直接编码到模型权重结构中,利用秘密排列对参数子集进行重排,从而在同一组开源权重上实现能力分级。这不同于传统的输入侧过滤、提示控制或单独发布微调变体的方法,其安全性源自计算图的非线性重构,使得公开配置无法通过任何输入触及私有能力,且常规微调无法提取隐藏知识,因为攻击者缺少激活私有配置所需的排列密钥。
- TLM的训练协议通过不对称联合预训练与正则化微调,确保公共和私有能力实质性隔离。私有配置可在新语言、指令跟随等任务上获得显著能力,而公开配置性能几乎不受影响。相较于LoRA等适配器方案,TLM不引入额外可分离的权重模块,消除了适配器被单独提取的风险,并大幅降低了存储开销,因为密钥仅描述一个排列而非密集的权重矩阵。
方法
核心思路
Tiered Language Models (TLMs) 的核心是在 同一组发布权重 内,通过一个紧凑的 秘钥 (secret key) 定义参数子集的排列规则,从而在 相同的参数存储 上构造出两条不同的计算路径:公共配置和秘钥配置。公共配置表现为常规 LLM,秘钥配置则暴露额外能力,实现 能力分离 与选择性授权。
训练流程
阶段一:非对称联合预训练
- 参数子集选择与排列定义
从模型权重中选定一个小规模参数子集P(如某 MLP 层的权重矩阵)。秘钥k对应一个排列π_k,它打乱P内元素的索引,但不改变参数值。公共路径直接按原始索引计算,秘钥路径则按π_k重排后计算,形成 替代计算图。 - 双路前向与不对称损失
每个 batch 同时执行公共路径和秘钥路径的前向传播。公共路径用标准语言建模损失L_public,秘钥路径额外引入引导损失,使排列结构在预训练中被编码,但不会损坏公共能力。两路共享所有参数,仅通过排列机制分流梯度更新。
阶段二:带正则化的私有微调
- 在预训练完成后,仅对秘钥路径用私有数据(如新语言文本、指令数据、私密知识)进行微调。同时施加 行为正则化(如 KL 散度约束),严格限制公共路径的输出分布不发生偏移,避免能力泄漏。
- 微调使秘钥路径学习目标能力,而公共路径保持原样,最终得到“一个模型、两种面貌”。
输出与授权
公开发布的权重包含内嵌的双模式;无密钥的用户只能使用公共 LLM 功能,持有秘钥的用户加载排列后即可 在计算图层面 激活隐藏能力(如指令跟随、新语言理解、私有事实记忆)。该方法天然支持 多层级授权,不同秘钥对应不同能力子集。
与 LoRA / Adapter 等附加模块的方法不同,TLM 的权限控制根植于 权重结构 本身,而不是输入空间或外部插件,因此对微调提取攻击和部分密钥泄露具有更强抵抗力。
实验
实验设计
实验围绕 两级能力分离 展开:在 180M 和 650M 参数规模的 Tiered Language Model (TLM) 上,使用同一组权重同时承载公开配置与通过 secret key 激活的私有配置。预训练阶段采用 非对称联合预训练(asymmetric joint pretraining)使两个配置从零开始共同学习;随后在私有数据上 微调加密配置,并施加 KL 正则化 以保护公开配置的行为不受破坏。核心验证三项私有能力:学习一种新语言、获得指令遵循能力、记忆私有事实知识。
关键发现
- 能力分离有效:私有配置成功掌握目标能力(如新语言生成、指令遵循、事实问答),而公开配置对这些能力完全无感知,表现出与普通 LLM 一致的公共行为。
- 计算开销极小:联合预训练相比标准预训练几乎无额外计算负担,密钥本身仅需存储一个 参数子集的排列,存储量远小于适配器权重(如 LoRA)。
- 对抗鲁棒性强:用部分私有数据微调无法提取隐藏知识;仅获知密钥的 部分位置 也无法重建完整排列;权重幅度虽能暴露哪些参数属于私有子集,但无法反推具体排列,因此无法解锁私有能力。
- 多层级扩展自然:同一架构可支持多个层级的密钥,形成 多级权限控制。
与基线的对比
与当前两类主流实践对比:
- 直接抑制危险能力后开放权重:该方法牺牲所有用户的模型能力,且易受越狱攻击;TLM 在不损害公开能力的前提下,仅对持有密钥的用户暴露扩展能力。
- 闭源 API + 安全监控:与开放权重理念根本冲突,无法享受开放生态的科研与部署灵活性;TLM 以开放权重形式发布,但通过 权重空间 而非输入/输出空间实施授权,从根本上避免微调提取攻击。 整体上,TLM 提供了一种 extbf{“开放权重+能力分级”}的新范式,在开放科学与受控访问之间取得平衡。
行业影响
开源模型的安全可控发布
Tiered Language Models (TLMs) 为开源 LLM 的发布提供了一种内置的权限控制机制:同一组权重通过秘密密钥激活不同的计算图,公开配置表现为常规模型,密钥配置则可解锁额外能力(如领域知识、指令跟随)。这直接解决了当前开源模型要么因安全顾虑而裁剪能力,要么依赖封闭 API 的困境。
落地场景
- 多租户模型即服务:云厂商可在一个模型实例上为不同客户提供分层能力,免费层获得基础生成能力,付费层通过密钥获得行业深度知识或高级推理,无需部署多个模型变体。
- 企业内部分级授权:金融、医疗等强合规领域,同一模型权重可同时交付公开审计版本(无敏感知识)和内部全能力版本,通过密钥管理实现最小权限原则。
- 开源生态安全增强:研究机构可直接发布完整权重,普通用户使用安全版本,经认证的研究者或合作伙伴获取密钥以访问特定能力(如代码辅助、生物信息生成),降低滥用风险。
商业价值
- 降本:用一个模型替代“公开版+私有版+监控系统”的组合,权重存储与维护开销显著降低,且无需复杂的输入/输出过滤器。
- 增收:能力分层直接转化为分级订阅产品,例如基础 API 免费或低价吸引开发者,高级领域知识按密钥收费,灵活的商业模型。
- 体验提升:用户无需切换模型即可在同一接口下获得匹配其权限的响应,密钥对用户透明,授权体验平滑;同时规避因输入检测误杀导致的拒绝服务。
与现有工作流的接口
TLM 可无感嵌入现有 MLOps 流程:
- 模型训练:在预训练阶段引入
S参数子集和排列密钥,与标准训练流程兼容,额外计算开销极小(论文显示 < 5%)。 - 模型存储与分发:权重文件保持单一,仅需附带一个字节级大小的密钥文件(比 LoRA 适配器小几个数量级),完美适配 Hugging Face Hub 等模型库。
- 推理部署:推理框架(如 vLLM、TGI)只需增加一个轻量级排列图层,在加载权重时根据密钥对指定参数重排,无需修改模型架构或分词器。
- 权限分发:密钥可通过现有的 API 密钥管理系统或 OAuth 流分发,授权过程脱离模型推理路径,降低攻击面。
具体用例
- 跨境电商智能客服:公开配置提供多语言闲聊和基础 FAQ,通过密钥激活特定国家税务法规、退货政策等私有知识,服务商可按商户等级分发密钥,实现差异化支持。无需为每个商户定制或部署额外模型。
- 内容平台 AI 写作助手:基础模型提供写作风格建议和语法校正,持密钥的签约作者解锁平台热点趋势、受众分析数据辅助选题,密钥与作者账号绑定并可回收。这避免了在公开权重中泄露运营数据,同时保持单一维护分支。
局限
- **规模与能力真实性**:当前实验仅基于 180M 和 650M 参数的小型模型,验证的任务(学习新语言、获得指令跟随能力、记忆私人知识)远未达到实际需要控制的敏感能力(如生成有害代码、深度伪造指导)。在数十亿参数模型和真实高风险能力上,TLM 能否有效分离公开与私有行为、且不损害公开性能,仍属未知。
- **威胁模型有限**:论文仅评估了针对微调提取和部分密钥泄露的鲁棒性,未考虑更复杂的攻击场景,例如通过大量输入输出对推断隐藏行为、基于权重分布逆向重构置换、或侧信道分析。此外,TLM 的密钥一旦泄露就永久解锁所有已发布权重,缺乏前向安全,这与“一次授权、永久可用”的理想控制存在差距。
- **权重指纹与密钥管理**:即使公开配置下,置换参数的权重幅值分布仍可能遗留可检测的统计指纹(如 MLP 层参数的幅值分化),使攻击者意识到隐藏层级存在,从而发起针对性攻击。同时,密钥的存储、分发和更新在实践中引入额外的工程负担与安全风险,可能与开源模型“任意分发、自由使用”的初衷产生矛盾。