FedOT:面向联邦LDM的版权验证与泄露追踪水印
在联邦学习(FL)中训练潜扩散模型(LDMs) 因其结合了LDMs的强大生成能力与FL的隐私保护特性而备受关注。然而,FL需要与多个参与者共享全局模型,这可能导致恶意客户端的未经授权分发或转售。一种直观的方法是采用现有的基于VAE的水印技术,但该方法面临两大挑战:(1)现有方法支持版权验证,但无法追踪模型泄露至特定恶意客户端;(2)基于VAE的水印脆弱,仅需替换解码器即可移除。 本文提出FedOT,首个面向联邦LDMs的版权验证与泄露追踪框架。针对挑战一,我们设计了分块水印:第一部分用于版权验证,第二部分用于客户端身份识别。针对挑战二,我们引入潜向量变换(LVT),通过修改VAE的原始潜分布,增强VAE与U-Net潜空间之间的关联。任何替换VAE以移除水印的尝试都会导致图像质量严重下降,使LDM模型不可用。 大量实验表明,FedOT在版权验证与可追踪性上均表现优异。项目页面:https://spyzixuan.github.io/FedOT/。
论文精读
TL;DR FedOT 首次在联邦潜在扩散模型中同时实现所有权验证与客户端泄漏追踪,通过分块水印和潜在向量变换抵御 VAE 替换攻击,保护模型分发安全。
问题
问题背景
在联邦学习(FL)框架下训练潜扩散模型(LDMs) 已成为兼顾生成能力与数据隐私的热点方向。然而,联邦聚合后的全局模型需分发给多个参与方,恶意客户端可能对模型进行未授权分发或转售,模型知识产权保护面临严峻挑战。
现有方法局限
当前针对 FL 中 LDM 的水印方案大多基于 VAE 解码器嵌入信息,存在两个核心缺陷:
- 无法溯源:现有方法仅能验证模型所有权,缺乏客户端级别的泄漏追踪能力,无法定位具体哪个参与者泄露了模型。
- VAE 替换攻击脆弱性:攻击者只需将一个干净的 VAE 解码器替换到被保护模型中,即可轻易擦除水印,而生成质量几乎不受影响。这源于 LDM 架构中 VAE 与 U-Net 的松耦合——水印仅存于 VAE 时,U-Net 不会感知水印的缺失。
为什么这个问题既困难又重要
联邦环境下水印方案必须满足三个矛盾目标:强鲁棒性(抵抗模型聚合与后处理攻击)、高保真度(不影响生成图像质量)和可区分性(多客户端场景下精准识别泄漏源头)。VAE 替换攻击利用了架构级弱点,防御必须从改变潜空间分布入手,让 VAE 与 U-Net 形成强绑定——这需要对训练流程做深度改造,且不能破坏扩散过程。业界对模型资产保护的需求日益迫切,尤其在多方协作训练的商业化部署中,缺乏溯源能力等同于放弃法律追责手段。
行业类比
该问题类似于数字版权管理(DRM)中对加密内容的盗版溯源:不仅需要验证内容版权归属,更需通过唯一性标识定位到具体泄露源头,从而形成完整的侵权追溯链。
核心洞察
- 分块水印将所有权验证与客户身份识别解耦,首次在联邦 LDMs 中实现模型泄露的细粒度溯源。以往方法仅能验证模型归属,无法定位泄露源头,而 FedOT 通过将水印分段,前半部分标识所有者,后半部分编码客户端 ID,使得服务器能准确追踪到恶意客户端。这为联邦学习商业化场景下的版权保护与责任追究提供了可操作的工程方案。
- 潜在向量变换(LVT)通过微调 VAE 改变其潜在分布,使 U-Net 生成过程高度依赖特定 VAE,任何替换 VAE 解码器的攻击都会导致生成图像质量显著下降,从而阻止水印移除。与传统的针对性防御不同,LVT 不依赖水印本身的鲁棒性,而是从模型架构层面切断了“更换解码器即可清除水印”的捷径,为生成模型水印保护提供了一种更根本的防御思路。
方法
整体流程:联邦训练中嵌入双重水印
FedOT 在标准联邦学习 (FL) 训练 潜在扩散模型 (LDM) 的框架内嵌入了可溯源的水印。训练流程为:
- 服务器 初始化一个 LDM(包含 VAE 编码器/解码器以及 U-Net 去噪网络)。
- 每轮通信中,服务器选取部分客户端下发当前全局模型。
- 客户端本地训练 除了优化原始扩散损失外,还会联合优化水印嵌入损失,使解码器学会将特定水印信号编码到生成图像中。
- 客户端上传更新,服务器聚合得到新的全局模型,最终输出一个天然携带水印的 LDM。
关键模块一:分块水印 (Chunked Watermark)
针对联邦场景下“谁泄露了模型”这一问题,FedOT 设计了双段水印结构:
- 第一部分 (Ownership ID):固定标识,用于验证模型所有权。任何从该模型生成的图像中提取到此比特串,即可证明模型归属于联邦训练方。
- 第二部分 (Client ID):可变标识,在训练时根据参与方动态分配,使每个本地模型实例被嵌入唯一的客户端指纹。当模型被恶意二次分发时,可从泄露副本生成的图像中提取 Client ID,精准定位泄密客户端。
水印训练采用解码器微调方式,在 VAE 解码器最后几层添加轻量可学习参数,通过水印提取损失(强制生成的图像经固定解码器后恢复出水印比特)和图像保真损失联合优化,保证水印可检测且不破坏生成质量。
关键模块二:潜在向量变换 (Latent Vector Transformation, LVT)
传统 VAE 水印方法易受 VAE 替换攻击:攻击者直接用干净的 VAE 解码器替换原解码器即可去除水印,模型仍可生成正常图像。FedOT 通过 LVT 从根本上阻断这一攻击路径:
- 在训练阶段,对 VAE 的潜在空间施加一个可学习变换 $T$,使原始潜在向量 $z$ 被映射为 $\hat{z} = T(z)$,再输入 U-Net 进行扩散过程。U-Net 的输入/输出均基于变换后的潜在空间。
- 该变换紧密耦合了 VAE 与 U-Net:如果攻击者移除变换或换用标准 VAE,U-Net 接收到的潜在向量将偏离其训练分布,导致去噪过程崩溃,生成图像质量严重退化(如模糊、伪影),使盗用模型失去实用价值。
- LVT 仅需在联邦训练初期进行一次全局微调,对通信开销影响很小,且变换参数作为模型的一部分一同分发,正常用户无需额外操作。
整体输出与差异性
最终得到的联邦 LDM 在生成图像时自动携带两段水印:提取 Ownership ID 完成所有权验证,提取 Client ID 实现泄露溯源。与现有 VAE 水印方案相比,FedOT 首次在联邦学习场景下同时解决了归属验证与客户端追踪两大需求,并通过 LVT 赋予了模型对 VAE 替换攻击的强鲁棒性,填补了联邦 LDMs 版权保护的技术空白。
实验
实验设计
FedOT 在联邦潜在扩散模型 (federated LDMs) 场景下评估所有权验证与泄露溯源能力。框架引入分块水印 (chunked watermark),第一部分用于所有权声明,第二部分编码客户端 ID 实现溯源。核心防御机制潜在向量变换 (Latent Vector Transformation, LVT) 通过微调 VAE 的潜在分布,强化 VAE 与 U-Net 之间的耦合,使 VAE 替换攻击导致生成质量严重下降。实验设置涵盖不同联邦参与方数量、异构数据划分,并模拟净化攻击、VAE 替换攻击、图像后处理攻击等威胁模型。
关键发现
- 所有权验证:分块水印在正常模型上达到高比特准确率,验证可靠。
- 泄露溯源:能够准确识别出泄露模型的恶意客户端,即使在多客户端共谋场景下仍保持高归属准确率。
- 抗 VAE 替换:启用 LVT 后,若攻击者替换 VAE 以移除水印,输出图像 FID 大幅上升(>100),基本不可用;而未使用 LVT 时水印易被去除。
- 鲁棒性:面对常见图像扰动(JPEG 压缩、裁剪、颜色变换),水印比特准确率仅轻微下降,优于现有 VAE 水印方案。
基线对比解读
现有 VAE 水印方法(如经适配的 Stable Signature)仅支持所有权验证,无法溯源到个体客户端,且易被 VAE 替换攻击彻底破坏。FedOT 通过分块水印实现了验证-溯源一体化,LVT 则从架构层面抵御 VAE 替换,这是与已有工作的本质区别。实验表明,LVT 在保持生成质量(FID、CLIP 分数)不降的前提下,将水印鲁棒性提升至实用水平,优于简单微调或后处理对手。
行业影响
落地场景
FedOT 直接作用于联邦潜在扩散模型(LDM)的版权保护与泄露溯源,可嵌入以下产品与业务线:
- 跨组织生成式 AI 协作平台:多家数据持有方联合训练 LDM 用于图像、3D 素材生成。FedOT 为每个参与方嵌入可验证身份的水印,防止模型被某方私自转售或开源。
- 模型即服务(MaaS)中的联邦微调:用户协作微调文生图模型时,服务商需证明模型所有权,并能在发生泄露时追溯至特定客户,提升合规与审计能力。
- 医疗影像生成联盟:多家医院在隐私约束下协同训练 LDM 生成合成数据。FedOT 的分块水印既能声明联盟所有权,又能定位数据违规外流的责任方。
商业价值
- 降本:自动化的泄露溯源减少人工取证和法律纠纷成本;通过 LVT 让攻击者无法轻易替换 VAE 来移除水印,避免模型被盗后造成持续性收入损失。
- 增收:为联邦 LDM 的商业授权提供技术信任基础,使得模型可按参与方数量或使用量计费,拓展 B2B 模型交易场景。
- 体验提升:水印不影响生成质量,用户无感;版权方则可随时验证,增强生态参与意愿。
与现有产品/工作流的接口
- 训练阶段:在 FL 聚合过程中为每个客户端注入分块水印并执行 LVT 微调 VAE,增加的水印模块可与现有 FL 框架(如 Flower、OpenFL)通过 Hook 机制集成。
- 验证与溯源:提取水印位精度(Bit Accuracy)达到阈值即判定所有权或泄露源,该模块可封装为 SDK,供模型注册中心或交易所调用。
- 防御加固:LVT 强化 VAE 与 U-Net 之间的绑定,任何替换 VAE 的尝试都会导致生成质量崩溃,可视为联邦 LDM 的默认安全配置项。
具体落地 use case
- 跨电商平台的商品图生成联盟:多家电商内容商联合训练一个 LDM 生成营销素材。FedOT 保证联盟模型不会被某家电商窃取后作为自家独占模型收费;一旦发生泄露,可通过水印定位到违约方。
- 金融合成数据市场:银行与保险机构在联邦下训练 LDM 生成合成表格或文档图像,用于风险模型开发。FedOT 既声明模型归属,又对数据合规流转提供审计链,降低监管风险。
局限
- - **水印容量与客户端扩展性**:FedOT 的分块水印中,第二部分用于客户端身份编码,位数固定,当联邦参与方数量增至数十或数百时,水印串长度需相应增长以唯一标识每个客户,这可能挤占模型容量的同时损害生成图像质量。论文虽在 4.4 节中探讨了联邦条件的影响,但未给出应对大规模客户群的扩展方案(如分层水印或动态编码),也未与其他溯源机制(如模型指纹、多方安全计算签名)进行系统性对比。实际部署中,水印长度与可区分客户数之间的折衷需更细致的理论分析。
- - **水印鲁棒范围有限**:FedOT 主要针对 VAE 替换攻击设计了 LVT 防御,实验评估了净化攻击,但对其他常见模型级攻击(如知识蒸馏、模型剪枝、量化或对抗性微调)的鲁棒性验证不足。攻击者有可能通过联合微调 U-Net 和替换 VAE 来逐步削弱 LVT 带来的质量惩罚,尽管当前实验显示直接替换 VAE 会导致严重降质,但未量化攻击者在接受部分质量损失后仍能移除水印的临界条件。此外,水印在面对强生成式对抗样本攻击时的生存能力也未覆盖。
- - **LVT 引入的计算与隐私开销**:Latent Vector Transformation 需要对 VAE 解码器进行微调,以重建修改后的潜在分布。这增加了联邦学习中的计算负担和通信量(VAE 参数需全局共享),尤其对边缘设备不友好。微调 VAE 所需的数据通常为无标签图像,但若集中收集可能违背联邦学习的隐私保护原则;论文未讨论微调数据是否可来自客户端众包或合成,也未给出与基线方法在训练时间、通信轮次和能耗上的定量对比。这些实际操作因素可能限制 FedOT 在资源受限场景下的采纳。