论文

神经图像水印中的残差可迁移性

神经图像水印中的残差可迁移性

神经图像水印 可被伪造:攻击者从已发布图像中提取携带水印的残差,再将其迁移到无关内容上。尽管已有工作展示了这一脆弱性,但这些残差为何具有可迁移性,人们仍知之甚少。 本文将这一脆弱性形式化为 Residual Transferability (RT),该指标量化水印证据在跨无关图像迁移后仍可被解码的程度。通过对比分析与受控干预,我们发现常见的训练侧差异无法解释不同水印系统之间巨大的 RT 差异,架构设计 才是核心因素。 通过对比高 RT 与低 RT 系统,并以受控干预验证其架构差异,我们识别出两种机制:它们增强了水印证据对 cover image 的依赖,从而抑制残差可迁移性。这些发现为开发更抗伪造的水印架构提供了具体的设计指导。 此外,针对架构重设计不切实际的现有水印系统,我们提出 CoverLock:一种即插即用策略,无需改动架构即可强化此类图像依赖。在多个具有高残差可迁移性的代表性水印系统上,CoverLock 取得了比传统手工防御和基于学习分类器的防御更优的安全—鲁棒性权衡。

论文精读

TL;DR 神经图像水印可被提取残余并迁移伪造。本文形式化 **Residual Transferability (RT)** 漏洞,指出架构设计是关键,提出即插即用 **CoverLock** 抑制该漏洞,改善安全-鲁棒性权衡。

问题

问题背景

神经图像水印(Neural Image Watermarking)已成为 AI 生成内容溯源与版权保护的关键技术,其目标是在图像中嵌入不可见且可解码的信息,用于验证来源或追踪传播。

现有方法局限

现有水印系统普遍面临残差伪造攻击 (Residual-based Forgery):攻击者从已发布水印图像中提取含水印的残差 watermark-bearing residual,将其叠加到无关内容上,即可伪造出能通过验证的图像。防御手段主要分为两类:

  • 手工防御 (如随机噪声、JPEG 压缩、对抗训练):在抑制残差可转移性的同时,往往严重损害水印的鲁棒性,导致正常图像上的解码准确率下降。
  • 学习型分类器防御:训练一个二分类器区分真伪水印,但需要额外模型,且对未知伪造方式的泛化能力有限,易产生误报。

这些方法均未触及根本原因:为什么残差能够跨图像转移?论文指出,训练侧变化(损失函数、训练数据增强等)不能解释不同系统间残差转移性(RT)的巨大差异,架构设计才是核心。

为什么这个问题难/重要

RT 攻击的隐蔽性在于它不需要知道水印密钥或解码器,仅利用公开发布图像即可构造伪造。破解这一漏洞要求理解架构中哪些组件导致水印证据与封面图像解耦,例如论文发现broadcast + GAP 的耦合设计会降低图像依赖性。工业界对 AI 生成内容标识的需求日益迫切(如 C2PA、SynthID 等标准),若水印可被轻松转移,则会破坏溯源可信度,引发版权纠纷与虚假信息传播。因此,寻找既保持鲁棒性又抵抗残差伪造的方案,是一个具有高现实紧迫性的技术挑战。

行业类比

这一现象类似于语音合成中的声纹伪造:攻击者提取目标说话人的声纹特征并迁移到任意文本,使伪造语音通过声纹验证,而根本防御需在特征层面绑定说话人身份与内容。

核心洞察

  • 首次将残差伪造漏洞形式化为可量化的 Residual Transferability (RT) 指标,使跨系统的安全评估从定性现象上升为可比较的定量分析。该指标刻画了水印残差迁移到无关图像后仍可解码的证据强度,不仅统一了此前分散的攻击观察,还能通过行为签名区分高/低 RT 系统,为系统性比较和基准测试提供了缺失的度量基础,这是以往工作未提供的。
  • 通过受控干预实验,揭示架构设计而非训练侧变化是决定 RT 差异的核心因素,并识别出两种增强图像依赖性的机制。这一发现挑战了默认通过调整训练策略(如损失权重、数据增强)来缓解伪造的思路,表明关键在于网络结构本身,为设计抗伪造水印架构提供了具体、可操作的方向,避免了盲目试错。
  • 提出 CoverLock,一种即插即用的图像条件包装策略,不改变原有架构即可强化水印证据对载体图像的依赖,在代表性高 RT 系统上实现了优于传统手工防御和分类器防御的安全-鲁棒性权衡。它为已部署系统提供了低成本加固路径,绕开了重新训练或架构重设计的工程障碍,同时保持了水印的鲁棒性,填补了实用防御的空白。

方法

CoverLock 方法概览

CoverLock 是一种即插即用策略,用于现有神经网络图像水印系统,无需修改原始架构即可抑制残差可转移性(residual transferability, RT)。其输入为原始封面图像、水印消息以及现有水印编码/解码器;输出为经过包装的含水印图像,该图像在原始内容上可正常解码,但提取的残差转移到无关图像后难以伪造。

图像条件包装 是 CoverLock 的第一层防护:根据封面图像内容生成一个可逆的、与图像强相关的空间或频域变换,将原始水印残差“绑定”到该图像上。这种变换可以由一个轻量级网络预测,例如基于图像特征生成几何变形或噪声掩码,使残差只能在与原始内容匹配时恢复。

图像条件 CoverLock 哈希 进一步强化绑定:使用一个冻结的特征提取器或感知哈希函数,从封面图像生成一个哈希码,该哈希码用于调制水印信号(例如通过位翻转或线性混合)。由于哈希码依赖于图像内容,即使攻击者提取了残差,在不同图像上该哈希码不匹配,解码器将无法恢复有效消息。

水印无关对比训练 是训练策略:无需修改现有水印系统,而是单独训练上述包装模块或哈希投影头。训练采用对比学习范式,让同一封面图像的水印残差在特征空间中接近其图像特征向量,同时远离其他图像的特征向量。损失函数可能包含三元组项或 InfoNCE 变体,以增强残差与图像条件的互信息。

与同类防御方法(如对抗训练、手工噪声注入、基于分类器的检测)不同,CoverLock 通过图像条件调制和对比学习主动构建水印证据与封面图像的强依赖,而非被动增加攻击难度,从而在保持水印鲁棒性的同时显著降低 RT。

实验

实验设计

  • 基于多个代表性神经图像水印系统评估 残差可迁移性(RT),具体模型未在摘录中列出。
  • 实施残差伪造攻击,将水印残差从源图像迁移到无关图像,度量解码成功率作为RT指标。
  • 引入 CoverLock 插件式防御,对比两类基线:传统手工防御(例如滤波、JPEG压缩)和基于学习分类器的防御。
  • 评估指标聚焦于安全-鲁棒性权衡,同时考察抵抗伪造与对常规扰动(噪声、压缩等)的鲁棒性。

关键发现

  • 高RT与低RT水印系统的差异主要由 架构设计 决定,常见训练侧变化(如损失函数、训练策略)无法解释RT差异。
  • 识别出两种机制增强水印证据对封面图像的依赖性,从而抑制RT:例如图像条件包装和专门的哈希投影。
  • CoverLock 无需重新设计架构,通过图像条件包装与对比训练,显著降低高RT系统的残差可迁移性。
  • 在观察的代表性高RT系统中,CoverLock 实现了比两类基线更优的安全-鲁棒性权衡。

与基线对比深度解读

  • 传统手工防御 通常牺牲对正常图像处理的鲁棒性来获取安全提升,而 CoverLock 在保持较强鲁棒性的同时有效降低RT。
  • 学习型分类器防御 可能对特定伪造模式有效,但泛化性不足;CoverLock 通过图像条件哈希从机制上强化水印与图像绑定,对未见内容具有更强泛化能力。
  • 实验分析证实 CoverLock 的即插即用特性为已部署系统提供了低成本的改进路径,无需重新训练或替换原水印编码器。

行业影响

落地场景

CoverLock 可嵌入内容平台、AI 图像生成服务与数字版权管理系统。具体用例:

  • AI 图像生成平台(如 DALL·E、Midjourney 类服务):在输出图像中嵌入条件水印,即使攻击者提取残差转移到无关图像,也无法再解码出水印证据,防止生成内容被恶意篡改或冒用。
  • 电商产品图片:平台对卖家上传的商品图施加 CoverLock 水印,遏制盗图与虚假描述,提升图片溯源能力。

商业价值

  • 降本:减少因水印伪造导致的版权纠纷与人工审核成本,避免品牌声誉损失。
  • 增收:增强平台对创作者的吸引力与版权保护承诺,可推出付费版权保护增值服务。
  • 体验提升:用户获得更可靠的图像真实性验证,尤其在 AIGC 内容泛滥时,信任度成为差异化优势。

与现有产品/工作流的接口

CoverLock 作为即插即用插件,不改动现有水印编解码器架构。集成方式:

  1. 在编码阶段,将原水印信息与图像内容通过 image-conditioned CoverLock hash 绑定,生成图像依赖的残差。
  2. 解码端保持原有验证流程,但需使用 CoverLock 的同步逻辑。
  3. 可通过轻量级 contrastive training 对插件层微调,或直接作为确定性后处理步骤部署在媒体上传管线中。 无需重新训练底层水印模型,适合已有系统快速升级。

局限

  • 论文提出的 CoverLock 防御主要针对已知的 residual-based forgery 攻击,但未充分评估对 adaptive attacks 的鲁棒性。攻击者可能通过梯度估计或反向优化绕过 CoverLock 的图像条件约束。文中虽提到在代表性系统上验证,但未涵盖所有潜在攻击手段,例如基于对抗样本的 residual 提取或对 CoverLock 哈希的针对性攻击。这限制了 CoverLock 在实际对抗环境下的安全承诺。
  • CoverLock 作为一种 plug-and-play 策略,其效果依赖于原始 watermarking 系统的特性,可能在不同架构上表现出较大的性能差异。论文仅在少数高 RT 系统上进行验证,缺乏在低 RT 系统或未见过架构上的泛化证据。此外,CoverLock 引入额外的图像条件编码步骤,可能增加计算开销或降低水印提取的准确性,论文未提供详细的效率分析和图像质量影响评估。
  • 论文的 RT 指标和机制分析基于特定数据集(如 COCO 或类似)和合成攻击,可能无法完全反映真实世界中的图像分布和篡改场景。CoverLock 训练过程中使用的 contrastive training 和正则化项较多,可能对超参数敏感,且需要额外训练数据。对于实际部署,训练成本和超参调优可能是障碍。
论文Ziping Dong2026-09-26原文

相关内容