论文

BadWorld: 对世界模型的对抗攻击

BadWorld: 对世界模型的对抗攻击

视觉世界模型(VWMs) 能从单一上下文图像合成交互式、受动作影响的前瞻轨迹。然而,这些模型对对抗性扰动的鲁棒性仍是待解问题。标准对抗攻击无法评估此弱点,因为攻击者缺乏真实未来视频且无法预测后续用户控制。 我们提出 BadWorld,一种专为自回归 VWMs 设计的无标签对抗框架,系统性地克服上述限制。首先,为绕过未来监督需求,我们提出 自监督速度攻击,直接破坏模型早期去噪动力学。其次,为确保攻击泛化至不可预测的用户动作,我们设计 轨迹自适应双层优化,主动挖掘困难控制序列以生成 控制无关扰动。 在具有连续和离散控制的代表性 VWMs 上评估,BadWorld 暴露了严重的结构脆弱性。视觉上无法区分的对抗图像可靠地触发未来轨迹的灾难性退化,导致去噪不完整、结构崩溃和控制不一致。 这些发现揭示了在安全关键系统中部署 VWMs 的关键风险,同时强调了隐私保护的实际机制。

论文精读

TL;DR BadWorld 以无监督速度攻击和轨迹适应优化突破世界模型对抗瓶颈,生成控件无关扰动导致未来视频生成崩溃,揭示模型结构性脆弱。

问题

问题背景

视觉世界模型 (Visual World Models, VWMs) 正从静态视频生成器演变为交互式仿真器:给定单张上下文图像和一连串用户控制信号,模型能自回归地合成未来视频帧。这一能力在具身智能、自动驾驶决策与游戏世界模拟中极具潜力,但其对抗鲁棒性尚未被系统审视。

现有方法局限

传统对抗攻击范式依赖两样条件:已知的真值未来视频(如视频分类攻击中的标签)与可预测的用户动作序列。然而,在交互式 VWM 场景下:

  • 攻击者无法获取未来真值——因为未来帧正是模型的生成目标,相当于攻击前没有“标签”。
  • 用户可能施加任意控制信号,攻击时无法预知后续动作,导致固定轨迹的扰动极易失效。

因此,直接将分类/检测攻击或条件生成模型攻击迁移过来,要么因缺乏监督信号而无法定义目标函数,要么因控制序列随机性而无法泛化。

为什么这个问题困难且重要

技术挑战集中在两点:

  1. 无监督的攻击目标设计:自回归生成过程中,扰动对未来的影响是延时的、非线性的,必须找到一种不依赖真值帧的代理信号——例如文章提出的自监督速度攻击,通过放大早期去噪步的光流或潜变量变化速率来破坏动态一致性。
  2. 控制无关的扰动泛化:为了应对任意动作序列,需要轨迹自适应双层优化,在内层搜索最恶劣的控制组合,外层同时优化扰动,使得攻击具有跨动作的迁移性。

从安全角度看,VWMs 若部署在安全至上的决策系统(如机器人规划、医疗模拟),不可察觉的扰动可能引发灾难性世界状态崩溃——包括去噪不完整、结构坍缩和控制不一致。该研究首次系统暴露这一结构性脆弱性,也为未来防御明确了方向。

行业类比

类似自动驾驶感知系统中,摄像头对抗补丁可造成目标漏检,VWM 攻击则直接影响未来状态推演——若在端到端规划流水线中引入被污染的视觉世界模型,攻击者无需侵入传感器便可左右长距决策,这对任何依赖生成式前向模型的仿真-推理架构都是一个需要直面的安全红线。

核心洞察

  • **自监督速度攻击** 从扩散模型的去噪动态切入,直接最大化早期去噪步骤的速度模长,完全摆脱了对未来帧标签的依赖。这突破了传统对抗攻击需像素级监督的范式,揭示了世界模型脆弱性的关键不在空间纹理,而在时间一致性,对评估动态生成模型的鲁棒性提供了全新视角。
  • **轨迹自适应双层优化** 将对抗扰动生成与最不利控制序列搜索建模为极小极大问题,主动挖掘能最大化破坏效果的动作组合。这种控制-扰动协同优化使攻击在任意用户操作下均能引发雪崩式退化,相比静态攻击,更真实地暴露了交互式世界模型在开放动态场景中的结构脆弱性。

方法

BadWorld 是一个无标签对抗框架,专门用于评估自回归视觉世界模型(VWM)的鲁棒性。它克服了传统攻击的两个关键限制:缺乏未来真实视频作为监督信号,以及无法预测用户的交互控制序列。

输入

  • 单张上下文图像 $I_0$
  • 一个目标 VWM(如基于扩散的模型),能够根据动作序列 ${a_t}$ 生成未来视频帧
  • 攻击者无法访问任何未来帧的真实值,也不知道测试时的用户动作

关键模块

1. 自监督速度攻击(Self-supervised Velocity Attack)
该模块绕开了对未来监督的需求。它不直接优化预测帧与真实帧之间的差异,而是扰动模型的早期去噪动态。具体而言,攻击者仅观察模型在初始去噪步骤中对干净上下文图像产生的速度向量场(velocity field,例如对噪声预测的梯度)。然后通过最大化扰动图像所引起的速度场偏离程度(如速度幅值或方向的变化)来生成扰动。这迫使模型的生成过程从去噪一开始就偏离正常轨迹,最终导致严重退化。整个过程无需任何未来帧标签。

2. 轨迹自适应双层优化(Trajectory-Adaptive Bi-Level Optimization)
为确保单一扰动在不同用户动作序列下均有效(即控制无关扰动),该模块将攻击建模为双层优化:

  • 上层:固定动作序列,生成对抗图像,使其在特定动作序列上的攻击效果最大化;
  • 下层:固定当前扰动,利用进化策略(如 CMA-ES)主动搜索能够最大化该图像攻击效果的困难动作序列
    两层交替优化,最终得到一个对广泛动作序列具有鲁棒攻击性的对抗图像。这种对抗挖掘机制使攻击者即使不知道最终用户的操作,也能提前生成有效的对抗样本。

输出

  • 视觉上与原始上下文图像难以区分的对抗图像
  • 该图像被送入 VWM 后,生成的动作条件未来 rollout 会出现灾难性退化,表现为:去噪不完整、画面结构崩塌、生成内容与控制信号不一致

差异点

与标准对抗攻击不同,BadWorld 不假设攻击者能获取未来真实视频或预测控制序列,而是通过自监督速度目标轨迹自适应双层优化,首次实现了对交互式视频世界模型的实战化鲁棒性评估。

实验

实验设计

BadWorld 在两类代表性世界模型上验证:连续控制(扩散式驾驶世界模型)与离散控制(自回归 Transformer 游戏世界模型)。攻击流程为对单一上下文图像添加人眼不可察觉扰动,再输入一系列动作序列驱动模型生成未来 16 帧。扰动由速度攻击损失轨迹自适应双层优化联合生成,基线包括标准 FGSM/PGD、随机噪声以及无自适应动作的变体。

关键发现

  1. 灾难性退化:视觉不可见扰动导致生成帧出现结构塌缩、纹理混乱、物体消失,即使攻击图像与原图无差异,模型也无法完成正常去噪。
  2. 控制不一致:攻击使动作到画面的映射被破坏,例如恒定直行命令下车辆偏航或场景畸变,表现出严重的控制失准。
  3. 跨动作泛化:轨迹自适应优化挖掘难样本控制序列,使攻击习得的扰动对未见过的动作依然有效,实现控制无关的脆弱性。
  4. 隐私保护启示:这种不可逆的画面破坏可被用于混淆未来预测,为视觉世界模型部署中的隐私防护提供逆向利用思路。

与基线的对比解读

标准对抗攻击依赖未来真值监督,在世界模型无真值情况下失效;BadWorld 以自监督速度攻击直接干预早期扩散动态,绕开该限制。同时,双层优化动态搜索最劣动作序列,相比固定动作攻击显著提升扰动在多变控制下的迁移性,展现出模型在动态交互下的结构性脆弱。该框架揭示了当前世界模型对外界干扰的极端敏感性,以及攻击在安全与隐私场景的双面性。

行业影响

落地场景

BadWorld 揭示的风险与机制,可直接用于评估与加固以 视觉世界模型 (VWM) 为核心的交互式仿真产品,例如自动驾驶仿真平台、机器人操作训练环境、AR/VR 内容生成工具等。在自动驾驶中,攻击者可在路牌或传感器采集的上下文图像上注入肉眼不可见的扰动,导致未来帧预测坍塌、控制指令失效,这对 L4 级仿真测试系统的安全性构成严重威胁。此外,该框架也可作为 隐私保护机制:通过在公开分享的图像上添加对抗扰动,使基于 VWM 的未来帧合成能力失效,防止恶意用户从单帧图像推理出敏感环境动态。

商业价值

BadWorld 的“无标签”攻击方式消除了对真实未来视频的依赖,大幅降低了攻击成本与实现门槛。这为安全厂商和 VWM 提供商带来明确的 防御驱动价值:通过内部红队测试暴露模型脆弱性,推动鲁棒训练或防御模块的开发,从而在产品上市前规避灾难性失效风险,节省潜在的召回与品牌损失。同时,隐私保护功能可嵌入内容分发网络 (CDN) 或社交平台,为用户提供一键式的“抗未来推演”水印,形成差异化增值服务,提升用户信任与活跃度。

与现有产品/工作流的接口

BadWorld 的 轨迹自适应双层优化 可直接作为即插即用的测试套件,集成进 VWM 模型的 CI/CD 管线中。例如,可以参照 torchattacksadvertorch 的部署模式,将攻击模块封装为标准化算子,在模型迭代时自动评估生成样本的 rollout 结构完整性 (如 LPIPS 恶化、控制一致率下降),并设定质量门禁。防御方面,其发现的 早期去噪动态脆弱点 可指导设计专用的 对抗训练增强方法,比如在训练时随机施加速度扰动,使模型学会忽略低幅值噪声,这与当前扩散模型的鲁棒训练范式(如 DiffPure)兼容。在隐私保护产品中,可提供轻量的图像预处理 API,服务器端对用户上传图片实时注入 BadWorld 扰动后再分发,确保即使攻击者获得模型权重也无法重建未来轨迹。

具体落地用例:

  • 自动驾驶仿真: Tier 1 供应商在感知-规划仿真闭环中,对从真实路采数据构建的 VWM 灌入 BadWorld 攻击,量化模型在异常输入下输出轨迹的碰撞率提升,作为安全验证报告的一部分。
  • 社交媒体隐私: 平台提供“防未来推演”选项,在图片上传时自动叠加 BadWorld 扰动,使得无关用户即使使用开源世界模型,也无法从一张自拍生成用户后续运动轨迹,从而避免行为模式泄露。

局限

  • **仅验证两个代表性世界模型**:实验在基于连续控制的 **Diamond** 和离散动作的 **Matrix-Game-2** 上完成,虽然覆盖了两种控制范式,但模型规模与多样性有限。尚未在更复杂的环境(如 3D 场景、多模态世界模型)或大规模工业级模型上进行测试,攻击方法的泛化性与可扩展性有待进一步验证。此外,攻击成功的程度可能高度依赖扩散模型的去噪步数、潜在空间维度等架构细节,论文未系统分析这些因素。
  • **对抗扰动的现实可迁移性与防御缺位**:攻击假设攻击者能对输入图像添加 `L∞` 约束下的不可见扰动,但在物理世界部署(如通过 adversarial patch 或光线变化)时,扰动可能因视角、光照、物理交互而失效。论文未讨论攻击的物理可迁移性,也缺乏对潜在防御策略(如对抗训练、输入净化)的评估,使得安全风险的实际程度与应对路径仍不明确。
  • **计算开销与双层优化的效率**:**Trajectory-Adaptive Bi-Level Optimization** 使用 **CMA-ES** 在内循环搜索最困难的控制序列,外循环优化图像扰动,带来显著的计算负担。论文虽报告了攻击的时间消耗(如单次攻击需约 20–30 分钟),但未与更轻量级的攻击 baseline(如单层优化或基于梯度的控制搜索)进行充分对比,也未分析在实时攻击场景中的可行性,限制了其作为实用攻击或鲁棒性测试工具的部署潜力。
论文Linghui Shen2026-06-15原文

相关内容