论文

我们能否抵御针对现实危机事件的AI生成视频攻击?对检测器、生成器与社会传播的系统性评估

我们能否抵御针对现实危机事件的AI生成视频攻击?对检测器、生成器与社会传播的系统性评估

近期视频生成器能够生成逼真的战争、灾难等危机事件视频,带来虚假信息风险,但现有基准对此场景下的检测器与生成器行为证据有限。为此我们提出 RA-Bench,一个以真实视频为锚点的AI生成视频检测基准,包含17,886个视频,含1,830个真实视频锚点(覆盖10类社会风险)与16,056个来自4个开源及5个闭源生成器的生成片段。 基于 RA-Bench,我们沿三个维度展开评估。首先测试检测器泛化能力,涵盖7种传统检测器、3种审查设置下的10个零样本多模态模型,以及2个专门微调于AI生成视频检测的 MLLM;结果显示,这三类检测器均无法在 RA-Bench 实例上一致泛化。其次,分析可检测性如何随生成质量、条件信息与采样种子变化,发现生成属性对不同检测器家族影响各异,而源级检测模式跨种子保持稳定。最后,研究人类真实性判断与社交传播中的检测器可靠性,结果发现:能误导人类的视频同样难以被当前检测器识别,且社交传播进一步加剧检测难度。 综上,当前方法难以检测逼真的AI生成视频,亟需对不断演化的视频生成器具有鲁棒性的检测器。

论文精读

TL;DR RA-Bench 基准以真实危机视频为锚点,系统评测 19 种检测器后发现:当前 AI 生成视频检测器在真实危机场景中普遍失效,且社交传播使检测更加困难。

问题

问题背景

AI 生成视频检测 领域当前聚焦于识别由扩散模型、视频生成器等伪造的真实场景内容,尤其是战争、灾难、公共紧急事件等危机情境下的虚假视频。

现有方法局限

已有基准通常在通用视频或非危机场景下评估检测器,缺乏对危机事件生成视频 的系统覆盖。具体技术限制包括:

  • 传统检测器(如基于频率或生理信号的方法)在跨数据集迁移时性能大幅下降,仅做时间重分配只能带来有限增益。
  • 零样本多模态模型(如 GPT-4V、Gemini)对提示词高度敏感,不同提示下判断结果不稳定。
  • 微调 MLLM 存在协议依赖和类别偏差,无法在不同评估协议间一致泛化。
  • 现有工作未系统评估生成条件(生成质量、条件信息、采样种子)对可检测性的影响,也未覆盖人类感知与社交传播后的检测可靠性。

为什么这个问题难/重要

危机事件中的生成视频容易造成社会恐慌与信息污染,检测器需要在开放世界分布漂移 下工作:生成器持续演进、视频经过社交平台压缩/重编码/截图转发后特征改变。RA-Bench 使用真实视频锚点构建 17,886 个样本,发现没有任何一个检测器家族能一致泛化,且误导人类的视频同样难倒检测器,社交传播模拟进一步削弱检测性能。业界对内容真实性审核的需求日益迫切,当前方案远未达到生产级鲁棒性。

行业类比

类似自动驾驶感知系统 在极端天气或罕见场景下失效,当前 AI 视频检测器在危机事件生成内容中的泛化性不足,亟需针对真实风险场景的鲁棒检测方案。

核心洞察

  • RA-Bench 以真实危机事件视频为锚点构建配对生成基准,揭示现有检测器在真实社会风险场景下泛化失效。与以往侧重通用生成视频的基准不同,RA-Bench 覆盖 10 类社会风险类别,直接配对真实与生成剪辑,迫使检测器面对高逼真伪造。传统检测器、零样本多模态模型和微调 MLLM 均无法一致泛化,说明领域特异的训练或提示策略缺失,实际部署需针对危机场景做专门适配。
  • RA-Bench 的社会传播模拟发现检测器预测显著偏向“真实”,且人类易误判的视频也是检测器难点,为检测评估引入传播链路维度。大多数基准只评估原始生成视频,忽略传播过程中的压缩、裁剪等失真。该发现表明检测器设计必须考虑传播噪声,否则在真实社交媒体环境中性能会进一步下降,为鲁棒检测器提出新要求。

方法

RA-Bench 以真实危机视频为锚点构建配对检测基准,流程分为五个模块。

输入与数据采集

从公开渠道收集 1,830 条真实视频锚点,覆盖战争、灾害、公共紧急事件等 10 类社会风险场景,所有素材经过版权与真实性核验。

自动化预处理

对每个视频执行场景分割,将长视频切分为独立片断,并利用感知哈希进行近重复预过滤,去除高度相似帧段,减少冗余。

人工审核与后处理

采用两轮人工审查:第一轮逐条筛选符合危机事件定义的片断,剔除低信息量或含合成痕迹的素材;第二轮由多名标注者裁决分歧样本。保留片断进一步做时长归一化(统一到固定区间)、编码标准化、同质化修剪,并再次确认权利状态。最终得到 1,830 个干净的真实锚点。

配对视频生成

以真实锚点为条件,使用四个开源生成器和五个闭源生成器,通过两阶段流程构建提示词:先从真实视频内容自动生成 caption,再转换为生成器可用的提示。每个真实锚点生成多条对应假视频,共得到 16,056 条生成片段,形成真实-生成配对。

评价维度

基于该基准,评估分为三条路径:

  1. 检测器泛化:测试 7 个传统检测器、10 个零样本多模态模型(三种提示设置)和 2 个微调 MLLM。
  2. 生成属性影响:分析视频质量、条件信息类型、采样种子对检测难度的影响。
  3. 人类感知与社会传播:收集人类真假判断,并模拟社交平台压缩、转码等传播失真,观察检测器性能变化。

与现有基准仅关注生成质量或特定检测器不同,RA-Bench 将真实危机视频作为锚点,同时覆盖多种生成条件、人类判断与传播失真,提供更贴近真实滥用的系统性评估。

实验

实验设计

  • 构建 RA-Bench 数据集,包含 17,886 个视频:1,830 个真实视频锚点(10 类社会风险场景)与 16,056 个由 4 个开源、5 个闭源生成器产生的合成视频。
  • 三个评估维度:检测器泛化(7 个传统检测器、10 个零样本多模态模型、2 个微调 MLLM);生成属性影响(质量、条件信息、采样种子);人类感知与社交传播模拟。

关键发现

  • 三类检测器无一能在 RA-Bench 上保持一致泛化,跨源、跨提示表现波动大。
  • 生成质量不直接决定检测难度;真实图像条件对不同家族影响相异;采样种子对检测结果影响很小。
  • 误导人类的视频同样难倒检测器;社交传播模拟使检测更偏向“真实”,进一步削弱可靠性。

与基线对比

  • 现有视频检测基准常用合成数据或单一生成器,RA-Bench 以真实视频为锚点并覆盖多源、多风险场景,更贴近真实危机传播。
  • 传统检测器在常规基准上的性能无法迁移到 RA-Bench;零样本多模态模型对提示词敏感,诊断提示易坍缩;微调 MLLM 存在协议依赖和类别偏差。
  • 这说明当前检测器需面向开放世界生成条件与传播链增强鲁棒性,而非仅追求特定基准分数。

行业影响

落地场景

AI 生成视频检测直接服务于内容审核与事实核查。在突发危机事件中,社交平台需要快速区分真实现场视频与 AI 伪造内容,防止恐慌性传播;新闻机构可在发布前对来源不明的视频进行真实性预筛;电商直播中可检测商品演示视频是否由生成模型合成,避免虚假宣传;法院或保险理赔场景中可作为辅助工具判断视频证据的原始性。典型用例包括:视频平台自动打上“疑似 AI 生成”标签,以及社交媒体在突发事件中优先审查高传播风险的视觉内容。

商业价值

该方向能同时切入降本、增收与风险控制三条线。降本方面,当前多数平台依赖人工审核,面对 17,886 条规模的基准测试已显示人工审查的瓶颈,自动检测可将人工抽检比例从全覆盖降至 10% 以下。增收方面,提供 AI 生成内容检测 API 或企业级合规报告可形成订阅制收入,尤其是面向媒体、保险公司等对真实性要求高的客户。体验提升则体现在用户信任度与平台品牌安全:减少虚假危机视频的扩散能直接降低监管处罚和公关风险,保护广告主品牌安全支出。

跟现有产品/工作流的接口

可将检测模型作为轻量级推理服务接入现有内容审核流水线,先由传统检测器(如 CNN-based 模型)进行粗筛,对高风险视频再调用零样本多模态模型(如 GPT-4V)进行二次复核,最后人工终审。RA-Bench 本身可作为离线评估集和线上监控指标,帮助团队跟踪新生成器出现时检测器的召回率漂移。工程上建议封装成基于 gRPC 的微服务,与特征存储、审核队列深度集成;同时利用论文中的种子稳定性发现,可在部署前固定采样种子做回归测试,降低线上波动。关键挑战在于检测协议依赖性,因此接口设计需支持灵活切换提示词模板与评测策略,避免单一固定 prompt 导致线上漏判。

局限

  • **生成器覆盖与类别泛化**:RA-Bench 纳入九个生成器(四个开源、五个闭源),但视频生成技术迭代迅速,新模型或更新版本可能改变检测难度,基准的静态快照难以持续评估最新风险。仅覆盖十个社会风险类别,未穷尽危机类型,跨类别泛化能力仍需验证。闭源模型仅能通过 API 访问,无法控制内部采样参数,生成条件一致性受限,可能影响生成质量与检测难度的归因分析。
  • **社交传播仿真的简化**:论文对社交传播的模拟采用压缩、转码、裁剪等单模态变换,可能过于简化真实平台传播。实际传播包含推荐算法放大、评论互动、截图转发、多模态混排等复杂路径,这些因素可能进一步改变检测难度。当前结论“传播使检测更难”可能低估或高估真实环境中的效应,需要更逼真的平台仿真或真实社交媒体数据验证。
  • **人类评估与微调模型局限**:人类评估的样本量和参与者背景未充分说明,可能引入主观偏差,且不同来源视频的难易差异可能部分源于参与者先验知识。MLLM 微调仅针对两个模型,训练协议(数据规模、正负样本比例、指令格式)不一致,难以全面代表微调方法的潜力。此外,传统检测器在 RA-Bench 上表现不佳,可能部分因为训练数据分布与危机视频差异大,但论文未深入分析特征空间偏移的具体原因。
论文Shuo Liang2026-08-14原文

相关内容