可泛化深度伪造视频检测的多智能体取证推理
生成式人工智能的恶意使用催生了高度逼真的深度伪造视频,引发严重伦理问题,并对 AI 安全构成重大挑战。然而,现有深度伪造视频基准覆盖的合成方法有限,且普遍缺乏可靠的细粒度文本标注。同时,传统检测器和多模态大语言模型(MLLM)无论采用单一模型还是单一分析视角,往往难以捕捉细微的伪造痕迹,限制了对新兴 AI 生成方法的泛化能力。 为此,我们引入了 FaceVid-Forensics-100K,一个大规模深度伪造视频数据集,包含 10 万段视频,覆盖 33 种合成方法,涵盖换脸、面部重演和全脸合成,包括 Seedance 2.0 等最新生成器。该数据集提供了细粒度的文本标注,包括视觉观察和与裁决一致的取证解释,并通过由先进 MLLM 驱动的多模型聚合与冲突消解流程自动合成。 基于这一基准,我们提出了一种 多智能体取证推理框架,采用四个专业领域专家智能体,分别从 纹理、光照、运动和物理 四个角度独立分析伪造线索。随后,一个法官智能体整合各智能体的报告,生成最终预测及解释。在域外测试集上的大量评估表明,尽管完全由小型开源 MLLM 组成,我们的框架在性能上超越了所有方法(包括闭源的 GPT 和 Gemini 模型),并在该基准的所有报告指标上名列第一。
论文精读
TL;DR 多智能体协同从纹理、光照、运动、物理四角度分析伪造线索,结合大规模精细标注数据集 FaceVid-Forensics-100K,在开放域检测中超越闭源模型。
问题
生成式 AI 的滥用使得 深度伪造视频 (deepfake videos) 日益逼真,引发虚假信息传播与伦理安全风险,推动视频真实性鉴伪成为 AI 安全领域的核心议题。
当前方案存在两大瓶颈:
- 基准滞后:现有数据集(如 FF++、DFDC)覆盖的伪造方法有限,缺乏对最新生成器(如 Seedance 2.0)的评测,且标注多为二分类标签,缺少细粒度的多维度文本描述,制约了可解释性研究。
- 单视角检测的固有缺陷:传统 CNN/Transformer 检测器通常从单一特征空间提取线索,而现有的 多模态大模型 (MLLM) 即便接受视觉-语言联合训练,在单独推理时也倾向于依赖表层纹理或全局特征,难以整合 纹理、光照、运动、物理一致性 等跨领域线索,面对未知伪造算法时泛化能力急剧下降。
深度伪造检测的难点在于伪造痕迹分布稀疏且与真实噪声混杂,不同生成方法留下的伪影模式差异巨大。单一模型或单代理视角如同盲人摸象,无法构建完整的证据链。此外,可解释性要求检测系统不仅能判断真伪,还要提供符合取证逻辑的推理过程,这对黑盒模型构成挑战。业界亟需一种能融合多专家知识、具备强泛化能力的检测范式,以应对 AI 生成内容 (AIGC) 的快速演进。
这一需求与 自动驾驶安全系统 的多传感器融合类似:正如单一摄像头难以应对所有路况,深伪检测也需要融合纹理、光照、运动等多维信号,形成冗余稳健的判据。
核心洞察
- **多智能体协同推理通过专业化分工提升深度伪造检测泛化能力**。该框架让 4 个观察 agent 分别独立分析纹理、光照、运动、物理维度的伪造痕迹,再由 judge agent 融合判断,这与传统单模型或单一视角 MLLM 形成本质差异。专业化分工迫使模型聚焦特定伪造线索,避免多线索互相干扰;同时,多 agent 报告间的冲突消解增强了推理的鲁棒性,即使单一 agent 误判,最终决策仍可能被纠正。在完全由小开源 MLLM 组成的条件下,该框架在域外测试中超越 GPT、Gemini 等闭源大模型,证明架构优势可弥补单模型规模不足,为 AI 安全领域提供了一种低成本、高扩展性的技术路径。
- **自动化标注流水线生成 verdict-consistent 解释,填补了深度伪造数据集的细粒度注释空白**。现有数据集普遍缺乏可靠的细粒度文本标注,而该工作利用多模型聚合与冲突消解 pipeline,自动生成视觉观察描述和与判决一致的取证解释。这种标注方式避免了人工标注的偏差和成本,同时确保了标签与最终真伪判断的逻辑一致性,使得后续训练出的模型不仅能判别真伪,还能提供可解释的证据链。与仅利用二元标签或粗粒度描述的方法相比,这种结构化注释让模型学会“像法医一样推理”,显著提升了决策透明度和对未知生成方法的适应能力。
方法
多智能体取证推理框架
输入为单帧人脸视频,框架由四类观察智能体 和一个法官智能体 组成,全部基于小型开源 MLLM。
观察智能体:每个智能体从特定领域独立分析伪造线索:
- 纹理智能体:检测皮肤纹理一致性、融合边界等像素级伪影;
- 光照智能体:评估面部与环境光照是否匹配,关注阴影和高光异常;
- 运动智能体:捕捉面部运动、眨眼、头部运动的不自然动态;
- 物理智能体:检验物理真实性,如面部几何与视角的一致性。 各智能体生成包含证据的文本报告。
法官智能体:读取所有观察报告,进行多视角冲突消解,最终输出二分类判定(真/伪)及连贯的自然语言解释。
训练流程
模型训练分为两个阶段:
- 监督微调(SFT):利用 FaceVid-Forensics-100K 数据集中的细粒度观察描述和判决解释进行端到端微调,使各智能体初步掌握领域知识。
- 策略优化(GRPO):引入群体相对策略优化(Group Relative Policy Optimization),以判决准确率和解释一致性为奖励信号,对齐推理链与最终决策,进一步提升泛化能力。
该框架的核心差异在于:将 deepfake 检测从单一模型的一次性推理分解为多个专家视角的协同取证,通过显式冲突消解和联合优化,显著提升了对未知伪造方法的泛化性,在保持模型规模轻量的同时超越 GPT-4o、Gemini 等闭源大模型。
实验
实验设计
在自建的 FaceVid-Forensics-100K 数据集上进行训练与评估,该数据集包含 10 万视频、33 种生成方法,覆盖换脸、面部重演与全脸合成。评估聚焦于分布外 (out-of-domain) 泛化:测试集包含训时未见的新一代生成器(如 Seedance 2.0)。
对比基线包括:
- 基于视觉特征的传统检测器
- 单模型多模态大语言模型 (MLLM) 的直接判断
- 多轮推理或链式思考 (CoT) 策略
- 闭源模型 GPT 与 Gemini 系列
本框架使用 4 个小型开源 MLLM 作为观测 Agent(分别分析纹理、光照、运动、物理伪影),并通过 法官 Agent 融合报告生成最终预测。训练分为两阶段:监督微调 (SFT) 与基于策略优化的决策精炼 (GRPO)。
关键发现
- 多智能体框架在所有报告指标上均排名第一,超过包括闭源 GPT/Gemini 在内的所有方法。
- 消融实验证实:每个观测 Agent 都对最终性能有独立贡献,缺少任一视角均导致指标下降。
- SFT + GRPO 联合训练比单独 SFT 显著提升决策质量,尤其在分布外数据上。
- 相较于单模型或多轮推理,多智能体协同能捕捉互补伪影线索,推理一致性更高。
基线对比解读
传统检测器依赖固定特征空间,难以泛化至未见合成方法;单一 MLLM 受限于单一分析视角,容易遗漏细微伪造痕迹。本工作表明,领域特化的小模型协同可通过视角解耦实现更全面的取证分析:纹理 Agent 发现局部不一致,光照 Agent 检查光影合理性,运动 Agent 追踪时序异常,物理 Agent 验证面部物理规律。法官 Agent 综合多源证据,纠正单一模型的误判。即使整体参数量远小于闭源巨模,该协作模式在分布外测试中依然稳定领先,说明系统架构设计比单模型规模对泛化能力更为关键。
行业影响
落地场景
该多智能体取证推理框架可集成到多种业务场景中,用于自动化检测 AIGC 生成的假视频。典型应用包括:社交媒体平台,对用户上传的视频进行实时深度伪造筛查,阻断虚假信息传播;金融身份核验,在远程 KYC 流程中检测合成人脸视频,防止身份冒用欺诈;数字内容版权保护,识别未经授权的面部替换或重演视频;直播合规监控,检测主播是否使用虚拟形象或伪造面部表情误导观众。其可解释的取证报告还能为法律取证提供参考依据。
商业价值
- 降本增效:由多个小型开源 MLLM 构成的检测系统,推理成本远低于闭源大模型,且可完全本地化部署,避免 API 调用费用。自动检测可大幅减少人工审核团队的人力投入。
- 风险控制与增收:高泛化能力使系统对未知合成方法保持高检出率,降低因深度伪造视频导致的信任危机、欺诈损失和合规罚款。对于内容平台,更准确的内容安全能吸引广告主,增加收入。
- 体验增强:输出包含纹理、光照、运动、物理等多维度证据的解释,帮助审核人员快速决策,提升审核透明度与效率;也便于向用户出具可信的判定结果,减少申诉纠纷。
与现有产品/工作流的接口
该框架以 微服务架构 集成到现有视频处理流水线中。每个观察代理(纹理/光照/运动/物理)可作为独立推理单元,通过 REST/gRPC 接口接收视频帧序列并返回分析报告;法官代理汇总后输出最终决策和解释。由于采用轻量开源模型(如 Qwen-VL 等),可部署在 CPU 或消费级 GPU 上,并支持横向扩展。与现有审核系统对接时,只需在视频上传或流处理阶段增加一个检测任务,将结果写入消息队列或数据库,触发后续人工复核或自动拦截动作。例如,可与 FFmpeg 等视频预处理工具结合,统一帧采样速率和分辨率,再传入代理服务。
局限
- 数据集 **FaceVid-Forensics-100K** 的细粒度文本标注由多模型聚合流水线自动生成,虽然通过冲突消解提升了标注一致性,但整个过程缺乏人工审核,可能保留 MLLMs 自身的视觉幻觉或系统性偏差,尤其对微小伪造痕迹(如局部纹理不一致)的描述准确性难以保障,进而影响以此为监督信号训练的检测器在真实分布上的鲁棒性。
- 多智能体取证推理框架需依次调用四个专家代理和一个法官代理,实质上将推理延迟放大了数倍。即便单个代理使用小型开源 MLLM,整体计算开销仍远高于单模型方案,在流式视频检测、移动端部署等对实时性要求较高的场景下面临较大工程挑战,论文未提供推理效率的定量分析(如延迟、吞吐量)。
- 评估主要围绕自建基准展开,尽管包含域外测试集,但所有数据均来自已知的 33 种合成方法,对完全未知的生成模型(如未来发布的新架构)泛化能力尚不明确;此外,与现有主流基准(如 Celeb-DF、DFDC)的跨库评测缺失,难以确认方法在更广泛生态中的相对优势。