行业新闻

腾讯优图与深大提出 ForgeryVCR,图像取证转向视觉中心推理

图像鉴伪的瓶颈不在模型不够大,而在证据被转述成文字时丢了——ForgeryVCR 让模型直接调工具、看证据、再下判断。

腾讯优图与深圳大学提出 ForgeryVCR,一个图像篡改检测与定位的取证智能体框架。它不再让多模态大模型先用文字描述异常再下判断,而是让模型直接调用取证工具生成可视化的中间证据(如压缩痕迹、噪声残差、频域能量),再基于这些图像证据判定真伪,减少转述成文字时的信息丢失。论文被 ACM Multimedia 2026 录用为 Oral。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/66d9ef03-e447-43e0-bd8f-6cf31b8fd044/072(2).jpg) ![图片](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsgimgIndex=0) 随着编辑工具与生成模型的快速普及,「改图」正在变得越来越容易,篡改者可以在几乎不改变画面观感的前提下完成内容伪造,给内容真实性核验、平台治理与数字媒体信任带来新的风险。因此,图像取证与可信鉴伪证据,成为了内容安全中尤为重要的一环。 近年来,多模态大模型凭借视觉理解与推理能力,逐渐成为图像取证的重要技术路线。现有主流方法采用文本中心的推理范式:先用自然语言描述异常,再根据这些描述判断图像是否被篡改。然而,图像篡改的关键证据通常隐藏在细微的低层视觉痕迹中,既难以被偏重高层语义的视觉编码器准确感知,也难以通过语言完整表达。当模型被迫先把「看到了什么」转述成文字、再据此判别图像真伪时,信息损失与语义偏见便可能使描述偏离真实痕迹,甚至将无关的场景内容误认成伪造证据。 针对这一问题, 腾讯优图实验室 与 深圳大学 的研究者提出了 ForgeryVCR :一个将取证工具箱、视觉中心推理与策略性工具学习统一到同一闭环的取证智能体框架,推动图像篡改检测与定位从「依赖文本描述取证痕迹」转向「基于显式视觉证据推理」的新范式。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-21原文

相关内容