行业新闻

DeepMind 提出 GenCeption,将视频生成模型改造为通用视觉理解系统

DeepMind 证明视频生成模型可作为通用视觉预训练目标,用单一模型统一处理多种视觉任务,无需专用设计。

传统视频理解需要为每项任务单独设计模型,而 DeepMind 的 GenCeption 直接复用文生视频扩散模型,将多步去噪改为单步前馈,通过改变文本指令即可切换深度估计、分割、3D 关键点等任务,所有任务使用统一架构和 L2 损失训练。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/8c544ad1-ccec-4aa7-8798-9fce5073e5f0/0-2026-07-14T181857(2).645.jpg) 编辑|山辉 [![](https://image.jiqizhixin.com/uploads/editor/657412b8-2b8c-4bde-9079-a932072e880d/1784082661343.png)](https://mp.weixin.qq.com/s/dX552RCIZwNNiywiosqSw) 如果想开发一个视频理解应用,你会怎么做? 一种常见的思路,是把视频中的信息逐层剥离。例如动作理解,原始像素转化为人体关键点,连续动作经过时序分割变成片段,整个过程要尽可能抛弃与任务无关的干扰信息。 问题也随之出现:不同阶段依赖不同的数据标注和表示,数据之间难以对齐,误差的传递与累积,抛弃的干扰信息可能在下游重新变重要…… 理解世界,是否一定要从「做减法」开始? 在几个月前,谷歌 DeepMind 放出了一篇重量级论文《Image Generators are Generalist Vision Learners》,系统性地证明了之前许多人已经有过的直觉:图像生成器就是强大的通用视觉学习器。 我们此前对此进行了报道:[视觉GPT时刻来了!DeepMind用Vision Banana证明「生成即理解」,何恺明、谢赛宁都参与。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-15原文

相关内容