DeepMind 提出 GenCeption,将视频生成模型改造为通用视觉理解系统
DeepMind 证明视频生成模型可作为通用视觉预训练目标,用单一模型统一处理多种视觉任务,无需专用设计。
传统视频理解需要为每项任务单独设计模型,而 DeepMind 的 GenCeption 直接复用文生视频扩散模型,将多步去噪改为单步前馈,通过改变文本指令即可切换深度估计、分割、3D 关键点等任务,所有任务使用统一架构和 L2 损失训练。
正文摘录
.645.jpg) 编辑|山辉 [](https://mp.weixin.qq.com/s/dX552RCIZwNNiywiosqSw) 如果想开发一个视频理解应用,你会怎么做? 一种常见的思路,是把视频中的信息逐层剥离。例如动作理解,原始像素转化为人体关键点,连续动作经过时序分割变成片段,整个过程要尽可能抛弃与任务无关的干扰信息。 问题也随之出现:不同阶段依赖不同的数据标注和表示,数据之间难以对齐,误差的传递与累积,抛弃的干扰信息可能在下游重新变重要…… 理解世界,是否一定要从「做减法」开始? 在几个月前,谷歌 DeepMind 放出了一篇重量级论文《Image Generators are Generalist Vision Learners》,系统性地证明了之前许多人已经有过的直觉:图像生成器就是强大的通用视觉学习器。 我们此前对此进行了报道:[视觉GPT时刻来了!DeepMind用Vision Banana证明「生成即理解」,何恺明、谢赛宁都参与。