Yann LeCun等人新论文V-JEPA 2.1,改进自监督学习
来自@ylecun等人的新论文——V-JEPA 2.1
它改变了V-JEPA的配方,使得模型同时学习:
• 全局语义——场景中正在发生什么
• 密集时空结构——物体在哪里以及如何移动
其思想不仅监督掩码token,也监督可见token
V-JEPA 2.1有4个关键要素:
- 对掩码和可见token的密集预测损失
- 跨中间层的深度自监督
- 共享编码器内的模态特定分词器(图像用2D,视频用3D)
- 模型+数据缩放
工作流程变成:掩码图像/视频→编码可见token→预测掩码和可见token的潜在表示→在多个层进行监督
详情如下:
它改变了V-JEPA的配方,使得模型同时学习:
• 全局语义——场景中正在发生什么
• 密集时空结构——物体在哪里以及如何移动
其思想不仅监督掩码token,也监督可见token
V-JEPA 2.1有4个关键要素:
- 对掩码和可见token的密集预测损失
- 跨中间层的深度自监督
- 共享编码器内的模态特定分词器(图像用2D,视频用3D)
- 模型+数据缩放
工作流程变成:掩码图像/视频→编码可见token→预测掩码和可见token的潜在表示→在多个层进行监督
详情如下: