动态

Yann LeCun等人新论文V-JEPA 2.1,改进自监督学习

Yann LeCun等人新论文V-JEPA 2.1,改进自监督学习
Ksenia_TuringPost
来自@ylecun等人的新论文——V-JEPA 2.1

它改变了V-JEPA的配方,使得模型同时学习:

• 全局语义——场景中正在发生什么
• 密集时空结构——物体在哪里以及如何移动

其思想不仅监督掩码token,也监督可见token

V-JEPA 2.1有4个关键要素:

- 对掩码和可见token的密集预测损失
- 跨中间层的深度自监督
- 共享编码器内的模态特定分词器(图像用2D,视频用3D)
- 模型+数据缩放

工作流程变成:掩码图像/视频→编码可见token→预测掩码和可见token的潜在表示→在多个层进行监督

详情如下:
动态Ksenia_TuringPost2026-03-20原文

相关内容