动态

阅读笔记:JEPA通过预测内部表示进行自监督学习,对比生成模型更高效。

John Carmack
#每日一篇 3(希望嵌入式链接能降低可见度,这样不会太多人被这些内容打扰)

@ylecun 最近成为热门话题,所以我今天读了:
Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture https://t.co/kYP2E8rhD0

我大致同意“重要的预测是内部表示而非像素”这一观点,因此生成模型可能有些适得其反,或者至少对许多任务来说效率低下。

然而,我倾向于认为内部预测应该在比完整图像处理更细粒度的层次上进行,比如微柱甚至神经层面,并且具有比局部掩码更多的时间成分。

自监督训练在大型数据集上进行,不知道后续会要求模型做什么,只是从数据中积累知识。之后,你可以在输出上训练一个简单的线性分类器(线性探针)并获得相当好的性能。在冻结的自监督模型上,最佳线性探针不如端到端训练的分类器强,但同一个SSM可以同时在许多不同任务上表现出色。

论文指出,与JEPA相反,基于不变性的训练方法(取同一张图像并以两种不同方式增强同时保持表示相似性)以研究人员偏好的图像增强集为代价获得性能,这种增强集无法迁移到音频或文本等其他模态。我注意到JEPA对确切执行的掩码非常敏感(表6),感觉差异不大。

目标编码器表面上类似于DQN强化学习网络中目标模型的现代形式——使用权重的EMA而非偶尔复制,但虽然它对于RL是一种稳定性辅助(且并非总是必需),在这里它有更根本的目的:防止模型崩溃为易预测的表示。这一点以及LayerNorm也是关键要素,在论文中没有明确说明,我不得不从其他资料中寻找参考。

有点奇怪的是,它们对上下文应用随机0.85-1.0的裁剪,但只从右侧和底部移除块。我本以为能看到这种裁剪的消融实验。

提高图像分辨率是一种有点奇怪的扩展模型的方式。可能实际有帮助的不是分辨率,而是总补丁数。

关于自监督学习有大量工作我只是略知一二,所以可能错过了一些JEPA的关键区别特征。我仍在努力理解核心问题:上下文究竟学到了什么,以及模型架构和训练如何引导它避免崩溃。
动态John Carmack2026-01-13原文

相关内容