Yann LeCun转推回顾表示学习重要开源工作
RT @HaiyuWu1: 最近关于开源的讨论让我觉得应该回顾这些重要的开源表示学习工作,它们推动了领域发展,最终使视觉基础模型在应用中如此有用。以下是我想到的论文,欢迎纠正并分享可能遗漏的重要论文。
MoCo v1 (2019-11) – ResNet
方法:对比损失 + 来自前几批样本的队列用于负配对 + 基于EMA的权重更新
训练分支数:2
效果:基于EMA的权重更新成为后来表示学习算法的重要训练范式,但此工作仅使用EMA为负样本生成稳定嵌入。
SimCLR (2020-02) – ResNet
方法:对比损失 + 更多数据增强 + MLP投影头以捕获增强效果
训练分支数:2
效果:MLP投影头成为表示学习算法的黄金标准。
BYOL (2020-06) – ResNet
方法:仅正配对 + 非对称架构 + 停止梯度 + SimCLR增强 + EMA
训练分支数:2
效果:可能是第一个无负配对的表示学习方法,在架构设计上启发了DINO和JEPA。
SwAV (2020-06) – ResNet
方法:全局/局部视图 + SimCLR增强 + 类原型
训练分支数:2
效果:其全局/局部视图训练成为后来表示学习方法的标配。
SimSiam (2020-11) – ResNet
方法:BYOL去掉EMA + 预测器恒定学习率
训练分支数:2
Barlow Twins (2021-03) – ResNet
方法:全局视图 + SimCLR增强 + 批次级协方差优化
训练分支数:2
效果:优化目标改变,之前用余弦相似度,此工作使用协方差显式正则化潜在空间。
MoCo v3 (2021-04) – ViT
方法:MoCo v1去掉记忆库 + SimCLR增强和MLP + 冻结第一层
训练分支数:2
效果:首个展示ViT可用于表示学习的工作。
DINO (2021-04) – ViT
方法:BYOL去掉预测器 + 全局/局部视图 + softmax蒸馏 + 中心化 + 温度锐化
训练分支数:2
效果:开启大规模视觉基础模型时代。
VICReg (2021-05) – ViT
方法:Barlow Twins → 分支级协方差 + 方差 + 样本级不变性
训练分支数:2或1
效果:首个支持稳定单分支训练且无需EMA、中心化、冻结层、温度锐化或停止梯度的表示学习方法。
MAE (2021-11) – ViT
方法:通过像素重建学习表示
训练分支数:1
效果:简单、简单、简单的训练策略,据我所知广泛用于医学影像。
I-JEPA (2023-01) – ViT
方法:通过潜在预测学习表示
训练分支数:2
效果:首个符合JEPA理念的表示学习方法,也是V-JEPA、VL-JEPA等的基础。
DINOv2 (2023-04) – ViT
方法:DINO v1 + SK中心化 + KoLeo + LayerScale
训练分支数:2
效果:首个在多种下游任务上展现卓越性能的大型视觉基础模型。
DINOv3 (2025-08) – ViT
方法:DINO v2 + Gram锚定 + 平坦调度
训练分支数:2
效果:首个在细粒度任务(如分割和深度估计)上展现卓越性能,并在ImageNet-1K上达到与监督学习方法相当精度的视觉基础模型。
LeJEPA (2025-11) – ViT + 其他
方法:VICReg → 全分布正则化,提供数学证明为何各向同性分布是潜在空间的理想目标,并提出SIGReg(缩放因子线性方法)。
训练分支数:1
效果:
MoCo v1 (2019-11) – ResNet
方法:对比损失 + 来自前几批样本的队列用于负配对 + 基于EMA的权重更新
训练分支数:2
效果:基于EMA的权重更新成为后来表示学习算法的重要训练范式,但此工作仅使用EMA为负样本生成稳定嵌入。
SimCLR (2020-02) – ResNet
方法:对比损失 + 更多数据增强 + MLP投影头以捕获增强效果
训练分支数:2
效果:MLP投影头成为表示学习算法的黄金标准。
BYOL (2020-06) – ResNet
方法:仅正配对 + 非对称架构 + 停止梯度 + SimCLR增强 + EMA
训练分支数:2
效果:可能是第一个无负配对的表示学习方法,在架构设计上启发了DINO和JEPA。
SwAV (2020-06) – ResNet
方法:全局/局部视图 + SimCLR增强 + 类原型
训练分支数:2
效果:其全局/局部视图训练成为后来表示学习方法的标配。
SimSiam (2020-11) – ResNet
方法:BYOL去掉EMA + 预测器恒定学习率
训练分支数:2
Barlow Twins (2021-03) – ResNet
方法:全局视图 + SimCLR增强 + 批次级协方差优化
训练分支数:2
效果:优化目标改变,之前用余弦相似度,此工作使用协方差显式正则化潜在空间。
MoCo v3 (2021-04) – ViT
方法:MoCo v1去掉记忆库 + SimCLR增强和MLP + 冻结第一层
训练分支数:2
效果:首个展示ViT可用于表示学习的工作。
DINO (2021-04) – ViT
方法:BYOL去掉预测器 + 全局/局部视图 + softmax蒸馏 + 中心化 + 温度锐化
训练分支数:2
效果:开启大规模视觉基础模型时代。
VICReg (2021-05) – ViT
方法:Barlow Twins → 分支级协方差 + 方差 + 样本级不变性
训练分支数:2或1
效果:首个支持稳定单分支训练且无需EMA、中心化、冻结层、温度锐化或停止梯度的表示学习方法。
MAE (2021-11) – ViT
方法:通过像素重建学习表示
训练分支数:1
效果:简单、简单、简单的训练策略,据我所知广泛用于医学影像。
I-JEPA (2023-01) – ViT
方法:通过潜在预测学习表示
训练分支数:2
效果:首个符合JEPA理念的表示学习方法,也是V-JEPA、VL-JEPA等的基础。
DINOv2 (2023-04) – ViT
方法:DINO v1 + SK中心化 + KoLeo + LayerScale
训练分支数:2
效果:首个在多种下游任务上展现卓越性能的大型视觉基础模型。
DINOv3 (2025-08) – ViT
方法:DINO v2 + Gram锚定 + 平坦调度
训练分支数:2
效果:首个在细粒度任务(如分割和深度估计)上展现卓越性能,并在ImageNet-1K上达到与监督学习方法相当精度的视觉基础模型。
LeJEPA (2025-11) – ViT + 其他
方法:VICReg → 全分布正则化,提供数学证明为何各向同性分布是潜在空间的理想目标,并提出SIGReg(缩放因子线性方法)。
训练分支数:1
效果: