讨论LeJEPA框架,改进JEPA训练稳定性,50行代码实现
YANN LECUN的新论文:
LeJEPA:无需启发式的可证明且可扩展的自监督学习
这可能是在Meta的最后一篇论文(哈哈),但我觉得很有趣。快速总结:
Yann LeCun的大想法是JEPA,一种自监督学习方法。然而,这种方法存在各种失败模式,因此训练强大的JEPA模型非常脆弱、不稳定且相当困难。所以整体上JEPA在实践中很少被采用。
这篇论文直接尝试解决这个问题,通过具体的设计决策来提高训练稳定性。
作者将各向同性高斯分布确定为JEPA模型嵌入应遵循的最优分布,并设计了Sketched Isotropic Gaussian Regularization(SICReg)来约束嵌入达到该理想分布。这构成了LeJEPA框架,可用约50行代码实现。
在实证测试中,作者展示了跨超参数、架构和数据集的训练稳定性。
然而,对我来说特别有趣的一个结果是,直接在下游数据集上从头训练LeJEPA模型,性能优于在该数据集上微调DINOv2/v3模型。
LeJEPA:无需启发式的可证明且可扩展的自监督学习
这可能是在Meta的最后一篇论文(哈哈),但我觉得很有趣。快速总结:
Yann LeCun的大想法是JEPA,一种自监督学习方法。然而,这种方法存在各种失败模式,因此训练强大的JEPA模型非常脆弱、不稳定且相当困难。所以整体上JEPA在实践中很少被采用。
这篇论文直接尝试解决这个问题,通过具体的设计决策来提高训练稳定性。
作者将各向同性高斯分布确定为JEPA模型嵌入应遵循的最优分布,并设计了Sketched Isotropic Gaussian Regularization(SICReg)来约束嵌入达到该理想分布。这构成了LeJEPA框架,可用约50行代码实现。
在实证测试中,作者展示了跨超参数、架构和数据集的训练稳定性。
然而,对我来说特别有趣的一个结果是,直接在下游数据集上从头训练LeJEPA模型,性能优于在该数据集上微调DINOv2/v3模型。