动态

Yann LeCun 评 LeJEPA 论文:理论改进与可扩展自监督学习

John Carmack
##PaperADay 10
LeJEPA:无需启发式方法的可证明且可扩展的自监督学习
https://t.co/9Q5hkRogbr

在##PaperADay 3 的评论中,有人推荐这篇论文作为最先进的 JEPA 论文,确实看起来好多了!

他们承认之前很多 JEPA 研究都是启发式的且充满特设方法,但这里他们对最优性提出了强有力的理论主张并提供了证明(我还没读)。

第一个主张是:对于线性和非线性探测,各向同性高斯分布是唯一的优嵌入分布,能最小化跨下游任务的最坏情况风险。我本来会凭“听起来不错”就接受,但他们详细地用示例进行了阐述。

实际上在高维中获得各向同性高斯分布说起来容易做起来难。他们提出了 Sketched 各向同性高斯正则化(SIGReg)作为实现这一目标的良好损失函数,并在分析多种统计测试后声称它以线性可扩展性击败了维度灾难。

最终的损失只是加权因子,用于平衡 JEPA 预测损失和 SIGReg 各向同性损失。这是 LeJEPA 唯一可调的超参数。

尽管 JEPA 中有 P,但他们这里没有使用预测器网络,而是直接比较视图嵌入来计算 JEPA 损失。预测器网络对于视频序列仍然有用,尤其是当使用智能体/机器人的动作信息进行条件化时。

每个训练图像经过增强得到 2 个全局视图和 6 个局部视图,具有不同的空间尺度,但使用相同的颜色和几何变换集。损失是全局视图嵌入的均值与每个局部视图嵌入之间的平均 MSE。

我对他们视图变换的权衡没有很好的感觉,这些变换似乎仍然非常特设,但它们将决定表示中哪些内容被过滤掉。学习什么不重要很关键,但“重要”的规范仅在视图变换中隐式定义。

LeJEPA 本身与架构无关——任何将数据集中的样本批次消化为向量的东西都可以使用。视觉 Transformer、MLP、卷积网络等。具体的视图增强会因输入模态而异,但 LeJEPA 算法可以处理音频、图像、视频或其他内容。

他们表明,在大型基础模型上,LeJEPA 损失能很好地指示下游任务性能,既可以直接使用,也可以通过一种启发式方法进一步提高损失的预测能力。

他们还表明,它可以用于在少至 1000 个样本的小数据集上从头训练,并取得比探测传统通用基础模型更好的结果。

我很高兴在论文中看到示例代码块,而不是充满希腊符号的伪代码,还有一个 GitHub 仓库。

附录 D 有关于通过变换 Sobol 序列生成低差异样本来良好覆盖单位超球面的有趣细节,但这仅用于他们的理论分析,并且他们表明最好每批都生成新的随机超向量,即使只有 16 个随机向量也优于数千个固定向量。

一些问题:

在非线性探测的讨论中,只提到了 kNN 和核方法,大概是出于理论分析的易处理性,但 MLP 通常表现更好吗?

JEPA 嵌入不像 NICE 或 RevNet 那样完全可逆,那么对于远离训练集的输入,它会如何反应?新颖的输入会映射到独特的嵌入,还是会被压缩到训练集的编码上?

在持续学习环境中,随着新颖输入加入训练混合,嵌入会如何演变?

JEPA 会过训练吗——更低的训练损失总是更好,还是存在最优早停点?
动态John Carmack2026-01-24原文

相关内容