LeCun团队推出高效视频预训练模型LeVJEPA,显著降低算力且性能提升。
RT @LeoKharon: 新世界模型:@ylecun 团队带着高效模型回来了!该项目涉及 @ylecun、@lukaskuhn77、@lucasmaes_、@quentinlldc 和 @randall_balestr。首先给出几个定义:- DINO:无标签自蒸馏。一种自监督图像模型(Meta,2021年),学生网络学习匹配教师(自身的EMA副本)在同一图像的两个裁剪上,无标签、无负样本。- SIGReg:一种正则化器,通过强制嵌入匹配各向同性高斯分布来防止嵌入坍缩,使用正态性检验(Epps–Pulley)在许多随机一维投影上测试,而非全维度。LeVJEPA是一种自监督视频预训练方法,随开源代码、权重和检查点发布。它通过将同一片段全局和局部裁剪的嵌入推到一起(不变性损失)来学习视频表示,同时称为SIGReg的正则化器将嵌入推向各向同性高斯分布,以可证明地防止表示坍缩。与V-JEPA和V-JEPA 2不同,它使用单个共享编码器和投影器,无目标网络、无预测器、无停止梯度。它每视图丢弃95%的token,使用块因果注意力(每帧只关注过去帧),并且只有一个损失权重。它仅通过冻结探测在ImageNet-1K、Something-Something-v2和Kinetics-400上进行评估,作为表示学习器,而非任何机器人。我觉得有趣的是,V-JEPA和V-JEPA 2需要EMA目标编码器、停止梯度和容量有限的预测器来避免坍缩;LeVJEPA全部去掉,只用一个共享编码器加投影器,通过SIGReg正则化器以可证明的保证和单一超参数防止坍缩。JEPA中的“P”(预测器)实际上消失了。LeVJEPA计算强度也更低:- 总预训练计算比V-JEPA 2低5.6倍至20.8倍- 在相同FLOPs下,ImageNet-1K高7.6个点- 在8GB内批量大小128训练,而V-JEPA 2在批量大小28时饱和。另外值得一提的是:ImageNet-1K准确率随token丢弃率单调上升,从rho=0时的33.9%到rho=0.95时的47.6%。激进的丢弃实际上在起正则化作用。关于JEPA与DINO的辩论:- 在ImageNet-1K(外观、静态)上比DINOv2低3.1个点- 但在Something-Something-v2(运动、时间)上几乎赢2倍- 并且以5.6倍更低的成本在ViT-L上比V-JEPA 2高1.9个点。-> 针对每个计算美元优化时间和运动理解。