介绍LeVJEPA简化视频自监督学习,降低计算成本并提升性能
RT @hillbig: LeVJEPA大幅简化视频自监督学习,以5-20倍更少的计算量实现与现有方法相当或更高的性能。\n\n视频包含静止图像所不具备的物体运动和时序因果等信息,是学习世界表征的理想素材。\n\n然而,视频自监督学习需处理比图像多得多的帧,计算成本高。\n\n而且传统自监督学习为防止表征崩溃,需要EMA更新的目标编码器、stop-gradient、predictor等多种机制。\n\nLeVJEPA提出同时解决这两个问题的方法,并主张视频预训练未来可能成为学习视觉基础模型的标准方式。\n\n首先从视频提取16帧片段,生成一个全局视图和多个局部视图。局部视图添加空间裁剪、颜色变化等增强,但全局和局部的时间区间相同。\n\n所有这些都输入同一个编码器。\n\n编码器只添加一个可学习的CLS标记,可关注所有帧和所有patch标记,聚合整个片段的信息。\n\n每个patch标记仅能关注同时刻及更早时刻的标记,且禁止从patch标记到CLS标记的注意力。\n\n因此各帧的patch表示是不使用未来信息的因果表示,而CLS表示是观察整个视频的非因果表示。\n\n在此设置下,学习目标是将最终CLS表示通过一个小型projector得到潜在表示z,并用MSE拉近全局视图和局部视图的z。\n\n但仅凭该损失,若对所有输入输出相同表示则损失为零,会发生表征崩溃。于是加入SIGReg。\n\nSIGReg是使批次整体embedding分布接近各向同性高斯N(0,I)的正则化。\n\n具体地,采样大量随机方向a,计算与z的内积a^Tz,用Epps-Pulley统计量衡量其是否服从N(0,1)作为损失。\n\n编码器最后层有LayerNorm,CLS表示被限制在球面空间,直接应用SIGReg较困难,因此先通过projector再应用。\n\n总之,整体损失仅为匹配全局和局部视图CLS表示的MSE与SIGReg。\n\n不再使用传统防崩溃的EMA目标编码器、stop-gradient、predictor。\n\n另一大特点是随机丢弃95%的patch标记。\n\n实验中ImageNet上probing精度在drop率达95%时不仅不降反而提升。\n\n作者将此解释为增强而非单纯降低计算量:因每次只能看到极少部分标记,要求无论观看视频哪部分都能产生相同的片段级语义表示。\n\n消融研究显示,不需要像VideoMAE那样的tube masking(沿时间方向掩膜同一空间位置),也无需在输入阶段将相邻帧融合为时间patch。\n\n相反,不采用这些反而性能更高,模型结构更简单。\n\n如此学到的编码器在下游任务表现优异。\n\n更有趣的是,只有CLS标记直接受损失影响,patch标记没有直接监督信号,但学习后的patch表示仍出现物体区域、背景等语义信息和详细空间信息。\n\n评论\n=== \n图像或视频自监督学习对构建视觉基础模型至关重要,此方法很有意义。\nLeVJEPA中直接对齐的是CLS表示,该表示无需教师标签即可编码图像或视频整体特征信息。\n例如“少年们在广场玩接球”的视频,其语义虽未用语言显式给出,但对应信息以连续潜在空间中的CLS表示体现。\n且全局/局部视图丢弃95%的patch标记,局部视图经空间裁剪后,需使各局部视图与全局视图的CLS表示一致。\n因此编码器学会从有限局部信息估算视频整体特征。\n进一步,改进后的编码器自己也用于计算全局视图的CLS表示,使后续学习目标更难。\n不追赶固定教师,而是通过学习达成逐步高级的目标变得重要。\n关于丢弃大部分patch反而得到较好表示(至少利于分类)的现象,论文解释为增强,但可能还有更深的原理或理论解释。\n此研究有几方面发展可能。\n一是LeVJEPA仅对CLS表示施加直接损失,但patch表示已出现物体区域等结构;因此除片段级匹配外,还可添加不同视图间对应patch的局部匹配目标,尤其对分割、跟踪等密集任务重要。\n二是视频效果如此好,其他序列数据或许也能采用类似思想。\n例如语言方面,从相同内容生成不同视图并匹配其表示的自监督学习已有大量研究。\n在这种趋势下,或许可以像“胡萝卜挂马前”一样,随着学习推进潜在表示目标也自动升级,形成自驱式高级学习设置。