新论文Bootleg:通过隐藏层自蒸馏提升自监督表示
新论文:"隐藏层的自蒸馏用于自监督表示学习"
我们提出 Bootleg——对 I-JEPA/MAE 的简单改进,显著提升了自监督表示。
思想:MAE 预测像素(稳定但低级)。I-JEPA 预测最终层嵌入(高级但不稳定)。Bootleg 通过同时预测教师网络多个隐藏层(早期、中期和晚期)的表示来弥合两者。
为何有效:早期层提供刺激驱动的接地,防止崩溃;深层提供语义目标;通过掩码补丁压缩所有抽象级别的信息瓶颈迫使编码器构建更丰富的表示。
该方法在 I-JEPA 基础上相当简单:从均匀间隔的块中提取目标,z-score 归一化并拼接,加宽预测器的最后一层。仅此而已。
冻结探针结果(无微调):
ImageNet-1K:76.7% 使用 ViT-B(比 I-JEPA 和 MAE 高 10 个百分点)
iNaturalist-21:58.3% 使用 ViT-B(比 I-JEPA 高 17 个百分点,比 MAE 高 15 个百分点)
ADE20K 分割:30.9% mIoU 使用 ViT-B(比 I-JEPA 高 11 个百分点,比 MAE 高 6 个百分点)
Cityscapes 分割:35.9% mIoU 使用 ViT-B(比 I-JEPA 高 11 个百分点,比 MAE 高 5 个百分点)
增益在 ViT-S、ViT-B 和 ViT-L 上保持一致。
单视图,批量大小无关——无增强堆叠、无多裁剪、无对比损失、无大计算需求。
我们的研究仅针对图像,但此更改可轻松部署到所有领域的 MAE 和 JEPA 模型。
https://t.co/PXJlRV4I6w
我们提出 Bootleg——对 I-JEPA/MAE 的简单改进,显著提升了自监督表示。
思想:MAE 预测像素(稳定但低级)。I-JEPA 预测最终层嵌入(高级但不稳定)。Bootleg 通过同时预测教师网络多个隐藏层(早期、中期和晚期)的表示来弥合两者。
为何有效:早期层提供刺激驱动的接地,防止崩溃;深层提供语义目标;通过掩码补丁压缩所有抽象级别的信息瓶颈迫使编码器构建更丰富的表示。
该方法在 I-JEPA 基础上相当简单:从均匀间隔的块中提取目标,z-score 归一化并拼接,加宽预测器的最后一层。仅此而已。
冻结探针结果(无微调):
ImageNet-1K:76.7% 使用 ViT-B(比 I-JEPA 和 MAE 高 10 个百分点)
iNaturalist-21:58.3% 使用 ViT-B(比 I-JEPA 高 17 个百分点,比 MAE 高 15 个百分点)
ADE20K 分割:30.9% mIoU 使用 ViT-B(比 I-JEPA 高 11 个百分点,比 MAE 高 6 个百分点)
Cityscapes 分割:35.9% mIoU 使用 ViT-B(比 I-JEPA 高 11 个百分点,比 MAE 高 5 个百分点)
增益在 ViT-S、ViT-B 和 ViT-L 上保持一致。
单视图,批量大小无关——无增强堆叠、无多裁剪、无对比损失、无大计算需求。
我们的研究仅针对图像,但此更改可轻松部署到所有领域的 MAE 和 JEPA 模型。
https://t.co/PXJlRV4I6w