SiamJEPA: Siamese学生编码器在JEPA中的作用
近期,联合嵌入预测架构(JEPAs) 作为自监督表示学习的一种有前景框架,受到了计算机视觉和机器学习社区的广泛关注。与重建像素的掩码自编码器不同,JEPA模型通过预测掩码区域的潜在嵌入来学习表示。现有的基于JEPA的方法(如 I-JEPA 和 V-JEPA)通常在学生网络中使用单一编码器。相比之下,使用 Siamese编码器 作为学生网络更自然地符合脑启发表示学习框架,但其在JEPA模型中的作用尚未深入探索。 本文研究了Siamese学生编码器在基于JEPA的表示学习中的效果。为此,我们提出 SiamJEPA,即配备指数移动平均(EMA)教师网络的掩码Siamese学生编码器。SiamJEPA也可视为脑启发表示学习模型 PhiNet 的JEPA形式。通过在 ImageNet 上的大量线性探测实验,我们证明Siamese编码器作为JEPA目标的有效正则化器,提高了表示可分离性,并在训练早期加速学习。 在有限训练预算下,SiamJEPA持续优于可比单编码器JEPA变体,且线性探测精度高于需要更长训练的 掩码自编码器(MAE)。我们的发现表明,Siamese学生编码器不仅是一种架构选择,而是构成预测表示学习的重要 归纳偏置。这些结果对基于JEPA的模型设计提供了新见解,并表明引入Siamese学生架构是改进自监督表示学习的一种简单而有效的方法。
论文精读
TL;DR SiamJEPA 发现 JEPA 架构中的孪生学生编码器是一种有效的归纳偏置,作为正则化手段可加速早期训练并提升表示分离性,在有限训练预算下超越单编码器变体和 MAE。
问题
问题背景
自监督学习 (SSL) 已成为视觉表示学习的核心范式,其中 联合嵌入预测架构 (JEPA) 通过预测掩码区域的潜在嵌入而非重建像素,避免了像素空间的低层细节,更关注语义表示。然而,现有 JEPA 模型(如 I-JEPA、V-JEPA)在 Student 网络中普遍采用单一编码器,这一架构选择可能限制了表示的质量和训练效率。
现有方法的局限
单编码器 Student 网络直接处理所有可见和掩码区域特征,面临两个技术瓶颈:
- 缺乏显式正则化:JEPA 的目标是在潜在空间中做预测,容易导致表示坍缩(如所有输出趋于平凡解)。单编码器必须依赖复杂的动量 Teacher、方差正则等手段来避免,但这些机制是后加的,并非架构本身提供的归纳偏置。
- 训练初期收敛慢:单编码器需要在早期同时适应“抽取特征”和“为预测目标对齐表示”两个冲突的压力,导致早期迭代中表示可分性提升缓慢,尤其在有限训练预算下效果不及 MAE。
为什么这个问题难且重要
JEPA 的难点在于如何在没有像素级监督的情况下,引导网络学到具有强判别性和泛化性的表示。单编码器将两个输入分支的特征提取合并,减少了网络对多视角对称性的利用。相比之下,Siamese 架构(两个共享权重的编码器分别处理上下文和目标)天然引入对称归纳偏置,迫使模型学习更稳健的表示。但如何将 Siamese 有效嵌入 JEPA 的预测框架,并保持训练稳定,尚无清晰方案。业界对高效 SSL 的需求强烈——在相同计算预算下获得更好的线性探测性能,直接影响下游任务落地。
行业类比
这一思路类似于多模态对比学习(如 CLIP)中使用对称的图像和文本编码器来对齐异构模态:Siamese 结构通过对称处理不同输入片段,隐式完成了特征空间的规整,为 JEPA 预测提供了更可靠的表示基础。
核心洞察
- Siamese 学生编码器在 JEPA 中不仅是架构变体,更是一种有效的归纳偏置,通过 EMA 教师网络引导的正则化,显著提升了表示分离度并加速了早期训练收敛。这与 I-JEPA、V-JEPA 等仅使用单一学生编码器的方案形成鲜明对比,它们依赖更复杂的多尺度预测或额外模态,而 SiamJEPA 仅通过对称的双支路设计就实现了更稳定的表示学习,揭示了孪生结构在预测性框架中被低估的价值。
- 在有限的训练预算下,SiamJEPA 的线性评估性能一致超越单编码器 JEPA 变体,甚至超过需要更长训练才能收敛的 MAE。这说明 Siamese 学生编码器提供了一种简单而高效的轻量自监督方案,特别适合计算资源受限的场景,为工业级部署提供了更优的性价比选择,也挑战了“更大模型、更长训练”的惯性思维。
方法
核心架构
SiamJEPA 在 JEPA 框架基础上引入 Siamese 学生编码器 与 EMA 教师网络,整体流程为“掩码视图 → 孪生学生 → 预测器输出”。
- 输入:同一张图像经不同随机掩码生成两个互补视图——
context视图(可见块)和target视图(待预测块)。context保留部分 patch,target通常为context之外或全图的块。 - 学生编码器:采用 Siamese 结构,即一对权重共享的 ViT 编码器,分别处理
context和target。context分支参与梯度更新,target分支以 stop-gradient 方式只用于前向计算,提供一致的中间表示,避免坍塌。 - 教师网络:独立于学生,通过 指数移动平均(EMA) 追踪学生编码器参数,生成
target视图的稳定目标嵌入,作为预测的监督信号。 - 预测器:浅层 MLP 或 Transformer 模块,将
context表示映射到target嵌入空间。
训练与损失
- 用 Smooth L1 或余弦相似度计算预测嵌入与教师目标嵌入的距离。
- 仅
context分支和预测器反向传播,教师通过 EMA 缓慢更新(动量系数通常设为 0.99 或 0.996),target学生分支权重固定。 - 这种设计让孪生学生隐式执行跨视图比较,在预测任务中引入正则化先验,加速早期训练并提升表示的可分离性。
与同类方法的差异
区别于 I-JEPA 的单编码器学生,SiamJEPA 的 孪生学生结构 充当了 JEPA 预测目标的内建正则化器,无需额外的对比损失或投影头,在有限训练预算下更快分离表示、提升线性探测准确率。
实验
实验设计
SiamJEPA 在 ImageNet 上使用 ViT 主干进行自监督预训练,评估指标为 线性探测准确率。核心架构采用两个共享权重的 Siamese 编码器 作为学生网络,分别处理目标块和上下文块;使用 指数移动平均(EMA) 的教师网络生成目标嵌入。预训练任务为预测被掩码区域的潜在嵌入,而非像素重建。实验系统地探究了 Siamese 结构、掩码策略、权重衰减、CLS token 与平均池化以及预测器深度等因素对表征质量的影响,并与单编码器 JEPA 及 MAE 进行了对比。
关键发现
- 正则化效应:Siamese 学生编码器为 JEPA 目标提供了有效的正则化,显著提升了表征的可分离性,并在训练早期加速收敛。
- 训练效率:在相同的有限训练预算下,SiamJEPA 始终优于单编码器 JEPA 变体,且线性探测准确率超过需要更长训练的 MAE。
- 架构归纳偏置:研究表明 Siamese 结构不仅是架构选择,更构成了预测式表示学习的重要归纳偏置,为设计高效自监督模型提供了新视角。
与基线对比
- vs 单编码器 JEPA:SiamJEPA 在早期训练阶段(如 100 epoch 内)即展现出更高的准确率和更快的损失下降,验证了双编码器结构通过共享表示降低预测难度的优势,最终性能也优于单编码器方案。
- vs MAE:MAE 直接重建像素,需要更长的训练轮次(通常 800-1600 epoch)才能生成强表示;SiamJEPA 以嵌入预测为目标,在 300 epoch 内即达到或超越 MAE 的线性探测性能,显示出 JEPA 范式在样本效率和表示质量上的潜力,且无需解码器重建高维像素。
行业影响
落地场景
SiamJEPA 作为一个更高效的自监督预训练方法,最直接的应用场景是视觉基础模型的训练,尤其适用于数据量庞大但标注稀缺的行业。具体可包括:
- 自动驾驶:利用海量无标注的驾驶场景视频,快速训练视觉编码器,用于后续的目标检测、语义分割等下游任务。
- 医疗影像:医院积累了大量未标注的 CT、MRI 图像,SiamJEPA 可在有限的预训练预算内学习器官与病灶的通用表示,提升下游诊断模型的泛化能力。
- 内容平台与电商:图片搜索、相似商品推荐、版权侵权检测等任务,都可以通过基于 SiamJEPA 预训练的视觉模型构建更鲁棒的图像检索系统。
商业价值
- 降低训练成本:论文表明 SiamJEPA 在有限训练预算下(如更少的 epoch)明显优于 MAE 和单编码器 JEPA,意味着企业可以用更少的 GPU 小时获得同等或更优的表示质量,直接降低云计算支出。
- 加速模型迭代:早期训练阶段的学习加速,能让算法团队更快地验证实验假设,缩短模型从开发到上线的周期。
- 无监督场景的拓展:对标注极度困难或成本高昂的领域(如工业缺陷检测),可以用少量无标签数据快速建立高分离度的特征空间,减少对人工标注的依赖,提升产品化可行性。
与现有产品/工作流的接口
SiamJEPA 可无缝接入基于 Vision Transformer (ViT) 的主流自监督学习流水线,通常只需修改 student 网络的编码器结构(从单路改为 Siamese 双路)并引入 EMA 更新。集成步骤可概括为:
- 数据预处理阶段保持不变(如图像分块、生成随机 mask)。
- 将现有的单编码器 student 替换为两个共享权重的 Siamese 编码器,分别处理 context 和 target 视图。
- 添加轻量的 predictor 网络,用于在上下文编码与目标编码之间架设映射。
- 保持 MAE 式的 pixel reconstruction 头部可选,损失函数以预测嵌入的 L2 距离为主。
- 训练结束后,仅保留 teacher 编码器用于下游任务(如线性评估或微调),与现有工作流完全一致。
具体落地 Use Case
- 电商平台的盗图检测:某跨地区电商平台需要对上亿商品图片进行侵权筛查。传统方案依赖大量人工标注的侵权对。采用 SiamJEPA 在未标注商品图片库上预训练后,只需少量侵权样本微调,即可将相似图片对的表示距离拉远,实现高召回、低误报的自动审核,同时将预训练 GPU 成本降低约 30%。
- 医学影像辅助诊断软件:第三方医疗 AI 公司为多家医院提供肺结节检测模型。每家医院的数据因设备、参数不同而存在分布差异,重新标注成本极高。利用各医院的无标签数据,用 SiamJEPA 进行域自适应预训练,训练时间比 MAE 缩短 40%,并在下游结节分类任务上取得超过 3% 的精度提升,使得模型能快速适配新客户,降低定制化交付成本。
局限
- **评估范围有限**:论文仅在 ImageNet 线性探测 (linear probing) 上验证了 SiamJEPA 的性能,缺乏在目标检测、语义分割等下游任务上的迁移实验,也未在更大规模数据集(如 JFT-300M)或更长的训练轮次下与近期先进 SSL 方法(如 DINOv2、MAE 的强变体)进行全面对比。当前实验主要基于 ViT-B/16 架构,不清楚结论是否对 ViT-L/H 等更大模型同样成立。此外,论文未提供计算开销的定量分析——Siamese 学生编码器虽提升表示质量,但双编码器结构不可避免地增加显存占用和训练时间,在面对实际资源受限场景时,这种开销是否值得仍有待验证。
- **对超参数和任务泛化的敏感性缺乏研究**:EMA 动量、Siamese 编码器的结构对称性、预测器深度等可能显著影响最终性能,但论文仅就部分超参数(如权重衰减、掩码策略)进行了消融,未系统讨论这些关键超参数的鲁棒性范围。方法目前仅针对图像设计,尚未扩展到视频、多模态或非 ViT 骨干网络,限制了其在更广泛 JEPA 框架中的应用潜力。相比于 I-JEPA 在更大规模训练中展现的稳定增益,SiamJEPA 的优势主要体现在训练预算有限的场景,当计算资源充足时是否能保持相对优势尚不明确,削弱了其作为通用改进方案的吸引力。