Yann LeCun详解JEPA系列模型
让我们把这份清单拆解开,使其真正有用:
• JEPA / H-JEPA:避免预测每个像素(成本太高),而是在潜在空间中进行预测。H-JEPA增加了层次结构——短期细节与长期规划,即人类实际学习的方式。
• I-JEPA:专为高效视觉模型构建。掩码图像块并预测语义,从而绕过了传统自动编码器的高计算量。
• MC-JEPA 和 V-JEPA:两者都是为视频构建的。MC-JEPA分离内容(对象是什么)与运动(如何移动)。V-JEPA掩码视频特征,无需文本标签,非常适合大规模动作追踪。
• Audio-JEPA:通过将声音视为视觉来过滤背景噪声。
• Point-JEPA 和 3D-JEPA:主要用于自动驾驶车辆。使用LiDAR点云和体素网格。
• ACT-JEPA:过滤现实世界噪声,通过模仿学习高效学习操作任务。
• V-JEPA 2:预测动作发生前将导致的未来物理状态。
• LeJEPA:用基于能量的模型(EBM)替代掩码等技术,从数学上防止“特征崩溃”,并确保模型随数据增加可靠扩展。
• Causal-JEPA:通过应用对象级掩码学习真实的因果物理。
• V-JEPA 2.1:非常适合空间定位,因为它结合了跨图像和视频的密集预测损失。
• LeWorldModel:直接基于LeJEPA的数学构建,但超级紧凑——1500万参数。
• ThinkJEPA:使用密集物理预测与VLM推理。最适合需要长期策略的场景。
• JEPA / H-JEPA:避免预测每个像素(成本太高),而是在潜在空间中进行预测。H-JEPA增加了层次结构——短期细节与长期规划,即人类实际学习的方式。
• I-JEPA:专为高效视觉模型构建。掩码图像块并预测语义,从而绕过了传统自动编码器的高计算量。
• MC-JEPA 和 V-JEPA:两者都是为视频构建的。MC-JEPA分离内容(对象是什么)与运动(如何移动)。V-JEPA掩码视频特征,无需文本标签,非常适合大规模动作追踪。
• Audio-JEPA:通过将声音视为视觉来过滤背景噪声。
• Point-JEPA 和 3D-JEPA:主要用于自动驾驶车辆。使用LiDAR点云和体素网格。
• ACT-JEPA:过滤现实世界噪声,通过模仿学习高效学习操作任务。
• V-JEPA 2:预测动作发生前将导致的未来物理状态。
• LeJEPA:用基于能量的模型(EBM)替代掩码等技术,从数学上防止“特征崩溃”,并确保模型随数据增加可靠扩展。
• Causal-JEPA:通过应用对象级掩码学习真实的因果物理。
• V-JEPA 2.1:非常适合空间定位,因为它结合了跨图像和视频的密集预测损失。
• LeWorldModel:直接基于LeJEPA的数学构建,但超级紧凑——1500万参数。
• ThinkJEPA:使用密集物理预测与VLM推理。最适合需要长期策略的场景。
14种最重要且最有影响力的JEPA类型
▪️ JEPA / H-JEPA
▪️ I-JEPA
▪️ MC-JEPA
▪️ V-JEPA
▪️ Audio-JEPA
▪️ Point-JEPA
▪️ 3D-JEPA
▪️ ACT-JEPA
▪️ V-JEPA 2
▪️ LeJEPA
▪️ Causal-JEPA
▪️ V-JEPA 2.1
▪️ LeWorldModel
▪️ ThinkJEPA
保存此列表并查看以下链接探索它们 https://t.co/zxoBA784xo