V-JEPA 2.1:视频自监督学习密集特征,提升动作预测和抓取成功率
V-JEPA 2.1:解锁视频自监督学习中的密集特征
作者解释:
https://t.co/Rg7VypVYEy
概述:
V-JEPA 2.1 集成了密集预测损失、分层自监督和多模态分词器,以学习图像和视频的结构化时空表示。
该架构在动作预期和机器人抓取方面提升了性能,相比先前迭代成功率提高了20个百分点。
该方法扩展模型容量和数据,在Ego4D、EPIC-KITCHENS和TartanDrive基准上取得了最先进的结果。
论文:
https://t.co/NyBRij543e
作者解释:
https://t.co/Rg7VypVYEy
概述:
V-JEPA 2.1 集成了密集预测损失、分层自监督和多模态分词器,以学习图像和视频的结构化时空表示。
该架构在动作预期和机器人抓取方面提升了性能,相比先前迭代成功率提高了20个百分点。
该方法扩展模型容量和数据,在Ego4D、EPIC-KITCHENS和TartanDrive基准上取得了最先进的结果。
论文:
https://t.co/NyBRij543e
我很高兴分享我在FAIR(Meta)实习的成果:V-JEPA 2.1:与 @ylecun @AdrienBardes 一起解锁视频自监督学习中的密集特征
我们的方法从视频中学习密集、空间连贯的特征,同时保持强大的全局理解 https://t.co/NVh5CZAGfZ