Yann LeCun团队发布V-JEPA 2.1论文,改进视频自监督学习
Yann LeCun和他的团队又发表了一篇新论文!
"V-JEPA 2.1:解锁视频自监督学习中的密集特征"
在这个V-JEPA升级版中,他们展示了如果让视频模型预测每个补丁(不仅仅是掩码补丁)并且在多个层上进行预测,模型就能将模糊的场景理解转化为密集且时间稳定的特征,从而真正理解"什么在哪里"。
这一关键洞察推动了分割、深度、预测乃至机器人规划方面的改进。
"V-JEPA 2.1:解锁视频自监督学习中的密集特征"
在这个V-JEPA升级版中,他们展示了如果让视频模型预测每个补丁(不仅仅是掩码补丁)并且在多个层上进行预测,模型就能将模糊的场景理解转化为密集且时间稳定的特征,从而真正理解"什么在哪里"。
这一关键洞察推动了分割、深度、预测乃至机器人规划方面的改进。