动态

Yann LeCun团队推出VL-JEPA,高效实时视觉语言模型。

Yann LeCun团队推出VL-JEPA,高效实时视觉语言模型。
Pascale Fung
介绍VL-JEPA:视觉语言联合嵌入预测架构,用于流媒体、实时动作识别、检索、VQA和分类任务,性能优于大型VLM且效率更高。

• VL-JEPA是首个基于联合嵌入预测架构、能实时执行通用视觉语言而非生成式模型。
• 控制实验表明,通过潜在空间嵌入预测训练的VL-JEPA优于依赖数据空间token预测的VLM。
• 因其非自回归设计和原生支持选择性解码,VL-JEPA在在线视频流应用中相比VLM显著提升效率。
• 统一模型架构可同时有效处理分类、检索和VQA等多种任务。

作者:@Delong0_0 @MustafaShukor1 @TheoMoutakanni @willyhcchung Jade Lei Yu Tejaswi Kasarla @AllenBolourchi @ylecun @pascalefung

https://arxiv.org/abs/2512.10942
动态Pascale Fung2025-12-15原文

相关内容