Yann LeCun与Saining Xie合作研究多模态预训练
Yann LeCun 🤝 Saining Xie
AI领域两大视觉表示研究者的疯狂交叉
“超越语言建模:多模态预训练的探索”
目前,大多数多模态模型本质上是一个语言模型加上视觉适配器,因此它们可以描述图像,但并不能真正以图像或视频的方式思考。
这篇论文展示了当你以困难的方式做这件事时会发生什么:在文本、图像和视频上从头开始训练一个模型,采用统一的设置。
关键思想是,如果你给模型一个好的视觉内部格式,它就可以利用视觉进行理解和生成。
此外,多模态数据可以改善语言而不是分散注意力,而专家混合(MoE)让你扩展视觉的巨大数据输入,而不会膨胀其他所有部分。
这为将视觉范式从“字幕附加”模型转变为原生多模态基础模型铺平了道路。
AI领域两大视觉表示研究者的疯狂交叉
“超越语言建模:多模态预训练的探索”
目前,大多数多模态模型本质上是一个语言模型加上视觉适配器,因此它们可以描述图像,但并不能真正以图像或视频的方式思考。
这篇论文展示了当你以困难的方式做这件事时会发生什么:在文本、图像和视频上从头开始训练一个模型,采用统一的设置。
关键思想是,如果你给模型一个好的视觉内部格式,它就可以利用视觉进行理解和生成。
此外,多模态数据可以改善语言而不是分散注意力,而专家混合(MoE)让你扩展视觉的巨大数据输入,而不会膨胀其他所有部分。
这为将视觉范式从“字幕附加”模型转变为原生多模态基础模型铺平了道路。