Yann LeCun探讨多模态预训练中视觉优先的设计空间。
[1/9] 当你在多模态预训练中将视觉视为一等公民时会发生什么?为了找出答案,我们研究了从头训练输入和输出所有模态的Transfusion风格模型的设计空间。以下是我们关于视觉表示、数据、世界建模、架构和缩放行为所学到的内容!
论文:
https://arxiv.org/abs/2603.03276
网站:
https://beyond-llms.github.io
@TongPetersb, @DavidJFan, @__JohnNguyen__, @ellisbrown, @GaoyueZhou, @JasonQSY, @boyangzheng, @webalorn, @han_junlin, @rob_fergus, @NailaMurray, @gh_marjan, @ml_perception, Nicolas Ballas, @_amirbar, Michael Rabbat, Jakob Verbeek, @LukeZettlemoyer, @koustuvsinha, @ylecun, @sainingxie
论文:
https://arxiv.org/abs/2603.03276
网站:
https://beyond-llms.github.io
@TongPetersb, @DavidJFan, @__JohnNguyen__, @ellisbrown, @GaoyueZhou, @JasonQSY, @boyangzheng, @webalorn, @han_junlin, @rob_fergus, @NailaMurray, @gh_marjan, @ml_perception, Nicolas Ballas, @_amirbar, Michael Rabbat, Jakob Verbeek, @LukeZettlemoyer, @koustuvsinha, @ylecun, @sainingxie