动态

视觉SSL模型缩放至7B参数可在VQA任务上匹配CLIP

NYU Center for Data Science
CDS教授@ylecun和CDS附属助理教授@sainingxie表明,视觉自监督模型在扩展到7B参数并在2B图像上训练后,可以在VQA任务上匹配或超越CLIP——无需任何语言监督。阅读论文:
动态NYU Center for Data Science2025-06-11原文

相关内容