Yann LeCun评论LeJEPA论文,对比小模型性能
在最近的SSL/JEPA讨论中,我意识到我还没读过LeJEPA论文……绝对值得一读!
有趣的是,他们在许多小型timm模型上进行了实验,有些还相当冷门(不错)。这张图立刻让我注意到,如果根据激活计数(而非FLOPs)重新绘制,那些小ResNet会明显高于其他。pico-nano maxvit的激活计数是ResNet 14-26的5-6倍,因此慢得多。
所以我想知道,在扩展模型实验中,一个“大型”ResNet或RegNet与ViT或ConvNeXt相比如何?ResNet在小数据规模上的优势是否会随着数据增加而消失(正如许多其他任务那样)?注意,我们还没有达到显著的数据规模。
有趣的是,他们在许多小型timm模型上进行了实验,有些还相当冷门(不错)。这张图立刻让我注意到,如果根据激活计数(而非FLOPs)重新绘制,那些小ResNet会明显高于其他。pico-nano maxvit的激活计数是ResNet 14-26的5-6倍,因此慢得多。
所以我想知道,在扩展模型实验中,一个“大型”ResNet或RegNet与ViT或ConvNeXt相比如何?ResNet在小数据规模上的优势是否会随着数据增加而消失(正如许多其他任务那样)?注意,我们还没有达到显著的数据规模。