研究显示纯CNN经优化可匹敌Transformer,速度更快
在2010年代的大部分时间里,卷积神经网络(ConvNet)——通过滑动小滤波器检测模式来处理图像的网络——是计算机视觉的主导架构。然后Transformer出现了。
Transformer最初为文本设计,通过让每个元素同时关注其他所有元素来处理输入,当适应图像时,它们开始在各项基准测试中超越ConvNet。普遍共识变成Transformer更好,ConvNet是过时的方法。
这篇论文的作者决定测试这个结论是否合理,或者ConvNet是否只是在训练方法和设计选择上落后,而非根本能力不足。
他们选取一个标准ResNet,逐步进行系统性更新——每次只做一个改变——借鉴Transformer的设计决策:比如使用哪种激活函数、应用哪种归一化、以及如何重塑每个处理块的内部维度。
每个改变都很小且可解释,论文跟踪每一步的精度,让你确切看到每个决策的贡献。
最终结果是一个纯ConvNet,在图像分类、目标检测和分割上匹配或超越同等规模的基于Transformer的模型,速度提升高达49%。
与AI导师一起阅读:
https://chapterpal.com/s/07691bb9/a-convnet-for-the-2020s
…
独自阅读:
https://arxiv.org/pdf/2201.03545
Transformer最初为文本设计,通过让每个元素同时关注其他所有元素来处理输入,当适应图像时,它们开始在各项基准测试中超越ConvNet。普遍共识变成Transformer更好,ConvNet是过时的方法。
这篇论文的作者决定测试这个结论是否合理,或者ConvNet是否只是在训练方法和设计选择上落后,而非根本能力不足。
他们选取一个标准ResNet,逐步进行系统性更新——每次只做一个改变——借鉴Transformer的设计决策:比如使用哪种激活函数、应用哪种归一化、以及如何重塑每个处理块的内部维度。
每个改变都很小且可解释,论文跟踪每一步的精度,让你确切看到每个决策的贡献。
最终结果是一个纯ConvNet,在图像分类、目标检测和分割上匹配或超越同等规模的基于Transformer的模型,速度提升高达49%。
与AI导师一起阅读:
https://chapterpal.com/s/07691bb9/a-convnet-for-the-2020s
…
独自阅读:
https://arxiv.org/pdf/2201.03545