改进YOLO系列 | YOLOv5 更换骨干网络之 ConvNeXt

纯卷积神经网络超越Swin Transformer

在这里插入图片描述

论文地址：https://arxiv.org/pdf/2201.03545.pdf
代码地址：https://github.com/facebookresearch/ConvNeXt

视觉识别的“Roaring 20年代”始于视觉变换器（ViTs）的引入，它很快取代了ConvNets，成为最先进的图像分类模型。另一方面，普通ViTs在应用于一般的计算机视觉任务（如目标检测和语义分割）时面临困难。正是层次变换器（例如，Swin变换器）重新引入了几个ConvNet Prior，才使得Transformers作为一个通用的视觉骨干网络切实可行，并在各种视觉任务中表现出卓越的性能。然而，这种混合方法的有效性在很大程度上仍然归功于Transformer的固有优势，而不是卷积固有的归纳偏置。在这项工作中，我们重新审视了设计空间，并测试了纯ConvNet所能达到的极限。我们将一个标准的ResNet逐步“现代化”，使其朝着视觉Transformer的设计

标签：深度学习 python 人工智能

本文转载自: https://blog.csdn.net/weixin_43694096/article/details/128671629
版权归原作者 迪菲赫尔曼 所有，如有侵权，请联系我们删除。

改进YOLO系列 | YOLOv5 更换骨干网络之 ConvNeXt

纯卷积神经网络超越Swin Transformer

发表评论

“改进YOLO系列 | YOLOv5 更换骨干网络之 ConvNeXt”的评论:

关于作者

overfit同步小助手

相关阅读

文章导航