YOLO系列算法改进 | 主干改进篇 | 替换WTConvNeXt小波变换卷积网络 | 凭借小波变换的多频感知能力,提升运动模糊、噪声等图像下目标检测性能 | ECCV 2024
0. 前言
本文介绍了WTConvNeXt网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。WTConvNeXt通过小波变换级联分解,用对数级参数实现指数级感受野增长,破解了大核卷积参数爆炸与性能饱和的困局。将其作为YOLO的backbone,让YOLO在自动驾驶等安全关键场景中,凭借小波变换的多频感知能力,以对数级参数实现全局感受野,大幅提升对运动模糊、噪声等图像损坏的鲁棒性。
专栏链接:YOLO系列算法改进专栏链接
专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!
目录
0. 前言
1. WTConvNeXt网络简介
2. WTConvNeXt网络原理与创新点
🧠 WTConvNeXt网络基本原理
🎯 WTConvNeXt网络创新点
3. 具体改进步骤
🍀🍀步骤1:创建WTConvNeXt.py文件
🍀🍀步骤2:tasks.py文件修改
⚡1. WTConvNeXt网络导入
⚡2. DecoupleNet网络注册
⚡3. 其他修改1(Ctrl+F搜索定位一下)
⚡4. 其他修改2(Ctrl+F搜索定位一下)
⚡5. 其他修改3(_predict_once函数修改)
🍀🍀步骤3:创建YAML配置文件
🍀🍀步骤4:新建train.py文件训练模型
🍀🍀步骤5:模型结构打印结果
1. WTConvNeXt网络简介
近年来,研究人员试图增加卷积神经网络的内核大小,以模仿视觉Transformer自注意力块的全局感受野。然而,这种方法很快遇到了上限,并在达到全局感受野之前就饱和了。在这项工作中,我们证明通过利用小波变换,实际上可以获得非常大的感受野,而不会遭受过度参数化的问题——例如,对于一个k×k的感受野,所提出方法的可训练参数数量仅随k对数增长。所提出的名为WTConv的层可以作为现有架构中的即插即用替换,实现有效的多频响应,并随感受野大小优雅地扩展。我们在ConvNeXt和MobileNetV2架构中展示了WTConv层在图像分类以及下游任务骨干网络上的有效性,并证明它带来了额外的特性,如图像损坏的鲁棒性和对形状而非纹理的响应增强。
原始论文:2407.05848
原始代码:
