当前位置: 首页 > news >正文

YOLO系列算法改进 | 主干改进篇 | 替换MobileViGv2可缩放图卷积网络 | 助力模型复杂场景下精细区分目标和理解空间关系 | CVPR 2024

0. 前言

本文介绍了MobileViGv2网络,并将其集成到ultralytics最新发布的YOLO26目标检测算法中,替换原有Backbone网络。MobileViGv2的创新在于将图卷积的稀疏性与位置编码的空间感知能力相结合,通过固定连接数设计解决了前代模型的扩展性问题,使CNN-GNN混合架构在移动端设备的性能达到甚至超越最先进的CNN-ViT模型。将其作为YOLO的backbone,将使目标检测在保持毫秒级推理延迟的同时,获得图神经网络强大的关系建模能力,特别适合需要在移动端实时运行、同时面临密集遮挡和小目标检测挑战的应用场景。

专栏链接:YOLO系列算法改进专栏链接

专栏文章:YOLO26改进系列 | 卷积篇、轻量化、注意力、损失函数、Backbone、SPPF、C2PSA、Neck、检测头全方面保姆级优化合集 | 同样适配YOLOv11改进!!!

目录

0. 前言

1. MobileViGv2网络简介

2. MobileViGv2网络原理与创新点

🧠 MobileViGv2网络基本原理

🎯 MobileViGv2网络创新点

3. 具体改进步骤

🍀🍀步骤1:创建MobileViGv2.py文件

🍀🍀步骤2:tasks.py文件修改

⚡1. MobileViGv2网络导入

⚡2. MobileViGv2网络注册

⚡3. 其他修改1(Ctrl+F搜索定位一下)

⚡4. 其他修改2(Ctrl+F搜索定位一下)

⚡5. 其他修改3(_predict_once函数修改)

🍀🍀步骤3:创建YAML配置文件

🍀🍀步骤4:新建train.py文件训练模型

🍀🍀步骤5:模型结构打印结果


1. MobileViGv2网络简介

为了与现有的移动端架构竞争,MobileViG引入了稀疏视觉图注意力——一种基于图神经网络原理的快速令牌混合算子。然而,MobileViG随着模型尺寸的扩大扩展性较差,与相似延迟的模型相比最多落后1%。本文介绍了移动图卷积,一种新的视觉图神经网络模块,解决了这一扩展问题。我们提出的移动视觉架构MobileViGv2使用MGC来证明我们方法的有效性。MGC通过增加图稀疏性并将条件位置编码引入图操作,改进了SVGA。我们的最小模型MobileViGv2-Ti在ImageNet-1K上达到了77.7%的top-1准确率,比MobileViG-Ti高出2%,在iPhone 13 Mini NPU上推理延迟为0.9毫秒。我们的最大模型MobileViGv2-B达到了83.4%的top-1准确率,比MobileViG-B高出0.8%,推理延迟为2.7毫秒。除了图像分类,我们还展示了MobileViGv2对其他任务的良好泛化能力。在MS COCO 2017的目标检测和实例分割任务中,MobileViGv2-M比MobileViG-M高出1.2 APbox和0.7 APmask,MobileViGv2-B比MobileViG-B高出1.0 APbox和0.7 APmask。在ADE20K的语义分割任务中,MobileViGv2-M达到了42.9%的mIoU,MobileViGv2-

http://www.cnnetsun.cn/news/1336867.html

相关文章:

  • 让照片活起来:Image-to-Video图像转视频生成器实战体验
  • Cosmos-Reason1-7B实战案例:教育AI助手解析物理实验视频并生成考题
  • Phi-3-vision-128k-instruct镜像免配置:Docker一键拉起+Chainlit前端自动对接
  • 2026企业级攻防实战全解析:从攻击链路到防御体系(附应急响应指南)
  • 基于STM32的NES游戏硬件扩展板设计
  • 电容感应式烙铁自动清洁器设计与实现
  • STM32F103C8循迹小车实战:IO口模式选择与PWM调参避坑指南
  • 【ROS2】从零开始构建你的第一个ROS2节点:基于RCLPY的实战指南
  • GD32VW553开发板I2C驱动SHT20温湿度传感器移植实战
  • 阿里云DataWorks:一站式大数据开发治理平台全景解析
  • Qwen2-VL-2B-Instruct在Unity游戏开发中的应用:智能NPC视觉感知系统
  • 3个强力方案解决Blender 3MF文件处理难题:Blender3mfFormat解决方案
  • Ubuntu服务器磁盘爆满?Ncdu命令行神器5分钟帮你找出空间黑洞
  • 从DAGGER到DAD:模仿学习中的数据聚合技术演进与最新应用案例
  • Python+Ollama构建本地AI文档分析流水线:从PDF智能解析到结构化Excel输出
  • ZYNQ SD卡驱动与FATFS文件系统实战:从硬件配置到数据读写
  • 重构C/C++开发效率:Red Panda Dev-CPP的技术突破与实践指南
  • HY-Motion 1.0部署指南:两种规格模型,如何根据显存选择?
  • 开箱即用:Hunyuan-MT 7B翻译镜像,原文输入→一键翻译→实时展示
  • Android逆向实战:用Frida-DexDump轻松脱壳(附详细命令解析)
  • Qwen3-14B部署避坑指南:vLLM日志分析、模型加载失败排查与修复方案
  • 梦幻动漫魔法工坊场景实战:一键生成洛丽塔风格壁纸
  • 特征提取新思路:为什么D2-Net在弱纹理场景下比传统方法更鲁棒?
  • Windows窗口置顶完全指南:告别多任务切换烦恼
  • Realistic Vision V5.1写实人像生成实战:为独立音乐人定制专辑封面人物
  • 实战指南:利用CapSolver高效突破Cloudflare Turnstile验证码防护
  • tao-8k性能实测:Xinference部署,8K上下文处理速度惊人
  • FeroxBuster实战指南:从基础扫描到高级配置的完整解析
  • Phi-3-vision-128k-instruct部署教程:国产昇腾910B平台ACL适配与性能调优
  • Qwen3-32B医疗问答系统:医学知识图谱与自然语言处理