ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

YOLOv13改进策略【注意力机制篇】| ICLR 2022 MobileViTAttention 移动视觉Transformer,卷积编码局部、Transformer 编码全局

YOLOv13改进策略【注意力机制篇】| ICLR 2022 MobileViTAttention 移动视觉Transformer,卷积编码局部、Transformer 编码全局 本文基于YOLOv13 官方仓库(iMoonLab/yolov13,ultralytics 8.3.63 fork)实测整理,Windows/CPU 全程可跑。卷积擅长局部、Transformer 擅长全局——MobileViT(Mehta et al., ICLR 2022《MobileViT: Light-weight, General-purpose, and Mobile-friendly Vision Transformer》,Apple 官方,标准 PyTorch 实现取自 xmu-xiaoma666 版)把两者串起来:3×3+1×1 卷积先编码局部,特征按 patch 展开成 token 序列过轻量 Transformer 编码全局,再折回空间与原特征拼接融合。本文把它插入 v13n 主干层 7 之后(256 通道 @20×20 的 P5 尺度),实测+2,692,096 参数、GFLOPs 6.5→8.61——本批次最重的模块,也是"卷积+Transformer 混合"路线的代表作。3 轮冒烟训练正常收敛。前言注意力机制篇的"插入式"玩法(层 7 之后插入、层号全量顺移)。MobileViT 是 Apple 提出的移动端友好 ViT:它不像 ViT 那样把整图切成 patch 直接过 Transformer(丢失局部结构、需要大数据预训练),而是保留卷积主干、只在中间插入一段"全局编码"——用 CNNA 的局部特征补 ViTA 的全局视野。插入点选在层 7 之后:P5 语义特征 @
返回列表