ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

YOLO26改进 - C3k2 | C3k2融合FDConv频率动态卷积:空间-频域协同调制增强细节捕获,提升小目标与边界模糊目标检出 | CVPR 2025

YOLO26改进 - C3k2 | C3k2融合FDConv频率动态卷积:空间-频域协同调制增强细节捕获,提升小目标与边界模糊目标检出 | CVPR 2025 前言本文提出新型频率动态卷积(FDConv),旨在解决传统动态卷积权重频率响应相似、参数开销大且适应性有限的问题。FDConv通过在傅里叶域学习固定参数预算,将其划分为基于频率的分组,构建频率多样化的权重。同时设计了核空间调制(KSM)和频段调制(FBM),分别在空间和频率域提升适应性。大量实验表明,FDConv应用于ResNet - 50时,仅增360万参数就能实现更优性能。我们将FDConv集成进YOLO26,替换部分模块,在目标检测、分割和分类任务中验证了其有效性,为现代视觉任务提供灵活高效的解决方案。文章目录: YOLO26改进大全:卷积层、轻量化、注意力机制、损失函数、Backbone、SPPF、Neck、检测头全方位优化汇总专栏链接: YOLO26改进专栏文章目录前言介绍摘要文章链接基本原理一、核心设计定位1. 解决的核心痛点2. 设计目标二、三大核心模块详解1. 傅里叶不相交权重(FDW:Fourier Disjoint Weight)2. 核空间调制(KSM:Kernel Spatial Modulation)3. 频段调制(FBM:Frequency Band Modulation)核心代码YOLO26引入代码注册步骤1:步骤2配置yolo26-C3k2_FDConv.yaml实验脚本结果介绍摘要尽管动态卷积(DY-Conv)通过“多组并行权重+注意力机制”实现自适应权重选择,展现出良好性能,但这些权重的频率响应往往高度相似,导致参数开销大而适应性有限。在本文中,我们提出一种新型频率动态卷积(FDConv),通过在傅里叶域学习固定参数预算来缓解这些局限性。FDConv将该预算划分为具有不相交傅里叶索引的基于频率的分组,能够在不增加参数开销的前提下构建频率多样化的权重。为进一步提升适应性,我们设计了核空间调制(KSM)和频段调制(FBM):KSM在空间层面动态调整每个滤波器的频率响应,而FBM则在频率域将权重分解为不同频段,并基于局部内容进行动态调制。我们在目标检测、分割和分类任务上开展了大量实验,验证了FDConv的有效性。结果表明,将FDConv应用于ResNet-50时,仅需小幅增加360万参数即可实现更优性能,超越了此前需要大幅增加参数预算的方法(如CondConv增加9000万参数、KW增加7650万参数)。此外,FDConv可无缝集成到多种架构中,包括ConvNeXt、Swin-Transformer,为现代视觉任务提供了灵活高效的解决方案。相关代码已公开在https://github.com/LinweiChen/FDConv。文章链接论文地址:
返回列表