一种新型DDCE-YOLOv8s模型的水下图像目标检测方法

专利2026-09-16  1


本发明属于计算机视觉和深度学习领域,特别是涉及一种新型ddce-yolov8s模型的水下图像目标检测方法。


背景技术:

1、近年来,随着智慧渔业、精准养殖等概念的提出,水下目标(如鱼类等)检测及应用已成为研究热点,引起了学者们的广泛关注。由于水下目标检测具有环境复杂性、目标动态性、形态多样性等特点,导致高质量的水下目标检测数据获取难,此外,如何提高水下目标的检测精度、追踪效率等是目前智慧渔业、精准养殖等领域的关键问题。

2、目标检测是指从图像中找出感兴趣的目标,并识别目标的类别和位置等信息,因此其分为两个子任务:分类和定位。随着深度学习的发展,目标检测方法已经从基于传统手工特征提取的算法发展到了基于深度学习的算法,通过深层神经网络的学习,深度模型已经能够提取到更为复杂的特征信息,进一步增强目标检测的能力。目前,基于深度学习的目标检测算法主要分为两类:一阶段检测算法和二阶段检测算法。一阶段检测算法以yolo、ssd和retinanet等为代表,直接通过网络模型学习预测目标的类别和位置,是一种端到端的目标检测算法,速度快但精度相对偏低。二阶段检测算法以rcnn系列等为代表,这类算法首先要从图像中搜索出一些可能存在的对象候选区域,然后分别对这些区域进行目标识别,速度慢但精度相对偏高。

3、yolo系列目标检测算法经过最近几年的发展,其在速度和精度的显著平衡中脱颖而出,目前已成为了机器人、无人驾驶车等的核心技术。其中,yolov8作为最先进的模型,在上一代yolov7的基础上做出了许多改进,比如:在基础特征提取模块中融入ghostnet和梯度流思想,提升了网络模型的学习效率;检测头被设计为不基于锚框,减少了目标预测的数量;mosaic增强被发现用在整个训练过程中是有害的,因此在最后10个轮次的训练中被禁用等。

4、公开号cn116758393a一种基于mpgd-yolo网络的火焰检测方法,包括数据采集、数据增强、改进yolov7和预测等部分,其中改进yolov7主要通过在主干网络中插入p-gam注意力模块来提升网络学习能力,同时为了轻量化网络,用mbo模块替换原本elan模块,用sppcspc-group模块替换原模型中的sppcspc模块等。这些改进虽然降低了模型的参数量和计算量,提升了模型的推理速度,但是却没有考虑到小尺寸目标检测效果差的问题,因此不适合水下环境下目标检测任务。

5、井方科等人在2023年《激光与光电子学进展》上发表论文“基于多尺度特征融合的小目标交通标志检测”,该论文主要针对小尺寸或特征不明显的目标检测效果较差的问题提出改进方法,包含提出双头检测结构,聚焦小目标特征信息;使用wise-iouv3边界框损失函数,减小低质量样本产生的有害梯度;使用坐标卷积替代主干网络中的普通卷积,增强模型的空间感知能力等。这些改进虽然缓解了水下场景中小尺寸目标检测效果差的问题,但仍有不足;首先,该方法基于yolov5进行改进,网络学习能力相较目前流行的yolov8有明显差距;其次,目标检测对象是交通标志,其形状基本固定,变化有限,反之,本发明面向的水下场景中的目标形状、姿态变化多样,因此该方法也不适用于水下图像中的精准目标检测。


技术实现思路

1、发明目的:提供一种新型ddce-yolov8s模型的水下图像目标检测方法,在现有的yolov8网络模型的基础上,对现有水下场景中目标检测存在的问题进行了针对性改进,提高了网络模型的特征学习和表达能力,达到了更优异的检测效果。

2、技术方案:本发明包括以下步骤:

3、(1)构建水下图像目标检测数据集,并制作相应的标签文件,然后将目标样本数据集按比例分为训练集train和测试集test;

4、(2)提出一种融合可变形卷积模块c2f_dc对水下图像目标进行特征提取;

5、(3)设计一种深度加权双向特征金字塔网络deepbifpn对目标特征进行融合;

6、(4)构建一种基于内容感知特征重组模块carafe的特征上采样方法,替代传统yolo模型中的最近邻上采样方法;

7、(5)引入一种高效多尺度注意力机制ema,对特征进一步增强;

8、(6)将上述模块进行整合,构建新型ddce-yolov8s网络模型,然后进行训练,实现对水下目标的精确检测。

9、其中步骤(1)中的,构建数据集方法如下:

10、(1.1)在网络上收集水下目标图像,使用labelimg软件对水下图像中的目标进行标注并将标签文件转换为相应txt格式,标签文件包含水下目标的位置信息、尺寸信息、类别信息等,完成数据集的创建;

11、(1.2)对数据集进行数据清理,去除不符合要求的数据,同时将数据集划分为训练集train=[train1,…,traini,…,trainn×α]和测试集test=[test1,…,testi,…,testn×(1-α)],其中样本总数为n,从中随机抽取比例为α(0<α<1)的样本作为训练集,剩余样本作为测试集,则训练集样本数量为n×α,测试集样本数量为n×(1-α)。

12、其中步骤(2)中的,融合可变形卷积模块c2f_dc的构建方法如下:

13、(2.1)构建deform_conv模块:不同于普通的卷积核形状固定不变的卷积层,设计的可变形卷积层的卷积核不再是一个固定的矩形,而是由一个基础网格和一组偏移量共同组成的可变形矩阵,其在卷积过程中可以根据偏移量动态调整卷积范围,从而达到更好适应目标形变的能力,可变形卷积的表达式如下:

14、

15、其中,r表示输入特征图,p0表示当前卷积位置,pn表示p0在卷积核范围内的偏置项,表示由输入特征图经过一个卷积层生成的偏移量,ω表示采样点权重,x表示特征图像素值。

16、考虑到加入了偏移量的位置往往会出现小数,实际并不存在这个像素点,因此进一步采用双线性插值来计算偏移后的像素值,具体公式如下:

17、

18、其中,x表示输入特征图对应位置像素值,表示计算后的偏移像素值。

19、构建完可变形卷积层后,添加bn层和激活层,完成deform_conv模块的构建。

20、(2.2)构建c2f_dc模块:首先将输入特征图通过两个3×3的conv模块(每一个conv模块按顺序由卷积层、bn层和激活层三部分构成);然后通过步骤(2.1)中设计的一个deform_conv模块,再与输入特征图相加融合,组合为bottleneck1模块;最后将bottleneck1模块替换传统yolov8模型中c2f模块里的bottleneck2模块,完成c2f_dc模块的构建。

21、其中步骤(3)中的,深度加权双向特征金字塔网络deepbifpn构建方法如下:

22、(3.1)增加极小尺寸目标检测层:传统yolov8网络按照特征图分辨率及其感受野的大小可以划分为六层,最后三层分别为小尺寸目标检测层、中尺寸目标检测层和大尺寸目标检测层。为了检测水下图像中小尺寸目标,考虑到浅层特征感受野较小,更加关注小区域特征,同时再结合深层语义特征,非常适合小尺寸目标的检测,因此本发明在小尺寸目标检测层上再添加一层极小尺寸目标检测层,输出到解耦检测头;

23、(3.2)双向跨尺度连接:将主干中的同检测层的输出特征图,额外输入到近输出端的concat模块,实现双向跨尺度连接;

24、(3.3)快速归一化融合:不同于普通的concat模块仅对输入特征图在通道维度上进行简单的拼接融合,本发明额外为每条路径上的输入特征图设置了一个可学习的权重,以区分不同路径上特征的重要程度,实现快速归一化融合,公式如下:

25、

26、其中,o为输出特征图,i为不同路径上的输入特征图,w为可学习的权重系数,e为正则项。

27、其中步骤(4)中的,内容感知特征重组模块carafe的构建方法如下:

28、(4.1)构建内核预测模块:输入特征图首先通过一个1×1的conv模块进行特征通道压缩,减少后续的计算量;然后使用3×3的conv模块根据上采样比例σ和上采样核尺寸大小kup来预测上采样核,因为要对每个位置使用不同的上采样核,所以输出通道数为接着使用pixelshuffle方法将通道维特征在空间维展开得到上采样核;最后利用softmax函数对上采样核进行归一化,使卷积核权重和为1;

29、(4.2)构建内容感知重组模块:首先对输入特征图进行边缘补零,取出特征图上对应输出特征图的上采样核尺寸大小的区域;接着将各个区域和对应位置的上采样核进行点积,相同位置不同通道的特征共享同一个上采样核;然后使用pixelshuffle方法将特征图的通道维特征在空间维展开得到输出特征图;最后通过一个1×1的conv模块调整通道数。

30、其中步骤(5)中的,高效多尺度注意力机制ema的设计方法如下:

31、(5.1)构建坐标注意力模块:首先对输入特征图并行地进行宽度维度上的平均池化和高度维度上的平均池化,调整拼接融合两组特征;然后通过一个1×1的conv模块进行特征编码;最后使用sigmoid函数归一化后得到坐标权重,与输入特征图相乘得到输出;

32、(5.2)构建交叉空间学习模块:输入特征图首先通过坐标注意力模块并标准化,输出的特征图记为特征图1,另外输入特征图又在并行分支上通过一个3×3的conv模块,输出的特征图记为特征图2;特征图1通过全局平均池化后使用softmax函数进行归一化,然后与特征图2进行矩阵相乘得到空间权重矩阵,特征图2进行同样操作后与特征图1进行矩阵相乘得到空间权重矩阵;接着将两个空间权重矩阵进行相加融合操作和sigmoid函数归一化操作得到最终的空间权重矩阵;最后输入特征图与空间权重矩阵相乘,过程简单表示如下:

33、z=xl(ca(i),i)

34、其中,z表示空间权重矩阵,i表示输入特征图,ca表示坐标注意力模块,xl表示交叉空间学习模块。

35、(5.3)组合构建ema模块:对输入特征图首先进行分组,将通道维度上的特征信息转换到批处理维度上,减少后续操作的计算量;接着将分组后的特征图输入到包含坐标注意力模块的交叉空间学习模块中;最后调整输出的特征图各个维度信息,完成对ema模块的构建。

36、其中步骤(6)中的,ddce-yolovss模型的训练方法如下:

37、(6.1)对训练轮次epoch、批次大小batchsize和输入图像尺寸inputsize等超参数进行设置;

38、(6.2)通过多尺度的迭代训练得到最终的网络模型,然后使用这个训练后的网络模型对测试集图像进行预测,得到最终检测结果。

39、本发明的优点和有益效果如下:

40、本发明方法基于目前流行的yolov8网络模型,有针对性的对水下图像目标检测所存在的问题做出相应对策,进行相应改进,从而得到较高精度的水下图像目标检测模型,具体描述如下:首先,本发明设计了融合可变形卷积的c2f_dc模块,使得网络模型的学习不再局限于局部的感受野,而是能够基于变化的感受野,以适应不同水下目标形态、大小和姿态的变化,提高网络模型的特征学习能力;然后,设计了deepbifpn架构,额外添加的极小目标检测层感受野小,具有更多小目标检测依靠的浅层特征,同时加权路径和跨越连接能够增强不同特征的区分度和帮助网络模型学习,进而缓解水下图像中小目标检测精度低,效果差的问题;其次,应用了carafe模块,能够让网络模型学习到的特征更加集中在目标物体区域而非背景区域,以处理水下图像目标密集、重叠的问题;最后,引入了ema模块,在通道、方向和空间多个维度上增强重要特征信息的表达,抑制冗余特征信息的表达,进一步提升网络模型的特征学习能力,实现了复杂环境背景下的较高精度水下目标检测。


技术特征:

1.一种新型ddce-yolov8s模型的水下图像目标检测方法,其特征在于,包括以下步骤:

2.根据权利要求1所述的一种新型ddce-yolov8s模型的水下图像目标检测方法,其特征在于,所述步骤(1)的,数据集构建方法如下:

3.根据权利要求1所述的一种新型ddce-yolov8s模型的水下图像目标检测方法,其特征在于,所述步骤(2)的,融合可变形卷积模块c2f_dc的构建方法如下:

4.根据权利要求1所述的一种新型ddce-yolov8s模型的水下图像目标检测方法,其特征在于,所述步骤(3)的,深度加权双向特征金字塔网络deepbifpn构建方法如下:

5.根据权利要求1所述的一种新型ddce-yolov8s模型的水下图像目标检测方法,其特征在于,所述步骤(4)的,内容感知特征重组模块carafe的构建方法如下:

6.根据权利要求1所述的一种新型ddce-yolov8s模型的水下图像目标检测方法,其特征在于,所述步骤(5)中,高效多尺度注意力机制ema的设计方法如下:

7.根据权利要求1所述的一种新型ddce-yolov8s模型的水下图像目标检测方法,其特征在于,所述步骤(6)中,ddce-yolov8s模型的训练方法如下:


技术总结
本发明公开了一种新型DDCE‑YOLOv8s模型的水下图像目标检测方法。首先,为应对水下目标种类、大小、姿态的复杂变化性,提出一种融合可变形卷积模块对水下目标进行特征提取;然后,为了解决水下小尺度目标较难检测的问题,设计一种深度加权双向特征金字塔网络进行特征融合;第三,针对水下目标密集重叠容易漏检的问题,构建基于内容感知特征重组模块的特征上采样方法;第四,为了抑制冗余特征,引入高效多尺度注意力机制;最后,将上述模块进行整合,构建新型DDCE‑YOLOv8s网络模型,实现对水下目标的精确检测。本发明提出的方法针对水下目标的特殊性,从不同角度增强网络模型,有效提高水下目标的检测性能。

技术研发人员:王鑫,张一舟,李黎,高威,王斌
受保护的技术使用者:河海大学
技术研发日:
技术公布日:2024/6/26
转载请注明原文地址:https://doc.8miu.com/read-1834227.html

最新回复(0)