本发明涉及视觉,具体涉及一种基于机器视觉的人群计数模型、方法及系统。
背景技术:
1、近年来,人群计数作为计算机视觉研究的核心议题,因其在安全监控、交通管理、智慧城市等领域的重要性而备受瞩目。其核心任务是在复杂拥挤场景中精确估算密集人群中个体的数量。尽管学术界已取得显著进展,但由于场景尺度的变化性、背景干扰、人体遮挡等因素的存在,实现高精度人群计数仍是一项具有挑战性的任务。
2、随着深度学习技术的迅猛发展,研究人员采用多种创新策略来应对这些难题,如引入注意力机制增强特征选择,以及采用多尺度特征提取技术改善人群规模多样性的适应性。早先的研究如mcnn和switch-cnn采用了多列结构以适应不同尺度人群特征的提取,进而合并生成密度图进行计数。然而,针对实时动态场景的分析显示,此类多列网络结构在训练时可能存在难度。对此,li等人提出的csrnet通过采用扩张卷积结构,显著提升了模型的感受野效率,并验证了单列网络结构的有效性。
3、近期,liu等人提出的can网络采取了端到端训练方式,综合运用多个滤波器产生的特征来编码不同尺度的上下文信息,同时,自适应卷积技术也被应用于适应人群尺度的变化。此外,诸如wang等人借助nlt技术减轻跨域人群计数中的域迁移问题,liu等人利用深度强化学习策略设计的libranet,以及sindagi等人提出的引入层级注意力机制的ha-cnn,均在不同程度上通过弱监督学习途径优化了特征表达并提高了计数准确性。
4、尽管上述基于卷积神经网络(cnn)的方法在精度上取得了突破,但在实际应用中暴露出了一些关键局限性,尤其是对计算资源和存储空间的需求巨大,且大多无法满足实时系统所需的低延迟响应。尤其是在边缘计算环境中,受限于设备本身的硬件条件,亟需研发适合嵌入式系统的轻量级网络模型。
5、为此,诸如mobilenet、squeezenet和shufflenet等高效网络结构应运而生,它们专为嵌入式系统进行了优化设计,凭借少量参数实现了媲美甚至超越某些复杂网络的精度表现。与此同时,轻量级网络设计方法也不断推陈出新,包括但不限于知识蒸馏技术,它可以加速预训练网络的推理速度而不显著牺牲精度,以及神经网络搜索(nas)技术,通过在庞大的网络设计空间中寻找最优解,以期在性能与速度之间取得理想的平衡点。
6、受此启发,大量针对边缘设备性能瓶颈问题的轻量级人群计数方法陆续出现,并可大致划分为两类:一类侧重于构造快速响应的网络结构,如chen等人提出的比目鱼网络,通过引入分组卷积技术去除网络冗余,以及旨在处理高分辨率图像的网络设计;另一类则着重追求精度与速度之间的平衡,如gao等人提出的pcc-net,利用局部与全局特征相结合的方式提高密度图估计的精确度,以及mobilecount系统,基于mobilenetv2架构,专为边缘设备打造的实时高精度计数方案,采用多层知识蒸馏技术进一步提升了整体性能。
7、尽管诸多研究已取得一定成果,但多数轻量级算法仍需在特征提取与融合层面进行深入探究,力求在减小模型尺寸的同时最大化保留计数准确性,以满足实际应用环境的严苛需求。
技术实现思路
1、为解决上述背景中的技术问题,本发明提出了一种创新的轻量化实时人群计数网络模型——uavcrowdcounter。该模型设计独特且高效,兼顾了模型的轻巧性和检测速度,同时也确保了人群计数预测的高精准度。
2、为实现上述目的,本发明提供了一种基于机器视觉的人群计数模型,包括:编码器模块和解码器模块;
3、所述编码器模块用于接收待识别区域图像,并对所述待识别区域图像进行预处理和特征提取后,生成四种不同尺寸的特征图;
4、所述解码器模块用于对四种不同尺寸的所述特征图进行融合,得到密度图,所述密度图用于计算得到人群计数结果。
5、优选的,所述编码器模块包括一个卷积层单元、一个最大池化层单元和四个bottleneck单元;
6、所述卷积层单元用于对所述待识别区域图像进行初步的特征提取,得到图像特征;
7、所述最大池化层单元用于对所述图像特征进行下采样,得到输出结果;
8、所述bottleneck单元用于基于所述输出结果,生成四种不同尺寸的特征图。
9、优选的,所述解码器模块包括:fusion单元和cpr单元;
10、所述fusion单元用于融合对四种不同尺寸的所述特征图进行抽取和融合,得到融合结果;
11、所述cpr单元用于对所述融合结果进行进一步的多尺度融合,得到所述密度图。
12、本发明还提供了一种基于机器视觉的人群计数方法,包括如下步骤:
13、获取待识别区域图像;
14、对所述待识别区域图像进行预处理和特征提取,生成四种不同尺寸的特征图;
15、对四种不同尺寸的所述特征图进行融合,得到密度图;
16、基于所述密度图,预测所述待识别区域图像的人群计数结果。
17、优选的,生成所述特征图的方法包括:
18、对所述待识别区域图像进行初步的特征提取,得到图像特征;
19、对所述图像特征进行下采样,得到输出结果;
20、基于所述输出结果,生成四种不同尺寸的特征图。
21、优选的,得到所述密度图的方法包括:
22、对四种不同尺寸的所述特征图进行抽取和融合,得到融合结果;
23、对所述融合结果进行进一步的多尺度融合,得到所述密度图。
24、优选的,预测所述待识别区域图像的人群计数结果的方法包括:
25、使用绝对误差mae和均方误差mse进行人群计数结果计算,
26、
27、
28、其中n为所述待识别区域图像的编号;cpmi是通过对所述密度图的所有像素求和来预测每个图像的人群计数统计;cgti是最终的所述人群计数结果。
29、本发明还提供了一种基于机器视觉的人群计数系统,包括:图像获取设备、特征提取模块、特征融合模块和计数模块;
30、所述图像获取设备用于获取待识别区域图像;
31、所述特征提取模块用于对所述待识别区域图像进行预处理和特征提取,生成四种不同尺寸的特征图;
32、所述特征融合模块用于对四种不同尺寸的所述特征图进行融合,得到密度图;
33、所述计数模块用于基于所述密度图,预测所述待识别区域图像的人群计数结果。
34、优选的,所述计数模块使用绝对误差mae和均方误差mse进行人群计数结果计算,
35、
36、
37、其中n为所述待识别区域图像的编号;cpmi是通过对所述密度图的所有像素求和来预测每个图像的人群计数统计;cgti是最终的所述人群计数结果。
38、与现有技术相比,本发明的有益效果如下:
39、本发明克服了现有基于深度学习的人群计数模型在实际应用中所面临的计算资源消耗大、模型复杂度过高以及难以实现实时处理等问题,特别是针对搭载于轻型无人机上的实时人群计数系统。
1.一种基于机器视觉的人群计数模型,其特征在于,
2.根据权利要求1所述的基于机器视觉的人群计数模型,其特征在于,所述编码器模块包括一个卷积层单元、一个最大池化层单元和四个bottleneck单元;
3.根据权利要求1所述的基于机器视觉的人群计数模型,其特征在于,所述解码器模块包括:fusion单元和cpr单元;
4.一种基于机器视觉的人群计数方法,其特征在于,包括如下步骤:
5.根据权利要求4所述的基于机器视觉的人群计数方法,其特征在于,
6.根据权利要求4所述的基于机器视觉的人群计数方法,其特征在于,
7.根据权利要求4所述的基于机器视觉的人群计数方法,其特征在于,
8.一种基于机器视觉的人群计数系统,其特征在于,
9.根据权利要求8所述的基于机器视觉的人群计数系统,其特征在于,
