本技术涉及人体姿态估计,尤其涉及一种拥挤场景下的多人人体姿态估计方法、系统及介质。
背景技术:
1、现有的多人人体姿态估计算法主要包括自顶向下和自下而上两种方向,前者利用目标检测预测框算法先得到拥挤场景下的多人人体预测框,再对每个预测框分别做关键点检测,后者则是通过高斯滤波等方法获得关键点热力检测图,得到所有的人体关键点检测结果,再对这些关键点重新进行分类、组合,得到完整的人体姿态估计结果。无论是哪种方法,在拥挤场景下的人体姿态估计中都会面对待检测目标相互遮挡严重,相邻关键点难以匹配到具体人体实例的问题。一些单阶段的多人人体姿态估计模型则是从整体特征向量中直接回归得到最后的结果,这类算法依赖的提取特征也容易受到相互遮挡交叉的人体目标间的影响。
技术实现思路
1、为解决上述技术问题,本发明的目的在于:提供一种运算速度快、精度高的拥挤场景下的多人人体姿态估计方法、系统及介质。
2、为实现上述目的,本技术实施例的一方面提出了一种拥挤场景下的多人人体姿态估计方法,包括以下步骤:
3、获取待估计拥挤场景图片,将所述待估计拥挤场景图片输入预训练的深度学习网络模型,得到初步特征,进而将所述初步特征输入预设的残差金字塔模块,得到融合特征;
4、将所述融合特征输入门控自注意力模块,得到全局特征,进而将所述全局特征输入个体信息特征提取模块,得到各个体对应的个体信息特征;
5、将所述全局特征和所述个体信息特征输入全局空间解耦模块,得到各所述个体对应的深层个体特征;
6、将所述深层个体特征输入预先训练好的人体姿态估计模型,得到人体姿态估计结果;
7、其中,所述人体姿态估计结果包括各所述个体对应的关键点热力图和关键点检测结果。
8、在一些实施例中,所述将所述初步特征输入预设的残差金字塔模块,得到融合特征这一步骤,其具体包括:
9、通过所述残差金字塔模块对所述初步特征进行分解,得到第一输入特征和第二输入特征;
10、将所述第一输入特征进行大小变换和特征提取,得到第一输出特征;
11、对所述第二输入特征进行分解,得到第三输入特征和第四输入特征;
12、对所述第三输入特征和所述第四输入特征进行下采样、双线性插值以及融合,得到第二输出特征;
13、将所述第一输出特征和所述第二输出特征进行融合,得到所述融合特征。
14、在一些实施例中,所述全局特征通过下式确定:
15、
16、
17、
18、
19、o=(u⊙av)wo
20、其中,x表示所述融合特征,wu、wv、wz以及wo表示特征维度转化矩阵,以及表示silu激活函数,u、v以及z为x的中间输出变量,q和k表示基础仿射变化,⊙表示hadamard积,a表示自注意力矩阵,n表示所述融合特征的长度,s为超参数,取s=128,o表示所述全局特征。
21、在一些实施例中,所述个体信息特征通过下式确定:
22、c=hmcenter(o)
23、
24、ii=(xi,yi)
25、fi=f(ii)
26、其中,o表示所述全局特征,hmcenter表示预设的热力图生成模块,c表示生成的热力图,cj表示第j个关键点对应的热力图,m表示个体总数量,表示第i个所述个体在第j个关键点的中心坐标信息,rank表示寻求最大值操作,ii表示第i个所述个体的中心坐标信息(xi,yi),f表示卷积操作,fi表示第i个所述个体对应的所述个体信息特征。
27、在一些实施例中,所述深层个体特征通过下式确定:
28、
29、fsi=mio
30、
31、
32、其中,o表示所述全局特征,fi表示第i个所述个体对应的所述个体信息特征,表示第i个个体的通道注意力权重特征,mi表示第i个所述个体的空间注意力系数,表示第i个所述个体的空间位置信息特征,pi表示第i个所述个体的相关位置坐标信息特征,[]表示拼接操作,conv表示卷积操作,sigmoid表示非线性激活函数,fsi表示第i个所述个体的空间注意力权重特征,relu表示非线性激活函数,表示第i个所述个体的所述深层个体特征。
33、在一些实施例中,所述多人人体姿态估计方法还包括预先训练所述人体姿态估计模型的步骤,其具体包括:
34、获取crowdpose数据集;
35、将所述crowdpose数据集划分为训练集、测试集以及验证集,进而对所述训练集进行预处理,得到数据集标签组;
36、根据所述数据集标签组、所述验证集以及预获取的损失函数值对深度学习网络进行训练,并根据所述测试集对训练后的所述深度学习网络进行评估,得到所述人体姿态估计模型。
37、在一些实施例中,所述训练集包括多张包含人体姿态的图像,所述对所述训练集进行预处理,得到数据集标签组这一步骤,其具体包括:
38、对所述训练集进行高斯滤波处理,得到所述训练集对应的关键点全局热力图;
39、对所述训练集中的各所述图像进行边界框标注,得到各所述图像中各所述人体对应的个体中心点信息;
40、对所述训练集中的各所述图像进行高斯滤波处理,得到各所述人体对应的关键点个体热力图;
41、将所述关键点全局热力图、所述个体中心点信息以及所述关键点个体热力图进行整合,得到所述数据集标签组。
42、为实现上述目的,本技术实施例的另一方面提出了一种拥挤场景下的多人人体姿态估计系统,包括:
43、融合特征获取模块,用于获取待估计拥挤场景图片,将所述待估计拥挤场景图片输入预先训练好的深度学习网络模型,得到初步特征,进而将所述初步特征输入预设的残差金字塔模块,得到融合特征;
44、个体信息特征获取模块,用于将所述融合特征输入门控自注意力模块,得到全局特征,进而将所述全局特征输入个体信息特征提取模块,得到各个体对应的个体信息特征;
45、深层个体特征获取模块,用于将所述全局特征和所述个体信息特征输入全局空间解耦模块,得到各所述个体对应的深层个体特征;
46、人体姿态估计模块,用于将所述深层个体特征输入预先训练好的人体姿态估计模型,得到人体姿态估计结果;
47、其中,所述人体姿态估计结果包括各所述个体对应的关键点热力图和关键点检测结果。
48、为实现上述目的,本技术实施例的另一方面提出了一种电子设备,所述电子设备包括存储器、处理器、存储在所述存储器上并可在所述处理器上运行的程序以及用于实现所述处理器和所述存储器之间的连接通信的数据总线,所述程序被所述处理器执行时实现如前面所述的拥挤场景下的多人人体姿态估计方法。
49、为实现上述目的,本技术实施例的另一方面提出了一种存储介质,所述存储介质为计算机可读存储介质,用于计算机可读存储,所述存储介质存储有一个或者多个程序,所述一个或者多个程序可被一个或者多个处理器执行,以实现如前面所述的拥挤场景下的多人人体姿态估计方法。
50、本发明的有益效果是:本发明的拥挤场景下的多人人体姿态估计方法、系统及介质,通过深度学习网络模型得到待估计拥挤场景图片的初步特征,通过残差金字塔模块进行多尺度融合得到融合特征,进而通过门控自注意力模块进行内部相关性捕捉得到全局特征,接着通过个体信息特征提取模块和全局空间解耦模块得到用于估计人体姿态的深层个体特征,最后将深层个体特征输入预先训练好的人体姿态估计模型,得到包含每个个体的关键点热力图和关键点检测结果的人体姿态估计结果。本发明通过以上几个模块和模型的联合作用,能够充分将拥挤场景下多人图像解耦成不同单独个体的特征表达,减少不同人体之间相互遮挡、重叠等对于人体关键点检测的干扰,更准确地估计各个人体姿态,提高系统在拥挤场景下的多人人体姿态估计的精确度和运算速度。
1.一种拥挤场景下的多人人体姿态估计方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的一种拥挤场景下的多人人体姿态估计方法,其特征在于,所述将所述初步特征输入预设的残差金字塔模块,得到融合特征这一步骤,其具体包括:
3.根据权利要求1所述的一种拥挤场景下的多人人体姿态估计方法,其特征在于,所述全局特征通过下式确定:
4.根据权利要求1所述的一种拥挤场景下的多人人体姿态估计方法,其特征在于,所述个体信息特征通过下式确定:
5.根据权利要求1所述的一种拥挤场景下的多人人体姿态估计方法,其特征在于,所述深层个体特征通过下式确定:
6.根据权利要求1所述的一种拥挤场景下的多人人体姿态估计方法,其特征在于,所述多人人体姿态估计方法还包括预先训练所述人体姿态估计模型的步骤,其具体包括:
7.根据权利要求6所述的一种拥挤场景下的多人人体姿态估计方法,其特征在于,所述训练集包括多张包含人体姿态的图像,所述对所述训练集进行预处理,得到数据集标签组这一步骤,其具体包括:
8.一种拥挤场景下的多人人体姿态估计系统,其特征在于,包括:
9.一种电子设备,其特征在于,所述电子设备包括存储器、处理器、存储在所述存储器上并可在所述处理器上运行的程序以及用于实现所述处理器和所述存储器之间的连接通信的数据总线,所述程序被所述处理器执行时实现如权利要求1至7中任一项所述的拥挤场景下的多人人体姿态估计方法的步骤。
10.一种存储介质,所述存储介质为计算机可读存储介质,用于计算机可读存储,其特征在于,所述存储介质存储有一个或者多个程序,所述一个或者多个程序可被一个或者多个处理器执行,以实现如权利要求1至7中任一项所述的拥挤场景下的多人人体姿态估计方法的步骤。
