本发明涉及室内定位,尤其涉及一种用于跨房间非视距声信号识别的域适应神经架构搜索方法。
背景技术:
1、为了满足人们对人和资产高精度定位日益增长的需求,随着物联网(iot)技术的进步,基于位置的服务(lbs)蓬勃发展,广泛应用于救灾、物体跟踪、车辆和行人导航等领域。在户外,全球导航卫星系统(gnss)可以提供可靠的导航解决方案。然而,由于gnss信号无法穿透墙壁和屏蔽效应,室内定位通常需要额外的信号介质,在没有卫星信号的室内和地下场景中,精确定位已成为亟需解决的问题。蓝牙、wifi、zigbee、近场通信(nfc)和uwb等各种无线定位室内服务正在兴起。与其他室内定位技术相比,基于到达时间(toa)/到达时间差(tdoa)的声学定位通常可以实现分米到厘米的定位精度。更重要的是,声学信号具有天然的低同步成本,并且与当前市场上的智能手机等边缘设备高度兼容。用户可以在不安装额外硬件设备的情况下使用准确快速的室内定位服务。与其他室内定位技术相比,声学信号具有较强的兼容性和较低的部署成本,被认为在构建精确的室内定位系统(ips)方面具有巨大的潜力。
2、室内声学定位面临着许多挑战,其中非视距(nlos)通常被认为是影响声学信号测距性能下降的最重要因素,表示通信的两点视线受阻,彼此看不到对方;相对应的还有视距(los),在视距条件下,无线信号无遮挡地在发信端与接收端之间直线传播。检测、滤波或校正nlos信号已成为ips的关键。检测算法的准确性将直接影响到每一个环节。nlos是指在发射器和接收器之间设置障碍物的情况。声学信号在到达周围墙壁之前可能会多次从墙壁上反弹,导致延迟以及可能的损失和退化。声学信号的频率通常约为20hz-20khz,波长约为17mm-17m。被障碍物阻挡后衰减明显,这无疑增加了识别los/nlos信号的难度。目前,识别los/nlos信号的方法有以下四种:
3、第一种是基于统计的方法,通过将先前的los测量记录为先验,构建具有零均值的高斯分布,将当前数据与之进行比较,如果存在不合理的差异,则将其丢弃或校正为los信号。这种先验测量可以给出目标的速度、方向、范围等。测量结果可以通过信号本身获得,也可以通过惯性测量单元(imu)等外部传感器进行测量;其中imu是测量物体三轴姿态角及加速度的装置。假设检验可以使用方差和均值等统计参数。但是,该方法难以定义los和nlos信号的阈值,识别精度受超参数影响较大。
4、第二种是基于室内地图和上下文的方法,根据定位估计大致的室内位置,并将其与室内地图相匹配来推断是否存在信号遮挡的情况。但是,该方法需要额外的精确室内地图和预定位,在一定程度上浪费了计算能力和存储。
5、第三种是基于数据驱动的传统机器学习方法,信道脉冲响应(cir)、信道状态信息(csi)、传播延迟、能量强度、峰度和峰间延迟等特征经常用于一些非参数机器学习中,如支持向量机(svm)、多层感知(mlp)、决策树等,以对nlos/los信号进行分类。但是,该方法需要以人工的方式手动提取特征,然而,信号传播路径损耗模型受到许多因素的影响,手动选择的特征可能不足以准确区分视线信号和非视线信号。
6、第四种是基于数据驱动的深度学习方法,近年来,许多工作都集中在引入深度神经网络来识别nlos信号上。jiang等人(参考文献见ieee communications letters,24(10):2226–2230,2020)提出了串行网络用于uwb cir测量的nlos/los分类。wang等人(参考文献见22nd international conference on indoor positioning and indoornavigation(ipin),beijing.2022:5-7.)利用cnn自动提取二维类图像光谱矩阵的特征并使用bi-lstm用于分类。wei等人(参考文献见measurement,195:111191,2022.)提出了一种由cnn和lstm组成的并行网络分别对声谱图和音频进行处理,并利用ubw的时频信息识别nlos信号。zhao等人(参考文献见applied sciences,12(13):6484,2022.)提出使用生成对抗网络(generative adversarial network,gan)来增强los/nlos数据。但是,该方法大多只使用了信号的时域信息作为深度学习模型的输入,且模型的结构较为简单,识别精度不高;其泛化性较差,对数据集的要求较高,且对于环境特性十分敏感。这种方法需要大量经过人工标定的数据用于训练网络模型,而训练完成的模型在陌生数据集(如在另一结构不同的房间中采集的数据)上的性能会明显下降;该方法中网络模型结构的设计和调整依赖工程师的深度学习知识和经验,且需要大量的时间成本试错。
技术实现思路
1、本发明的目的在于针对现有技术的不足,提供一种用于跨房间非视距声信号识别的域适应神经架构搜索方法。本发明能够实现高精度的nlos/los信号识别,且在未标注的陌生环境中表现良好。
2、本发明的目的是通过以下技术方案来实现的:本发明实施例第一方面提供了一种用于跨房间非视距声信号识别的域适应神经架构搜索方法,包括以下步骤:
3、(1)设计音频信号,房间中的扬声器向麦克风周期性发送设计的音频信号,麦克风采集房间中的音频信号;
4、(2)对采集到的音频信号进行预处理,以获取预处理后的频谱矩阵;
5、(3)构建对抗性域适应网络模型,该对抗性域适应网络模型包括特征提取器、标签预测器和域分类器,将预处理后的频谱矩阵输入到特征提取器中,获取特征向量;将特征向量分别输入到标签预测器和域分类器中,获取非视距信号识别结果及其对应的域识别结果;
6、(4)冻结特征提取器的结构参数,只训练其权值参数;采用神经架构搜索方法在给定的搜索空间中进行结构搜索,对标签分类器和域分类器进行周期性训练,将预处理后的频谱矩阵输入到对抗性域适应网络模型中,获取预测的非视距信号识别结果及其对应的域识别结果,根据预测的非视距信号识别结果及其对应的域识别结果以及信号标签计算对抗性域适应网络模型的损失函数,并根据对抗性域适应网络模型的损失函数调整标签分类器和域分类器的参数,以获取标签分类器和域分类器的最优网络结构及其参数。
7、进一步地,所述步骤(1)中设计的音频信号为线性扫频信号,表示为:
8、
9、
10、其中,s(t)为单个线性扫频信号,j表示虚数单位,f0和u0分别为初始频率和调制速率,线性扫频信号的长度为t,t(τ)表示周期性的整体线性扫频信号,τ表示来自不同路径的传播延迟,t为线性扫频信号的发送周期,时间间隔(t-t)为静默时间,ε(·)为阶跃函数,i表示第i个信号。
11、进一步地,所述麦克风采集到的音频信号表示为:
12、
13、其中,res(τ)表示麦克风采集到的房间中的音频信号,nr和nd分别表示反射信号和衍射信号的数量,nl=0,1表示是否为视距信号,nl=1表示该音频信号为视距信号,nl=0表示该音频信号为非视距信号,β表示不同路径的衰落系数,下标l、r、d分别表示直达路径、反射路径、衍射路径,黑曼窗w·用于消除轻微的多向波动,n·表示噪声。
14、进一步地,所述步骤(2)包括以下子步骤:
15、(2.1)采用带通滤波器对采集到的音频信号进行带通滤波,以去除音频信号中的噪声,并将音频信号的通频带量化为m个单位;
16、(2.2)采用峰值检测方法寻找音频信号中的最大峰值,保留最大峰值点前后各n/2个时间单位的音频信号,以获取形状为n×m的频谱矩阵,并以张量形式保存该频谱矩阵;
17、(2.3)将频谱矩阵中的所有元素归一化至[0,1],以获取预处理后的频谱矩阵。
18、进一步地,所述带通滤波器包括巴特沃斯滤波器、切比雪夫滤波器和贝塞尔滤波器;
19、所述归一化的方法包括min-max归一化、缩放归一化、标准化归一化和均值方差归一化。
20、进一步地,所述特征提取器采用现有神经网络模型的主干部分构成,所述特征提取器包括多个卷积层和池化层;
21、所述标签预测器输出的非视距信号识别结果表示为:
22、
23、其中,为标签预测器预测的非视距信号识别结果,gy表示标签预测器,gf(x;θf)表示特征提取器输出的特征向量,也为标签预测器gy的输入,x表示预处理后的频谱矩阵,θf表示特征提取器f的可训练参数,θy表示特征提取器gy的可训练参数;
24、所述域分类器输出的域识别结果表示为:
25、
26、其中,为域分类器预测的域识别结果,gd表示域分类器,gf(x;θf)表示特征提取器输出的特征向量,也为域分类器gd的输入,θd表示域分类器gd的可训练参数。
27、进一步地,所述步骤(4)中,在对域分类器进行训练时,在特征提取器和域分类器之间增加一个梯度反转层,表示为:
28、rλ(xf)=xf
29、
30、其中,xf表示特征向量,λ是随训练周期变化的参数,rλ表示梯度反转层,i表示单位矩阵;
31、所述步骤(4)中,对抗性域适应网络模型的损失函数表示为:
32、
33、其中,e(θf,θy,θd)表示对抗性域适应网络模型的损失,ly表示标签预测器的损失,xi表示第i个频谱矩阵,yi表示第i个频谱矩阵对应的信号标签,ld表示域分类损失。
34、进一步地,所述神经架构搜索方法包括:
35、①随机搜索方法,具体包括:
36、根据候选算子集合确定候选模型集合,随机设置标签分类器和域分类器的结构超参数,对候选模型集合中的所有候选模型进行若干周期的训练;
37、在对候选模型进行周期性训练时,冻结特征提取器的结构参数,频谱矩阵作为该候选模型的输入,输出预测的非视距信号识别结果及其对应的域识别结果,同时根据预测的非视距信号识别结果及其对应的域识别结果以及频谱矩阵对应的信号标签计算对抗性域适应网络模型的损失函数,并根据对抗性域适应网络模型的损失函数调整标签分类器和域分类器的结构超参数;
38、根据预测的非视距信号识别结果及其对应的域识别结果以及频谱矩阵对应的信号标签确定所有候选模型的识别结果准确率,选择准确率最大的候选模型作为最优候选模型;
39、对该最优候选模型进行训练直至对抗性域适应网络模型的损失函数收敛为止,获取标签分类器和域分类器的最优网络结构及其参数;
40、②可微架构搜索方法,具体包括:
41、标签分类器和域分类器的网络结构是分类变量,通过计算网络结构所有候选算子的softmax实现分类选项的松弛:
42、
43、其中,o表示候选算子集合,x′指神经网络中当前网络层的输入,是与o相同维度的权重向量,表示不同算子被选择的概率,表示(i,j)上的所有算子的加权混合,(i,j)表示表示向量网络结构中的位置下标;
44、搜索离散结构向量即为学习连续向量α={α(i,j)},当搜索结束后,选择具有最高概率的算子:
45、
46、其中,o(i,j)表示具有最高概率的算子,argmax表示取向量中的最大元素;
47、将搜索网络结构任务转化为双层优化问题,其中,结构向量α是外部变量,权向量w是内部变量:
48、minlα(w*(α),α)
49、s.t.w*(α)=argminwltrain(w,α)
50、其中,w*表示最优权向量,ltrain表示训练集上的损失函数;
51、采用两层优化方法交替更新标签分类器和域分类器的网络结构和权值,获取标签分类器和域分类器的最优网络结构及其参数。
52、本发明实施例第二方面提供了一种用于跨房间非视距声信号识别的域适应神经架构搜索装置,包括一个或多个处理器和存储器,所述存储器与所述处理器耦接;其中,所述存储器用于存储程序数据,所述处理器用于执行所述程序数据以实现上述的用于跨房间非视距声信号识别的域适应神经架构搜索方法。
53、本发明实施例第三方面提供了一种计算机可读存储介质,其上存储有程序,该程序被处理器执行时,用于实现上述的用于跨房间非视距声信号识别的域适应神经架构搜索方法。
54、本发明的有益效果为,本发明采用频谱矩阵作为网络模型的输入,增加了频域信息,使用二维卷积神经网络提取特征,并通过滤波、裁剪等手段去除冗余信息,进一步提高识别率,有效提高了识别精度;本发明引入了迁移学习方法,采用深度域适应方法,在模型中特征提取器后增加一个与标签分类器并行的域分类器,仅需使用少量未标注的目标域数据和源域数据共同训练,可以显著提升模型在目标域的识别准确率,有利于提升泛化性;针对一已经训练完成的模型,在面对来自未知环境时,仅需增加少量的未标注数据重新进行少量训练即可,而不需要重新采集和标注大量新数据并重新训练模型;本发明采用nas技术实现模型参数的自动调整,降低对于深度学习知识和经验的依赖,有利于降低深度学习模型的成本;本发明可实现同房间99%的nlos/los声信号的识别准确率,跨房间95%的识别率。
1.一种用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,所述步骤(1)中设计的音频信号为线性扫频信号,表示为:
3.根据权利要求1所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,所述麦克风采集到的音频信号表示为:
4.根据权利要求1所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,所述步骤(2)包括以下子步骤:
5.根据权利要求4所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,所述带通滤波器包括巴特沃斯滤波器、切比雪夫滤波器和贝塞尔滤波器;
6.根据权利要求1所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,所述特征提取器采用现有神经网络模型的主干部分构成,所述特征提取器包括多个卷积层和池化层;
7.根据权利要求1所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,所述步骤(4)中,在对域分类器进行训练时,在特征提取器和域分类器之间增加一个梯度反转层,表示为:
8.根据权利要求1所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法,其特征在于,所述神经架构搜索方法包括:
9.一种用于跨房间非视距声信号识别的域适应神经架构搜索装置,包括一个或多个处理器和存储器,其特征在于,所述存储器与所述处理器耦接;其中,所述存储器用于存储程序数据,所述处理器用于执行所述程序数据以实现权利要求1-8中任一项所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法。
10.一种计算机可读存储介质,其特征在于,其上存储有程序,该程序被处理器执行时,用于实现权利要求1-8中任一项所述的用于跨房间非视距声信号识别的域适应神经架构搜索方法。
