本发明涉及数据处理,具体涉及一种面向不确定模态缺失的多模态意图识别方法、一种面向不确定模态缺失的多模态意图识别系统、一种计算机设备以及一种计算机可读存储介质。
背景技术:
1、本部分的陈述仅仅是提供了与本发明相关的背景技术,并不必然构成现有技术。
2、多模态数据提供了多样化的信息,并且不同模态的数据之间具有很好的互补性,通过结合不同模态的信息进行分析判断,可以帮助模型更好地理解数据背后的含义和上下文,从而有效提升模型性能和鲁棒性。然而,现有的多模态意图识别模型都假设在训练和测试过程中所有的模态数据(文本、音频、视觉)都始终可用。在现实环境中,因为一些人为不可控的原因不可能获取所有模态的数据,多模态意图识别会出现某些模态信息缺失或不完整的情况。如图1所示,在摄像头损坏的情况下,会丢失视觉模态的信息;由于隐私保护政策无法获取文本以及由于环境噪音太大导致音频噪声过多。在进行多模态意图识别时,模态缺失会对模型的性能和效果产生负面影响,这是由于缺少某个模态数据时,模型可能无法充分利用多个模态之间的相关性和互补性,从而导致模型的性能出现下降。遗憾的是,绝大部分现有的多模态意图识别模型无法处理模态缺失问题。因此,如何处理多模态意图识别中的模态缺失问题成为了一个新的挑战。
3、针对模态缺失的问题,一些研究工作简单地丢弃缺失的模态或利用矩阵补全方法来估算缺失的模态,但这些方法会导致模型整体性能下降。因为深度学习模型具有强大的学习能力,所以近年来的研究趋势是利用深度神经网络来学习可用模态之间的潜在关系。这些方法大致可以分为联合学习式和生成式两类。联合学习式方法可以通过端到端的优化过程,直接最大化模型在多模态数据上的整体性能,而不需要分别优化每个模态的编码器或解码器。因此,近年来更多地使用联合学习方法来处理模态缺失,这样可以更好地保持模型的一致性和整体性能。在多模态意图识别领域,一些学者针对模态缺失开展了相应的研究,并取得了一定的成果。然而,已有的研究只能解决文本模态缺失的问题,无法解决不确定模态缺失的问题,并且只能处理包含视觉、文本两种模态的多模态数据。
4、不确定模态缺失是指在多模态数据中,样本随机出现某一种或多种模态不可用的情况,在多模态情感分析领域,一些基于联合学习的模型被提出用来解决不确定模态缺失问题。这些模型无需在不同模态缺失的情况下重新训练模型,减少了模型的复杂性。虽然当前研究取得了一定的成果,但还存在以下不足:
5、(1)已有的研究工作表明,多模态意图识别中文本模态占据主要作用,然而,已有的研究在多模态特征融合过程中将不同模态看作同等地位。因此,已有的工作在融合过程中多模态特征无法深度交互并对噪声敏感;
6、(2)不确定模态缺失会导致多模态样本的语义与完整模态时的语义不一致,进而导致模型识别不准确,已有的研究未充分考虑这种不一致性,因此降低了模型的性能和鲁棒性;
7、(3)已有的研究工作在处理不确定模态缺失时,模型可能会过度依赖现有模态的信息,从而对缺失模态的数据分布进行错误估计,进而导致过拟合现象。
技术实现思路
1、为了解决现有技术的不足,本发明提供了一种面向不确定模态缺失的多模态意图识别方法及系统,首先,通过lstm(long short-term memory,长短期记忆人工神经网络)编码器进行特征提取;其次,通过基于注意力的双向门控多模态特征融合方法进行多模态特征融合,并基于cmd的距离约束策略拉近各个模态到文本模态的距离;然后,将融合后的多模态特征输入transformer编解码器进行学习,同时,根据不确定模态缺失情况,输入不同的注意力级提示,从而引导网络关注那些缺失的模态;最后,将多模态特征输入分类器进行意图识别,同时,在训练过程中以全模态场景下预训练的模型在分类器对模型进行指导,从而帮助模型在减少过拟合的同时进一步提升泛化能力。
2、为了实现上述目的,本发明采用如下技术方案:
3、第一方面,本发明提供了一种面向不确定模态缺失的多模态意图识别方法。
4、一种面向不确定模态缺失的多模态意图识别方法,包括以下过程:
5、获取不确定模态缺失的多模态数据,通过lstm编码器进行多模态数据的特征提取,得到不同模态特征;
6、最小化文本模态特征与视觉模态特征和音频模态特征的相似性损失,通过基于注意力的双向门控多模态特征融合方式进行不同模态特征的融合;
7、将融合后的多模态特征输入transformer模型进行学习,根据不确定模态缺失情况,向每个transformer块的多头自注意力层的键和值中添加不同的注意力级提示,以引导transformer模型关注缺失的模态;
8、以transformer模型输出的特征作为分类器的输入,得到多模态意图识别结果。
9、第二方面,本发明提供了一种面向不确定模态缺失的多模态意图识别系统。
10、一种面向不确定模态缺失的多模态意图识别系统,包括:
11、特征提取单元,被配置为:获取不确定模态缺失的多模态数据,通过lstm编码器进行多模态数据的特征提取,得到不同模态特征;
12、特征融合单元,被配置为:最小化文本模态特征与视觉模态特征和音频模态特征的相似性损失,通过基于注意力的双向门控多模态特征融合方式进行不同模态特征的融合;
13、模态缺失提示单元,被配置为:将融合后的多模态特征输入transformer模型进行学习,根据不确定模态缺失情况,向每个transformer块的多头自注意力层的键和值中添加不同的注意力级提示,以引导transformer模型关注缺失的模态;
14、意图识别单元,被配置为:以transformer模型输出的特征作为分类器的输入,得到多模态意图识别结果。
15、第三方面,本发明提供了一种计算机可读存储介质,所述计算机可读存储介质存储有计算机程序,所述计算机程序适于被处理器加载并执行如本发明第一方面所述的面向不确定模态缺失的多模态意图识别方法。
16、第四方面,本发明提供了一种计算机设备,包括:处理器和计算机可读存储介质;
17、处理器,适于执行计算机程序;
18、计算机可读存储介质,所述计算机可读存储介质中存储有计算机程序,所述计算机程序被所述处理器执行时,实现如本发明第一方面所述的面向不确定模态缺失的多模态意图识别方法。
19、与现有技术相比,本发明的有益效果是:
20、本发明创新性的提出了一种面向不确定模态缺失的多模态意图识别模型(mirumm模型)来解决不确定模态缺失的问题,采用基于注意力的双向门控多模态特征融合模块进行多模态特征融合,并基于cmd距离的约束策略拉近音频模态、视觉模态与文本模态的距离,从而解决多模态特征融合不能深度交互的问题;根据不确定模态缺失的情况,在transformer中添加注意力级提示,从而引导模型关注这些缺失的模态;此外,本发明提出了一个基于完整模态训练的预训练模型在分类器监督整个模型的训练过程,从而帮助模型提升泛化性能;在公共数据集上进行的实验结果表明,与基线模型相比,本发明提出的mirumm模型在不同不确定模态缺失率条件下的准确率、f1分数、精准率和召回率都有所提升。
21、本发明附加方面的优点将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实践了解到。
1.一种面向不确定模态缺失的多模态意图识别方法,其特征在于,包括以下过程:
2.如权利要求1所述的面向不确定模态缺失的多模态意图识别方法,其特征在于,
3.如权利要求1所述的面向不确定模态缺失的多模态意图识别方法,其特征在于,
4.如权利要求3所述的面向不确定模态缺失的多模态意图识别方法,其特征在于,
5.如权利要求1-4任一项所述的面向不确定模态缺失的多模态意图识别方法,其特征在于,
6.如权利要求5所述的面向不确定模态缺失的多模态意图识别方法,其特征在于,
7.如权利要求1-4任一项所述的面向不确定模态缺失的多模态意图识别方法,其特征在于,
8.一种面向不确定模态缺失的多模态意图识别系统,其特征在于,包括:
9.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质存储有计算机程序,所述计算机程序适于被处理器加载并执行如权利要求1-7任一项所述的面向不确定模态缺失的多模态意图识别方法。
10.一种计算机设备,其特征在于,包括:处理器和计算机可读存储介质;
