本发明涉及视频处理,尤其是一种基于语音交互的视频换脸方法和系统、电子设备及介质。
背景技术:
1、随着科技的进步,视频编辑技术已经广泛应用于各种领域,如电影、电视、广告等。其中,视频换脸技术,也就是将视频中的一个人的脸部替换为另一个人的脸部,是一种常见的视频编辑技术。然而,传统的视频换脸技术通常需要复杂的操作和专业的技术知识,对普通用户来说,难度较大。人工智能的发展带来了成熟的语音交互技术。用户可以通过语音指令,方便快捷地完成各种任务。然而,目前市场上的语音交互系统,大多用于智能家居控制、音乐播放等领域,而在视频编辑领域的应用还相对较少。因此,如何将语音交互技术应用于视频换脸技术,以提高视频换脸的便利性和效率,是当前亟需解决的技术问题。
2、术语解释:
3、视频换脸:是一种数字图像处理技术,也被称为“深度换脸”,它是指在视频中将一张脸部图像替换成另一张脸部图像。这种技术通常涉及到人脸检测、人脸识别、人脸对齐和脸部图像合成等步骤。
4、音频转文字模型:一般被称为语音识别(speech-to-text,stt)或自动语音识别(automatic speech recognition,asr)模型。这些模型的目标是将人类的口头语音转化为书面的文本格式。
技术实现思路
1、本发明的目的在于至少一定程度上解决现有技术中存在的技术问题之一。
2、为此,本发明实施例的一个目的在于提供一种基于语音交互的视频换脸方法,该方法提高了视频换脸的效率和用户的使用体验,也提高了视频处理的准确性和质量。
3、本发明实施例的另一个目的在于提供一种基于语音交互的视频换脸系统。
4、为了达到上述技术目的,本发明实施例所采取的技术方案包括:
5、第一方面,本发明实施例提供了一种基于语音交互的视频换脸方法,包括以下步骤:
6、获取目标用户的第一语音指令,根据所述第一语音指令确定视频描述信息、角色描述信息以及替换图像描述信息;
7、根据所述视频描述信息获取待处理视频,对所述待处理视频进行人体识别,得到人体位置信息和人体区域图像;
8、将所述人体区域图像输入到预先训练好的人物分类模型,得到人物特征描述信息,进而根据所述人物特征描述信息、所述人体位置信息以及所述角色描述信息确定目标换脸对象,并根据所述目标换脸对象对所述待处理视频进行定位标记,得到待换脸视频帧;
9、根据所述替换图像描述信息获取目标脸部图像,将所述待换脸视频帧和所述目标脸部图像输入到人脸融合模型,得到目标换脸视频。
10、进一步地,在本发明的一个实施例中,所述根据所述第一语音指令确定视频描述信息、角色描述信息以及替换图像描述信息这一步骤,其具体包括:
11、对所述第一语音指令进行语音识别,得到第一文本信息;
12、将所述第一文本信息输入到语义分析模型,得到命名实体、关系抽取信息、属性抽取信息以及行为抽取信息;
13、根据所述命名实体、所述关系抽取信息、所述属性抽取信息以及所述行为抽取信息确定所述视频描述信息、所述角色描述信息以及所述替换图像描述信息。
14、进一步地,在本发明的一个实施例中,所述根据所述视频描述信息获取待处理视频,对所述待处理视频进行人体识别,得到人体位置信息和人体区域图像这一步骤,其具体包括:
15、获取预设的视频库,根据所述视频描述信息在所述视频库中匹配得到所述待处理视频;
16、根据所述待处理视频获取多个待处理视频帧,并将所述待处理视频帧输入到人体识别模型,得到包含人脸的第一视频帧和不包含人脸的第二视频帧,并确定所述第一视频帧对应的所述人体位置信息和所述人体区域图像;
17、其中,所述人体区域图像包括脸部区域图像、身体区域图像以及头发区域图像。
18、进一步地,在本发明的一个实施例中,所述视频换脸方法还包括预先训练所述人物分类模型的步骤,其具体包括:
19、获取预设的多个人物分类样本数据,并确定各所述人物分类样本数据的标签信息;
20、根据所述人物分类样本数据和所述标签信息构建训练数据集;
21、将所述训练数据集输入到预先构建的残差神经网络进行训练,得到训练好的所述人物分类模型;
22、其中,所述标签信息包括脸部特征标签、身体特征标签以及头发特征标签。
23、进一步地,在本发明的一个实施例中,所述将所述训练数据集输入到预先构建的残差神经网络进行训练,得到训练好的所述人物分类模型这一步骤,其具体包括:
24、将所述训练数据集输入到所述残差神经网络,得到人物分类结果;
25、根据所述人物分类结果和所述标签信息确定所述残差神经网络的损失值;
26、根据所述损失值通过反向传播算法更新所述残差神经网络的模型参数,并返回将所述训练数据集输入到所述残差神经网络这一步骤;
27、当所述损失值达到预设的第一阈值,停止训练,得到训练好的所述人物分类模型。
28、进一步地,在本发明的一个实施例中,所述将所述人体区域图像输入到预先训练好的人物分类模型,得到人物特征描述信息,进而根据所述人物特征描述信息、所述人体位置信息以及所述角色描述信息确定目标换脸对象,并根据所述目标换脸对象对所述待处理视频进行定位标记,得到待换脸视频帧这一步骤,其具体包括:
29、将所述人体区域图像输入到所述人物分类模型,并根据模型输出确定所述人体区域图像对应的所述人物特征描述信息;
30、将所述人物特征描述信息和所述人体位置信息与所述角色描述信息进行比对,确定所述第一视频帧中符合所述角色描述信息的所述目标换脸对象;
31、根据所述目标换脸对象的位置对所述第一视频帧进行定位标记,得到待换脸视频帧。
32、进一步地,在本发明的一个实施例中,所述根据所述替换图像描述信息获取目标脸部图像,将所述待换脸视频帧和所述目标脸部图像输入到人脸融合模型,得到目标换脸视频这一步骤,其具体包括:
33、获取预设的脸部图像库,根据所述替换图像描述信息在所述脸部图像库中匹配得到所述目标脸部图像;
34、将所述待换脸视频帧和所述目标脸部图像输入到所述人脸融合模型,得到第三视频帧;
35、对所述第二视频帧和所述第三视频帧进行排序编码,得到所述目标换脸视频。
36、第二方面,本发明实施例提供了一种基于语音交互的视频换脸系统,包括:
37、语音指令解析模块,用于获取目标用户的第一语音指令,根据所述第一语音指令确定视频描述信息、角色描述信息以及替换图像描述信息;
38、人体识别模块,用于根据所述视频描述信息获取待处理视频,对所述待处理视频进行人体识别,得到人体位置信息和人体区域图像;
39、换脸对象确定模块,用于将所述人体区域图像输入到预先训练好的人物分类模型,得到人物特征描述信息,进而根据所述人物特征描述信息、所述人体位置信息以及所述角色描述信息确定目标换脸对象,并根据所述目标换脸对象对所述待处理视频进行定位标记,得到待换脸视频帧;
40、人脸融合模块,用于根据所述替换图像描述信息获取目标脸部图像,将所述待换脸视频帧和所述目标脸部图像输入到人脸融合模型,得到目标换脸视频。
41、第三方面,本发明实施例提供了一种电子设备,所述电子设备包括存储器、处理器、存储在所述存储器上并可在所述处理器上运行的程序以及用于实现所述处理器和所述存储器之间的连接通信的数据总线,所述程序被所述处理器执行时实现如上述第一方面所述的基于语音交互的视频换脸方法。
42、第四方面,本发明实施例还提供了一种存储介质,所述存储介质为计算机可读存储介质,用于计算机可读存储,所述存储介质存储有一个或者多个程序,所述一个或者多个程序可被一个或者多个处理器执行,以实现如上述第一方面所述的基于语音交互的视频换脸方法。
43、本发明的优点和有益效果将在下面的描述中部分给出,部分将从下面的描述中变得明显,或通过本发明的实践了解到:
44、本发明实施例获取目标用户的第一语音指令,根据第一语音指令确定视频描述信息、角色描述信息以及替换图像描述信息,据视频描述信息获取待处理视频,对待处理视频进行人体识别,得到人体位置信息和人体区域图像,人体区域图像输入到预先训练好的人物分类模型,得到人物特征描述信息,进而根据人物特征描述信息、人体位置信息以及角色描述信息确定目标换脸对象,并根据目标换脸对象对待处理视频进行定位标记,得到待换脸视频帧,据替换图像描述信息获取目标脸部图像,将待换脸视频帧和目标脸部图像输入到人脸融合模型,得到目标换脸视频。本发明实施例通过语音交互的方式,使用户能够方便快捷地实现视频中特定角色脸部的替换和修改,提高了视频换脸的效率和用户的使用体验;同时,由于根据用户的语音指令精确地定位和替换视频中的目标,避免了手动操作容易出错的缺陷,提高了视频处理的准确性和质量,进一步提高了用户的使用体验。
1.一种基于语音交互的视频换脸方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的一种基于语音交互的视频换脸方法,其特征在于,所述根据所述第一语音指令确定视频描述信息、角色描述信息以及替换图像描述信息这一步骤,其具体包括:
3.根据权利要求1所述的一种基于语音交互的视频换脸方法,其特征在于,所述根据所述视频描述信息获取待处理视频,对所述待处理视频进行人体识别,得到人体位置信息和人体区域图像这一步骤,其具体包括:
4.根据权利要求1所述的一种基于语音交互的视频换脸方法,其特征在于,所述视频换脸方法还包括预先训练所述人物分类模型的步骤,其具体包括:
5.根据权利要求4所述的一种基于语音交互的视频换脸方法,其特征在于,所述将所述训练数据集输入到预先构建的残差神经网络进行训练,得到训练好的所述人物分类模型这一步骤,其具体包括:
6.根据权利要求3所述的一种基于语音交互的视频换脸方法,其特征在于,所述将所述人体区域图像输入到预先训练好的人物分类模型,得到人物特征描述信息,进而根据所述人物特征描述信息、所述人体位置信息以及所述角色描述信息确定目标换脸对象,并根据所述目标换脸对象对所述待处理视频进行定位标记,得到待换脸视频帧这一步骤,其具体包括:
7.根据权利要求6所述的一种基于语音交互的视频换脸方法,其特征在于,所述根据所述替换图像描述信息获取目标脸部图像,将所述待换脸视频帧和所述目标脸部图像输入到人脸融合模型,得到目标换脸视频这一步骤,其具体包括:
8.一种基于语音交互的视频换脸系统,其特征在于,包括:
9.一种电子设备,其特征在于:所述电子设备包括存储器、处理器、存储在所述存储器上并可在所述处理器上运行的程序以及用于实现所述处理器和所述存储器之间的连接通信的数据总线,所述程序被所述处理器执行时实现如权利要求1至7中任一项所述的基于语音交互的视频换脸方法的步骤。
10.一种存储介质,所述存储介质为计算机可读存储介质,用于计算机可读存储,其特征在于:所述存储介质存储有一个或者多个程序,所述一个或者多个程序可被一个或者多个处理器执行,以实现如权利要求1至7中任一项所述的基于语音交互的视频换脸方法的步骤。
