本发明属于计算机图像处理,更具体地,涉及一种基于超网络的低参数gan反演方法、装置及介质。
背景技术:
1、随着生成对抗网络(gan)的快速发展,解耦其潜在空间成为了研究的热点,因此gan反演相关任务备受关注。目前,大部分工作采用stylegan来完成这一任务。最常见的三种反演方法分别是:基于优化的方法、基于编码器的方法和混合方法。基于优化的方法直接优化潜在向量,最小化图像误差,生成较高反演质量的图像,但推理速度很慢。基于编码器的方法将输入图像映射到潜在空间,虽然反演质量可能不及基于优化方法,但推理速度更快,且它的可编辑性更强。混合方法充分利用了上述两种方法的优点,它首先使用编码器将图像编码为初始潜码,然后将该潜码作为后期优化过程的初始点,在一定程度上平衡了反演质量和推理时间。
2、预训练的gan生成器所包含的潜在空间封装了许多可解释的语义方向,可用于图像编辑。其中最具有代表性的工作stylegan使得许多方法能够更便捷编辑不同的面部属性,如头部姿势、面部表情或发型。这些方法的核心思想源自stylegan提出的的w+潜在空间和w潜在空间,其高度的可解释性允许进行不同语义信息的编辑。因此,理解和探索预训练gan潜在空间中编码的语义方向一直是许多研究的主要方向。目前有许多方法利用了不同程度的监督来发现语义的潜在方向。这些方法包括一些无监督地发现潜在空间的可解释方向的方式,无需配对数据。还有一些完全监督的形式,以语义标签的形式进行。最新的方法开辟了探索对比学习的有效性。
3、超网络主要功能是用于产生较大规模网络参数的小规模网络。其结构提供了一种新的权衡方式,介于卷积神经网络(cnn)和循环神经网络(rnn)之间,能够有效控制模型参数量并取得优异效果。
4、psp(encoding in style:a stylegan encoder for image-to-imagetranslation)提出了一种分层嵌入潜在代码的方式,直接把styles送到stylegan里,而不加入其他的spatial输入。这个方法尤其在人脸正面化方面取得了较大的优势,可以完全以无监督的方式来进行。其次是对中间style表征的支持使得它可以用于许多人脸相关的任务,比如超分、分割图人脸生成等。
5、e4e(designing an encoder for stylegan image manipulation)设计了一种新的编码器,旨在将实际图像映射到与stylegan潜在空间w相似的位置。该编码器通过训练将给定的实际图像转换成一系列具有低方差且与w分布相似的样式向量。利用对抗训练来鼓励样式向量在w中的正确编码,并采用渐进式训练方案来帮助保持可编辑区域内的样式向量方差。
6、restyle(a residual-based stylegan encoder via iterative refinement)提出一种用于训练和部署gan逆映射编码器的新方案,引入迭代强化机制,扩展了目前基于编码器的逆映射方法。编码器的任务不是用单通道直接预测给定真实图像的潜码,而是以自校正方式预测相对于当前估计的逆映射潜码的残差,通过多次正向传递,更准确、更快速地收敛到目标逆映射。该方案让编码器学习如何有效地引导其收敛到所需的逆映射。
7、pti(pivotal tuning for latent-based editing of real images)采取了两阶段的优化方法,使用现有的反演技术将输入图像转换为可编辑的潜在代码;然后微调预训练stylegan,使其能够生成与前一步中发现的潜在代码相对应的输入图像。
8、psp反演能力有限,对于细节特征不能很好的保留,并且仅能反演stylegan生成的图像,如果想要反演真实世界图像案例便十分困难;e4e反演能力图像会确实部分细节特征,对于复杂领域的图像反演能力较弱;restyle虽然通过迭代优化的方法提升了反演质量,但是在反演图像的保真度上有一定的缺失;pti虽然提高了反演的保真度,但是在进行微调时会消耗大量的参数和时间。总的来说,现有技术各有不同的局限性,尽管它们在一定程度上改善了图像反演的质量但是对模型参数和反演时间的考虑比较少。
技术实现思路
1、提供了本发明以解决现有技术中存在的上述问题。因此,需要一种基于超网络的低参数gan反演方法、装置及介质,以解决图像反演与编辑之间的权衡问题。为解决此问题,本发明采用了分阶段执行的优化策略。首先,搜索最精确反演图像的潜在代码,然后将这些潜在代码嵌入到对应的潜在空间中,随后对生成器进行微调。在微调阶段,设计了一种新型的轻量化超网络结构,使得本发明能够在保证图像重建质量的同时,优化模型的参数量和推理时间
2、根据本发明的第一方案,提供了一种基于超网络的低参数gan反演方法,所述方法包括:
3、通过编码器将输入图像映射到w+潜在空间;
4、利用超网络对生成器的权重进行优化,通过优化权重后的生成器对映射到潜在空间的输入图像进行处理,得到目标图像。
5、进一步地,所述潜在空间为stylegan潜在空间,所述stylegan潜在空间由18个不同的512维向量组成,每个向量对应stylegan的各个层,并通过自适应实例标准化接收输入。
6、进一步地,所述通过编码器将输入图像映射到潜在空间,包括:
7、基于psp框架,利用特征金字塔编码器生成粗、中、细三个级别的特征映射,
8、使用map2style作为中间网络,从各个级别的特征映射中提取样式信息,并根据样式信息对应的层次结构将样式信息与潜在空间对齐。
9、进一步地,所述编码器将输入图像x编码为潜在向量w∈w+,其中w的维度为r512,包含输入图像中的语义信息。
10、进一步地,所述利用轻量化超网络对生成器的权重进行优化,包括:
11、通过超网络学习残差权重,并使用残差权重更新生成器中对应的卷积层。
12、进一步地,假设预训练的stylegan生成器有n个卷积层,权重表示为θconv=(θ1,...,θn),通过超网络学习对应卷积层的偏移量δθj,具体如公式1其中wz和bz是超网络的权重和偏置参数,用来将接收的特征向量映射到一个中间表示;relu表示修正线性单元激活函数wo和bo是用来生成我们网络参数的权重和偏置。更新后的生成器的卷积权重为
13、δθj=h(z)=wo·relu(wz·z+bz)+bo#(1)
14、进一步地,所述通过超网络学习残差权重,并使用残差权重更新生成器中对应的卷积层,包括:
15、基于预训练的arcface网络来捕获人脸的身份特征;
16、在输入初始潜码和原始图像x后,通过arcface最后一个卷积层输出特征图fc:其中c代表输入通道数,fc是16×16×512的特征图;
17、将所述特征图传入多通道并行计算模块,具体如公式(2)所示。其中wi是共享给多个通道计算的参数集合,n代表通道数。利用并行计算的优势,我们能够同时处理多个通道的特征图,从而加速了计算过程。此外,参数共享策略减少了需要优化的参数数量,降低了模型的复杂度和训练的计算成本。有效地提升了stylegan生成器权重优化效率。;所述多通道并行计算模块包括空间重建单元(sru)和通道重建单元。
18、
19、根据本发明的第二技术方案,提供一种基于超网络的低参数gan反演装置,所述装置包括:
20、编码模块,被配置为通过编码器将输入图像映射到w+潜在空间;
21、生成模块,被配置为利用超网络对生成器的权重进行优化,通过优化权重后的生成器对映射到潜在空间的输入图像进行处理,得到目标图像。
22、进一步地,所述潜在空间为stylegan潜在空间,所述stylegan潜在空间由18个不同的512维向量组成,每个向量对应stylegan的各个层,并通过自适应实例标准化接收输入。
23、根据本发明的第三技术方案,提供一种可读存储介质,所述可读存储介质存储有一个或者多个程序,所述一个或者多个程序可被一个或者多个处理器执行,以实现如上所述的方法。
24、本发明至少具有以下有益效果:
25、本发明通过对特定的细节特征信息所在的分布层进行权重优化调整和轻量化超网络设计,大大减少了模型训练时的参数和处理图像所需的时间,并且我们的模型在保持低参数量的同时,能够达到或超越现有方法的表现水平。这意味着我们能够在较短的时间内获得更优秀的性能。在编辑方面,我们的模型可以更好的保持身份一致性。
1.一种基于超网络的低参数gan反演方法,其特征在于,所述方法包括:
2.根据权利要求1所述的方法,其特征在于,所述潜在空间为stylegan潜在空间,所述stylegan潜在空间由18个不同的512维向量组成,每个向量对应stylegan的各个层,并通过自适应实例标准化接收输入。
3.根据权利要求2所述的方法,其特征在于,所述通过编码器将输入图像映射到潜在空间,包括:
4.根据权利要求1所述的方法,其特征在于,所述编码器将输入图像x编码为潜在向量w∈w+,其中w的维度为r512,包含输入图像中的语义信息。
5.根据权利要求1所述的方法,其特征在于,所述利用轻量化超网络对生成器的权重进行优化,包括:
6.根据权利要求5所述的方法,其特征在于,假设预训练的stylegan生成器有n个卷积层,权重表示为θconv=(θ1,...,θn),通过超网络学习对应卷积层的偏移量δθj,更新后的生成器的卷积权重为
7.根据权利要求5所述的方法,其特征在于,所述通过超网络学习残差权重,并使用残差权重更新生成器中对应的卷积层,包括:
8.一种基于超网络的低参数gan反演装置,其特征在于,所述装置包括:
9.根据权利要求8所述的装置,其特征在于,所述潜在空间为stylegan潜在空间,所述stylegan潜在空间由18个不同的512维向量组成,每个向量对应stylegan的各个层,并通过自适应实例标准化接收输入。
10.一种可读存储介质,其特征在于,所述可读存储介质存储有一个或者多个程序,所述一个或者多个程序可被一个或者多个处理器执行,以实现如权利要求1至7中任一项所述的方法。
