一种使用注意增强技术的未配对红外到可见光视频转换方法

专利2026-07-22  3


本发明涉及计算视觉领域,特别是涉及一种未配对的红外到可见光视频转换方法。


背景技术:

1、可见光和红外摄像机通常会被用来弥补人眼视觉的不足。可见光摄像机可以提供提供清晰、丰富的视觉信息,在计算机视觉算法中具有广泛的适用性。大多数最先进的视觉算法在良好的可见度条件下表现出卓越的性能。然而,可见摄像机的图像传感器对于黑暗或曝光过度等光照条件敏感,其成像结果在恶劣天气下往往模糊不清。在这种情况下,人们使用红外传感器来弥补可见摄像机的不足。因为热成像原理,红外传感器在捕获与热量相关的视觉信号方面具有优势,可以提供具有足够空间或结构描述的视觉信号。但其缺乏详细的语义信息,很难从中识别物体,图像色彩与成像质量无法很好地满足人们对世界的认知习惯。因此在实际任务中一般不直接使用原始红外数据,例如车辆导航或监控。由此可见,利用采集到的红外信号生成可见的彩色信息具有重要的意义。

2、可见光和红外帧的信息融合是一种经典研究方向,可以用于增强夜视环境。但是融合的结果在视觉上依然不具备多彩的视觉效果,和白天人眼所见相比差别很大。基于图像着色的方法也是红外到可见的一种常见方法。其通过颜色映射等进行图像或视频的着色优化。但是这些方法往往依赖人工设置或是受到参考图像的颜色限制,制约了其实用性。

3、随着深度学习的兴起,图像到图像的转换方法给研究人员带来了新的思路。生成对抗性训练网络(gan)可以在输入一个随机编码z之后,输出一幅由神经网络自动生成的、假的图片g(z)。为增加用户控制能力,条件gan使用配对数据集,实现根据参考域的风格,在保持源域图像内容不变的前提下,生成目标图像。由于成对的源域和参考域图像的数据集难以获取,无监督的gan应运而生。但是红外图像和可见光图像有着巨大差别。一些无监督的gan将红外转换成可见光图像时,其合成图像内容的精确度等还有待优化。


技术实现思路

1、本发明为了克服红外到可见视频转换的不足,提出了一种使用注意增强技术的未配对红外到可见光视频转换方法。该方法能更好地保持转换后的视频与红外视频的内容一致性,而且转换后的视频具有良好的时间相干性。与此同时,本发明能很好地学习白天可见视频的特征,使转换后的视频看起来如同白天拍摄一般具有真实的多彩外观。

2、本发明所采用的的技术方案是:一种使用注意增强技术的未配对红外到可见光视频转换方法,包括以下步骤:

3、步骤1,将红外和白天可见视频剪辑成连续帧,得到相应的源域和目标域。这里的红外视频和可见视频可以不用配对,即红外使用的是夜间拍摄的红外视频,而可见使用的是白天拍摄的可见光视频。只需要两者都是同一个场景,即都为高速公路场景,或者同为城市道路等等。

4、步骤2,使用剪辑好的未配对夜间红外和白天可见光数据集,训练aten网络。目的是获得训练好的生成器。其中,aten网络指的是由resnet生成器、多尺度鉴别器和改进的注意力增强鉴别器组成的生成对抗网络。

5、步骤3,设计了滑动注意的跨域相似性损失、权重优化的patchnce损失对网络优化进行约束,使得转换后的可见帧能和原始的红外帧在内容结构上保持一致。此外还使用了生成对抗网络本身的生成对抗损失以及跨域相似性时间损失。前者是用于生成器和鉴别器对抗优化,后者用于保持转换结果的时间一致性。

6、步骤4,建立红外和可见光的测试集,取训练后的生成器模型,对红外视频帧进行转换测试,得到转换后的白天可见视频帧。除了人眼观察转换后的结果的定性评价,还可以计算测试所得可见帧和真实的可见视频帧之间的fid、kid指标,即可定量评价。

7、进一步地,步骤1中,选取12v-gan提供的irvi数据集,包含6个用于训练(共22080帧)和另外6个用于测试(共2272帧)的剪辑。其内容分别有交通和监控部分,视频分辨率为256×256。另外,还选取了roma提供的infraredcity-lite数据集,其包含城市、高速公路和监控场景,由9个长视频剪辑而成。该数据集的分辨率也为256×256,总共有603,142帧。

8、进一步地,步骤2中,训练aten网络,aten网络模型结构包括:

9、resnet生成器:使用resnet_9blocks,每个resnet块包括两个卷积层、标准化层和relu激活函数,具有可选的dropout。它借鉴了残差网络(resnet)的思想,利用跳跃连接(skip connection)促进梯度的流动,有助于训练更深的网络。

10、多尺度鉴别器:首先,vit将图像划分成大小为的多个patchs,经过线性的投射层操作,以及位置编码,形成可用于transformer架构的tokens。将这些tokens按取平均值的方式缩小重塑成不同的大小,形成多层次。最后送入mlp discriminator判断真实与虚假。

11、改进的注意力增强鉴别器:对从预训练的vit网络提取的结果,一方面进行全局平均池化和全局最大池化操作,然通过全连接层得到一组结果。另一方面,从全连接层的参数中获取权重,对从预训练的vit网络提取的结果进行相应的平均和最大权重优化,经过卷积和反射填充,得到另一组结果。再将两组结果分别计算mse损失,判别真实与虚假。

12、进一步地,步骤3中,各种损失函数的具体说明如下:

13、生成对抗损失函数,分成鉴别器损失函数和生成器损失函数。

14、鉴别器计算转换后的可见帧和代表假的0之间的损失以及输入的红外帧和代表真的1之间的损失。具体为:

15、

16、生成器计算转换后的可见帧和代表真的1之间的损失。具体有:

17、后续的其他损失也会加入中。

18、滑动注意的跨域相似性损失:本发明将多层预训练vit的结果进一步计算基于滑动窗口的自注意,设计了滑动注意的跨域相似性损失。具体地,使用两个swin transformerblocks,以求增加局部关注。由此,vit进行全局注意,swin transformer blocks添加局部注意,使提取的特征信息更为完善。最后计算两者间的跨域相似性损失。目的是使转换后的可见帧和红外帧保持空间上内容和结构的一致性。具体流程为:

19、首先将图像均匀地分割成多个patchs,然后可以计算输入的每个patch与输出的所有patchs交互的相似性映射。同时,通过与输入patchs的交互,也可以得到输出patchs的相似性映射。即:

20、当所有的的patchs都参与计算后,可以得到交叉相似度的集合:

21、

22、从多层的vit中选取若干个层的结果来计算,进一步可以得到:

23、

24、最后,最小化两者之间的余弦距离来优化训练网络:

25、

26、最后,加上滑动注意:

27、权重优化的patchnce损失:本发明对patchnce损失进行权重优化,设计了权重优化的patchnce损失。这是一种对比学习的损失,可以解决配对数据集难以获取的问题。主要研究对象有两种:一个“query”和它的“positive”example,另外作为比较的对象是数据集中其他的点,称之为“negatives”。用向量代表query,positive,而则表示n negatives,是第n个negative。这属于(n+1)路分类问题,计算交叉熵损失,表示正例被判为负例的概率。具体为:

28、

29、不仅输入和输出的整个图像之间需要共享内容,两者的相应patchs也应该具有内容一致性。因此,进行patch划分。同时为了对图像中内容更为复杂的对象增加更多的关注,取相应的网络层权重参数进行权重优化。公式为:

30、

31、跨域相似性时间损失:前面介绍了跨域相似度。跨域相似性旨在保持转换后的可见帧与输入的红外帧结构一致性,同样可以用于度量由于场景运动引起的结构变形。先计算第t转换帧与第t+1红外帧的交叉相似性,以及第t+1转换帧与第t红外帧的交叉相似性。然后计算两者之间的余弦距离,并进一步计算l1损失。公式为:

32、

33、进一步地,步骤4中,将红外帧输入训练好的生成器中,可以得到转换后的可见帧。如果输入的是红外视频的连续帧,那么将输出进行合成,就可以得到转换后的可见视频。本发明选择了fid、kid客观评价指标用于视频性能的评估。“fréchet inception distance”(fid)能够量化生成图像与真实图像之间的相似度,评估生成图像的真实程度。它基于inception网络,具有较高的稳定性和泛化能力,而且针对小样本数据有较好的鲁棒性。“kemel inception distance”(kid)计算生成图像与真实图像在嵌入空间的最大均值差异。它使用三次核,有一个无偏估计,能更好地匹配人眼感知。fid、kid越小,表示生成图像和真实图像具有更多相似的内容和结构。

34、与现有技术相比,本发明的有益效果是:采用了无监督的条件生成对抗网络进行红外到可见的视频转换。加入了注意力机制,设计了改进的注意力增强鉴别器、滑动注意的跨域相似性损失以及权重优化的patchnce损失,对网络进行优化。还使用了多尺度鉴别器和跨域相似性时间损失。前者辅助鉴别真实与虚假,后者使结果保持时间一致性。相比于其他的红外到可见视频转换方法,能更好地学习白天可见风格特征,内容一致性和时间一致性保持较好。

35、下面结合说明书附图对本发明作进一步描述。


技术特征:

1.一种使用注意增强技术的未配对红外到可见光视频转换方法,包括以下步骤:

2.根据权利要求1所述的红外到可见视频转换方法,其特征在于:步骤1的具体过程为:

3.根据权利要求1所述的红外到可见视频转换方法,其特征在于:步骤2的具体过程为:

4.根据权利要求1所述的红外到可见视频转换方法,其特征在于:步骤3的具体过程为:

5.根据权利要求1所述的红外到可见视频转换方法,其特征在于:步骤4的具体过程为:


技术总结
本发明提出了面向未配对的红外和可见光数据集,结合生成对抗网络的一种使用注意增强技术的未配对红外到可见光视频转换方法。将未配对的两组数据集——红外视频和可见视频,剪辑成有序帧,分别称之为源域和目标域。使用剪辑好的数据集,对Resnet生成器、多尺度鉴别器和改进的注意力增强鉴别器组成的生成对抗网络进行训练。另外设计了滑动注意的跨域相似性损失和权重优化PatchNCE损失,约束转换帧和红外帧在空间上的内容一致性。此外,本发明还使用了跨域相似性时间损失,约束转换后的相邻帧的时间一致性。最终,取训练后的生成器用于红外到可见光视频的转换。本发明在保持红外视频内容和时间一致性的同时,使转换后的视频具有白天可见视频的风格特征。

技术研发人员:任侃,林翠华,陈钱
受保护的技术使用者:南京理工大学
技术研发日:
技术公布日:2024/6/26
转载请注明原文地址:https://doc.8miu.com/read-1831919.html

最新回复(0)