场景深度估计模型训练方法、场景深度估计方法及装置与流程

专利2026-08-22  10


本说明书涉及计算机视觉,尤其涉及一种场景深度估计模型训练方法、场景深度估计方法及装置。


背景技术:

1、场景深度估计旨在确定某一特定空间区域内各点到探测器的距离,在三维重建、即时定位、机器人视觉导航等多种视觉计算场景中具有重要应用。

2、考虑到利用神经网络训练单目图像深度估计模型,需要大量带有深度信息(作为标签)的训练样本。由于对采集的真实单目图像进行逐像素深度信息的标记耗时且成本高,所以,大多基于无监督域自适应的单目图像深度估计方法;然而,这种无监督微调方式由于缺乏真实标签信息的引入导致训练不稳定。

3、可见,现有单目图像的场景深度估计模型的训练方案会导致训练得到的模型稳定性较差。


技术实现思路

1、本说明书实施例的目的是提供一种场景深度估计模型训练方法、场景深度估计方法及装置,以解决现有技术中单目图像的场景深度估计模型稳定性较差的问题。

2、为解决上述技术问题,本说明书实施例是这样实现的:

3、第一方面,提出了一种场景深度估计模型训练方法,包括:

4、获取图像样本集;其中,所述图像样本集中包含图像样本和真实场景深度图;所述图像样本,包括:真实图像、第一合成图像以及第二合成图像;所述真实场景深度图,为所述第一合成图像对应的真实场景深度图;所述真实图像为单目图像;所述第二合成图像,通过将所述真实图像的颜色信息迁移至所述第一合成图像得到;

5、循环执行下述操作,直至获得训练收敛的所述神经网络模型,作为场景深度估计模型:

6、将所述图像样本输入神经网络模型,以得到所述神经网络模型预测的所述图像样本的预测场景深度图;

7、根据三元损失函数值,调整所述神经网络模型的参数;

8、所述三元损失函数值包含:基于所述真实场景深度图确定的有监督学习损失函数值,以及,基于所述真实图像的预测场景深度图确定的自监督学习损失函数值。

9、第二方面,提出了一种场景深度估计方法,包括:

10、获取待检测图像;

11、将所述待检测图像输入场景深度估计模型,以获得所述场景深度估计模型输出的所述待检测图像的场景深度;其中,所述单目图像场景深度估计模型,基于图像样本集训练得到;所述图像样本集中包含图像样本和真实场景深度图;所述图像样本,包括:真实图像、第一合成图像以及第二合成图像;所述真实场景深度图,为所述第一合成图像对应的真实场景深度图;所述真实图像为单目图像;所述第二合成图像,通过将所述真实图像的颜色信息迁移至所述第一合成图像得到。

12、第三方面,提出了一种场景深度估计模型训练装置,包括:

13、获取模块,用于获取图像样本集;其中,所述图像样本集中包含图像样本和真实场景深度图;所述图像样本,包括:真实图像、第一合成图像以及第二合成图像;所述真实场景深度图,为所述第一合成图像对应的真实场景深度图;所述真实图像为单目图像;所述第二合成图像,通过将所述真实图像的颜色信息迁移至所述第一合成图像得到;

14、执行模块,用于循环执行下述操作,直至获得训练收敛的所述神经网络模型,作为场景深度估计模型:

15、将所述图像样本输入神经网络模型,以得到所述神经网络模型预测的所述图像样本的预测场景深度图;

16、根据三元损失函数值,调整所述神经网络模型的参数;

17、所述三元损失函数值包含:基于所述真实场景深度图确定的有监督学习损失函数值,以及,基于所述真实图像的预测场景深度图确定的自监督学习损失函数值。

18、第四方面,提出了一种场景深度估计装置,包括:

19、获取模块,用于获取待检测图像;

20、估计模块,用于将所述待检测图像输入场景深度估计模型,以获得所述场景深度估计模型输出的所述待检测图像的场景深度;其中,所述单目图像场景深度估计模型,基于图像样本集训练得到;所述图像样本集中包含图像样本和真实场景深度图;所述图像样本,包括:真实图像、第一合成图像以及第二合成图像;所述真实场景深度图,为所述第一合成图像对应的真实场景深度图;所述真实图像为单目图像;所述第二合成图像,通过将所述真实图像的颜色信息迁移至所述第一合成图像得到。

21、第五方面,提出了一种电子设备,包括:

22、处理器;以及

23、被安排成存储计算机可执行指令的存储器,所述可执行指令在被执行时使所述处理器执行第一方面所述的场景深度估计模型训练方法的步骤,和/或,执行第二方面所述的场景深度估计方法的步骤。

24、第六方面,提出了一种计算机可读存储介质,所述计算机可读存储介质存储一个或多个程序,所述一个或多个程序当被包括多个应用程序的电子设备执行时,使得所述电子设备执行第一方面所述的场景深度估计模型训练方法的步骤,和/或,执行第二方面所述的场景深度估计方法的步骤。

25、第七方面,提出了一种计算机程序产品,所述计算机可读存储介质存储一个或多个程序,所述一个或多个程序当被包括多个应用程序的电子设备执行时,使得所述电子设备执行第一方面所述的场景深度估计模型训练方法的步骤,和/或,执行第二方面所述的场景深度估计方法的步骤。

26、由以上本说明书实施例提供的技术方案可见,获取包含真实图像、第一合成图像和第二合成图像的图像样本集,该第一合成图像是通过真实图像的场景模拟得到,且该第一合成图像包含真实场景深度图;第二合成图像是第一合成图像基于真实图像的颜色信息迁移得到;将获取的图像样本集输入神经网络模型,输出所述图像样本的集中图像样本的预测场景深度图,然后基于预测场景深度图和真实场景深度图确定的三元损失函数值,调整神经网络模型的参数,如此反复调试将神经网络模型收敛为场景深度估计模型。这样,可以充分利用具有真实场景深度图的合成图像作为图像样本来指导神经网络模型的训练,提升神经网络模型的训练稳定性,以得到更为精准收敛的场景深度估计模型。



技术特征:

1.一种场景深度估计模型训练方法,其特征在于,包括:

2.如权利要求1所述的模型训练方法,其特征在于,第一合成图像基于所述真实图像的颜色信息迁移得到第二合成图像时,包括:

3.如权利要求1所述的模型训练方法,其特征在于,将所述图像样本集输入神经网络模型,得到所述神经网络模型预测的所述图像样本的预测场景深度图,包括:

4.如权利要求3所述的模型训练方法,其特征在于,基于构造的多层级混合注意力映射,将所述多层级视觉编码特征逐级映射,得到所述图像样本集中每个图像样本的预测场景深度图,包括:

5.如权利要求4所述的模型训练方法,其特征在于,所述多层级混合注意力映射中,每一层级混合注意力映射包含:通道交叉注意力映射、空间交叉注意力映射和查询交叉注意力映射;

6.如权利要求1-5任一项所述的模型训练方法,其特征在于,

7.一种场景深度估计方法,其特征在于,包括:

8.一种场景深度估计模型训练装置,其特征在于,包括:

9.一种场景深度估计装置,其特征在于,包括:

10.一种计算机可读存储介质,所述计算机可读存储介质存储一个或多个程序,所述一个或多个程序当被包括多个应用程序的电子设备执行时,使得所述电子设备执行权利要求1-6任一项所述的场景深度估计模型训练方法的步骤,和/或,执行权利要求7所述的场景深度估计方法的步骤。

11.一种计算机程序产品,所述计算机可读存储介质存储一个或多个程序,所述一个或多个程序当被包括多个应用程序的电子设备执行时,使得所述电子设备执行权利要求1-6任一项所述的场景深度估计模型训练方法的步骤,和/或,执行权利要求7所述的场景深度估计方法的步骤。


技术总结
本说明书实施例公开了一种场景深度估计模型训练方法、场景深度估计方法及装置,该方法包括:获取包含真实图像、第一合成图像和第二合成图像的图像样本集,该第一合成图像是通过真实图像的场景模拟得到,且包含真实场景深度图;第二合成图像是第一合成图像基于真实图像的颜色信息迁移得到;将获取的图像样本集输入神经网络模型,输出图像样本的集中图像样本的预测场景深度图,基于预测场景深度图和真实场景深度图确定的三元损失函数值,调整神经网络模型的参数,如此反复调试将神经网络模型收敛为场景深度估计模型。这样,可以充分利用具有真实场景深度图的合成图像指导神经网络模型的训练,提升训练稳定性,以得到精准收敛的场景深度估计模型。

技术研发人员:余家忠,李飞,靳志娟,梁清华,刘子伟,曹润东,刘昱含
受保护的技术使用者:中国铁塔股份有限公司
技术研发日:
技术公布日:2024/6/26
转载请注明原文地址:https://doc.8miu.com/read-1833266.html

最新回复(0)