本发明涉及强化学习,特别是涉及一种无人系统稳定决策方法、产品、介质及设备。
背景技术:
1、深度强化学习的稳定性是指强化学习算法在同一任务中,经过训练后稳定收敛到最优策略的能力。强化学习算法需要无人系统与环境不断交互,来不断优化自身策略,最终寻找到当前任务的最优策略。而在这一过程中,即使环境保持不变,强化学习算法训练过程中无人系统自身策略的不断迭代,也会导致不同时间段的策略采集到的数据分布不同,也会引起模型的性能下降。如何降低数据漂移(数据分布随着时间和空间变化的现象)对强化学习模型的影响目前仍没有完善的解决方案。
2、数据漂移会使异策略(off-policy)的深度强化学习算法在值函数估计的过程中存在对q值的过估计现象,导致其无法收敛。针对这个问题,double dqn将最优动作的选择和目标q值的计算解耦,通过不同的两个网络完成,解决了离散动作空间下,值函数的过估计问题。双延迟深度确定性策略梯度(twin delayed deep deterministic policygradient,td3)继承了double dqn的思路,设计了两个价值网络和一个策略网络,每次选择两个网络中q值较小的作为估计的结果。此外,将集成学习的思想与深度强化学习结合,也有助于降低值函数的过估计,随机集成双q学习(randomized ensembled double q-learning,redq)将多个critic网络集成,每次随机选择其中两个,再将二者中较小的q值作为值函数估计的结果。
3、此外,还有一种观点认为,由于智能体训练过程中不断更新策略,使得智能体与环境交互得到的数据的分布会逐渐偏移,早期的经验对神经网络的影响会持续到训练后期,从而无法收敛到最优策略。文献“transient non-stationarity and generalisation indeep reinforcement learning”提出了一种迭代再学习(iterated relearning,iter)算法,首次将知识蒸馏思想引入深度强化学习。iter算法的主要目的是通过迭代的方式训练出一个学生模型,该学生模型能够学习教师的策略和价值函数。算法的主要实现过程包括以下几个步骤:a.在每个迭代步骤中,使用教师模型的输出和学生在当前策略和价值函数下的输出之间的不一致性作为监督损失,即lπ和lv。b.引入额外的两个损失项lpg和ltd,它们是以异策略的方式进行强化学习的目标,用于更新策略网络和价值网络。c.在每个迭代中,学习一系列的策略和价值函数,用πk(a|s)和vk(s)表示,其参数为θk。d.使用参数θk+1训练学生模型,将lπ和lv作为监督损失,lpg和ltd作为异策略强化学习损失,进行组合训练。e.从初始策略π0和价值函数v0开始,然后从迭代k=0开始重复以上步骤。通过上述的迭代过程,学生模型能够逐渐学习并接近教师的策略和价值函数,从而达到预定的目标。迭代再学习通过将知识蒸馏的思想与深度强化学习相结合,不断在使用当前策略训练新的学生网络,并替换原网络,排除了数据分布偏移对智能体的影响。但是学生网络的替换频率难以设计,很容易引起模型决策能力下降甚至崩溃。
4、迭代再学习方法判断是否进行知识蒸馏根据的是预先设置的超参数。当模型训练一定步长后,无论模型决策效果如何,都会进行知识蒸馏的操作。这使得迭代再学习方法对环境的变化极为敏感,需要为不同的环境设计不同的超参数。而如果在面向现实世界任务的仿真场景中训练时,如果超参数设置较小,会导致智能体决策模型崩溃;如果超参数设置较大,则会浪费大量的训练时间。在部分场景中,训练学生网络所需的时间和迭代次数,接近从零开始训练一个新的网络并收敛。这些问题使得基于知识蒸馏的深度强化学习方法的应用范围受到了限制。这一缺陷导致迭代再学习方法很难具有实际的应用价值。
5、总的来说,环境中数据分布发生变化,会引起智能体决策能力的下降,即决策的不稳定。而现有的方法分别从降低过估计和去除旧分布数据影响两个层面来解决这一问题,但是学生网络的替换频率难以设计,很容易引起模型决策能力下降甚至崩溃。
6、综上,如何降低无人系统策略从虚拟到现实世界迁移过程中,数据分布变化引起的决策模型稳定性下降的问题,成为本领域技术人员亟待解决的问题。
技术实现思路
1、本发明的目的是提供一种无人系统稳定决策方法、产品、介质及设备,以降低无人系统策略从虚拟到现实世界迁移过程中,数据分布变化引起的决策模型稳定性下降的问题。
2、为实现上述目的,本发明提供了如下方案。
3、一方面,本发明提供一种无人系统稳定决策方法,包括:
4、步骤s1:初始化无人系统任务环境、经验池、策略网络的参数、集成策略价值网络的参数以及学生价值网络的参数;所述集成策略价值网络包括多个价值网络;
5、步骤s2:将无人系统与环境交互产生的数据存储于所述经验池;
6、步骤s3:从所述经验池中随机采样一批训练数据,计算所述集成策略价值网络的损失函数,并更新所述集成策略价值网络的参数;
7、步骤s4:将所述集成策略价值网络作为知识蒸馏的教师网络,计算知识蒸馏过程中所述学生价值网络的综合损失,并更新所述学生价值网络的参数;所述学生价值网络用于对所述集成策略价值网络中的每一个价值网络进行知识蒸馏;
8、步骤s5:计算所述集成策略价值网络和所述学生价值网络的累计误差评分;
9、步骤s6:根据所述集成策略价值网络和所述学生价值网络的累计误差评分,对所述集成策略价值网络进行替换,得到更新后的集成策略价值网络;
10、步骤s7:根据所述更新后的集成策略价值网络,计算所述策略网络的损失函数,并更新所述策略网络的参数;
11、步骤s8:判断更新迭代次数是否达到预设阈值;
12、若否,则返回步骤s2;
13、若是,则执行步骤s9:保存所述策略网络的参数,得到用于决策的策略网络。
14、可选地,从所述经验池中随机采样一批训练数据,计算所述集成策略价值网络的损失函数,并更新所述集成策略价值网络的参数,具体包括:
15、从所述经验池中随机采样一批训练数据,包含多个状态动作对;
16、对于采样的状态,使用所述集成策略价值网络和所述策略网络计算得到多个价值,并从所述多个价值中随机选择两个价值作为目标价值,得到两个目标价值;
17、在最小的所述目标价值基础上增加熵,得到增加熵后的目标价值;
18、根据所述增加熵后的目标价值,计算所述集成策略价值网络中的每一个价值网络的损失函数;
19、采用adam优化器,根据所述集成策略价值网络中的每一个价值网络的损失函数,使用随机梯度下降法依次更新所述集成策略价值网络中的每一个价值网络的参数。
20、可选地,将所述集成策略价值网络作为知识蒸馏的教师网络,计算知识蒸馏过程中所述学生价值网络的综合损失,并更新所述学生价值网络的参数,具体包括:
21、在所述集成策略价值网络部分使用基于输出的知识蒸馏,将所述学生价值网络与所述集成策略价值网络在同一状态-动作对下,对值的估计的差作为蒸馏损失;
22、直接使用时序差分误差来更新所述学生价值网络,得到所述学生价值网络的损失;
23、将所述蒸馏损失和所述学生价值网络的损失相加,得到知识蒸馏过程中所述学生价值网络的综合损失;
24、采用adam优化器,根据知识蒸馏过程中所述学生价值网络的综合损失,使用随机梯度下降法更新所述学生价值网络的参数。
25、可选地,计算所述集成策略价值网络和所述学生价值网络的累计误差评分,具体包括:
26、计算所述集成策略价值网络中的每一个价值网络的累计误差评分;
27、计算所述学生价值网络的累计误差评分。
28、可选地,根据所述集成策略价值网络和所述学生价值网络的累计误差评分,对所述集成策略价值网络进行替换,得到更新后的集成策略价值网络,具体包括:
29、比较并获取所述集成策略价值网络中的每一个价值网络的累计误差评分与所述学生价值网络的累计误差评分中最大的累计误差评分,若最大的累计误差评分对应的网络不是所述学生价值网络,则将最大的累计误差评分对应的网络与所述学生价值网络进行替换,得到更新后的集成策略价值网络和更新后的学生价值网络。
30、可选地,根据所述更新后的集成策略价值网络,计算所述策略网络的损失函数,并更新所述策略网络的参数,具体包括:
31、根据所述更新后的集成策略价值网络中的每一个价值网络,结合策略熵,计算所述策略网络的损失函数;
32、采用adam优化器,根据所述策略网络的损失函数,使用随机梯度下降法更新所述策略网络的参数。
33、另一方面,本发明提供一种计算机程序产品,包括计算机程序,该计算机程序被处理器执行时实现所述无人系统稳定决策方法的步骤。
34、另一方面,本发明还提供一种计算机可读存储介质,其上存储有计算机程序,该计算机程序被处理器执行时实现所述无人系统稳定决策方法的步骤。
35、再一方面,本发明提供一种计算机设备,包括:存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述计算机程序以实现所述无人系统稳定决策方法的步骤。
36、根据本发明提供的具体实施例,本发明公开了以下技术效果:
37、本发明公开的无人系统稳定决策方法、产品、介质及设备,通过集成策略价值函数(即集成策略价值网络),使无人系统能够对数据有更高的学习效率,同时通过知识蒸馏方法,降低数据分布变化引起的泛化性差的问题,通过将知识蒸馏思想引入集成q函数(即集成策略价值函数),实现在排除旧经验影响的同时,提升无人系统对状态估计的准确性,进一步降低了深度强化学习模型迁移到现实世界后决策能力下降的问题,从而最终实现了降低无人系统策略从虚拟到现实世界迁移过程中,数据分布变化引起的决策模型稳定性下降的问题。
1.一种无人系统稳定决策方法,其特征在于,包括:
2.根据权利要求1所述的无人系统稳定决策方法,其特征在于,从所述经验池中随机采样一批训练数据,计算所述集成策略价值网络的损失函数,并更新所述集成策略价值网络的参数,具体包括:
3.根据权利要求1所述的无人系统稳定决策方法,其特征在于,将所述集成策略价值网络作为知识蒸馏的教师网络,计算知识蒸馏过程中所述学生价值网络的综合损失,并更新所述学生价值网络的参数,具体包括:
4.根据权利要求1所述的无人系统稳定决策方法,其特征在于,计算所述集成策略价值网络和所述学生价值网络的累计误差评分,具体包括:
5.根据权利要求4所述的无人系统稳定决策方法,其特征在于,根据所述集成策略价值网络和所述学生价值网络的累计误差评分,对所述集成策略价值网络进行替换,得到更新后的集成策略价值网络,具体包括:
6.根据权利要求5所述的无人系统稳定决策方法,其特征在于,根据所述更新后的集成策略价值网络,计算所述策略网络的损失函数,并更新所述策略网络的参数,具体包括:
7.一种计算机程序产品,包括计算机程序,其特征在于,该计算机程序被处理器执行时实现权利要求1-6中任一项所述无人系统稳定决策方法的步骤。
8.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,该计算机程序被处理器执行时实现权利要求1-6中任一项所述无人系统稳定决策方法的步骤。
9.一种计算机设备,包括:存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序以实现权利要求1-6中任一项所述无人系统稳定决策方法的步骤。
