本发明属于模型构建,具体涉及一种车险投保赔付风险预测模型构建方法、装置、设备及介质。
背景技术:
1、在客户申请对车辆不同险种进行投保或续保过程中,保险公司需对车辆的风险进行评级,作为是否对保单核准投保以及保单差异化定价的依据。
2、随着近几年来车联网技术的发展,相关数据维度也更加丰富和复杂,这也面临着如何改进现有常用的车险投保赔付风险预测模型的需求,以便提高模型的风险预测能力以及稳定性。
技术实现思路
1、本发明的目的是提供一种车险投保赔付风险预测模型构建方法、装置、计算机设备及计算机可读存储介质,用以解决现有车险投保赔付风险预测模型所存在风险预测能力以及稳定性有待提高的问题。
2、为了实现上述目的,本发明采用以下技术方案:
3、第一方面,提供了一种车险投保赔付风险预测模型构建方法,包括:
4、获取以目标车险的保单号为主键的原始数据集合,其中,在所述原始数据集合中与所述保单号对应的键值数据包含有建模所需的且基于保单赔付信息加工好的多个因变量特征,所述保单赔付信息包含有投保地区、保费、险种覆盖度、保费密度、出险赔付率、是否出险、出险频次和赔付强度;
5、基于不同投保地区的险种覆盖度、保费、保费密度和出险赔付率,对所述原始数据集合中的所有所述键值数据进行层次聚类分析处理,得到k个数据类,其中,k表示大于等于3的正整数;
6、针对在所述k个数据类中的各个数据类,对在属于对应类的键值数据中的所述多个因变量特征进行特征初筛处理,得到对应的离散特征组合;
7、针对所述各个数据类,将属于对应类的所有样本数据划分为对应的且与多个赔付风险等级一一对应的多个风险子集,并从该多个风险子集的每一个风险子集中分别抽取一部分所述样本数据组成对应的验证集,以及从所述每一个风险子集中分别抽取另一部分所述样本数据组成对应的训练集,其中,所述样本数据包含有根据在属于对应类的键值数据中的所述多个因变量特征处理得到的所述离散特征组合,所述多个赔付风险等级预先根据基于出险率、赔付强度和/或赔付额制定的等级划分规则划分确定;
8、针对所述各个数据类,利用对应的训练集进行广义回归建模,得到对应的且基于广义线性模型的车险投保赔付风险预测模型,其中,所述车险投保赔付风险预测模型包括有出险率预测模型、赔付强度预测模型和/或赔付额预测模型;
9、针对所述各个数据类,利用对应的验证集和对应的车险投保赔付风险预测模型,进行模型效果评估,得到模型效果评估结果。
10、基于上述
技术实现要素:
,提供了一种基于层次聚类算法的车险投保赔付风险预测模型构建新方案,即在获取以目标车险的保单号为主键的原始数据集合后,先基于不同投保地区的险种覆盖度、保费、保费密度和出险赔付率,对所述原始数据集合中的所有所述键值数据进行层次聚类分析处理,得到k个数据类,然后针对各个数据类,对在属于对应类的键值数据中的所述多个因变量特征进行特征初筛处理,得到对应的离散特征组合,以及将属于对应类的所有样本数据划分为对应的且与多个赔付风险等级一一对应的多个风险子集,并组合得到对应的验证集和训练集,最后针对所述各个数据类,利用对应的训练集进行广义回归建模,得到对应的且基于广义线性模型的车险投保赔付风险预测模型,并完成模型效果评估,如此可以有效提高模型的风险预测能力以及稳定性,便于实际应用和推广。
11、在一个可能的设计中,基于不同投保地区的险种覆盖度、保费、保费密度和出险赔付率,对所述原始数据集合中的所有所述键值数据进行层次聚类分析处理,得到k个数据类,包括:
12、根据不同的投保地区,将所述原始数据集合划分成与m个投保地区一一对应的m个原始数据子集合,其中,m表示投保地区总数;
13、针对在所述m个原始数据子集合中的各个原始数据子集合,以保费、保险深度和保险密度作为聚类变量,对在对应子集合中的所有所述键值数据进行层次聚类分析处理,得到对应的至少两个数据类;
14、对所述各个原始数据子集合的至少两个数据类进行合并,得到k个数据类,其中,k表示大于等于3的正整数。
15、在一个可能的设计中,对所述各个原始数据子集合的至少两个数据类进行合并,得到k个数据类,包括如下步骤s231~s234:
16、s231.汇总所述各个原始数据子集合的至少两个数据类,得到数据类集合,然后执行步骤s232;
17、s232.判断所述数据类集合中的数据类总数是否大于k,若是,则执行步骤s233,否则将所述数据类集合作为合并结果,得到k个数据类,其中,k表示大于等于3的正整数;
18、s233.分别计算得到在所述数据类集合中的各对数据类的距离,然后执行步骤s234,其中,所述各对数据类的距离按照如下公式计算得到:
19、
20、式中,i和j分别表示正整数,dij表示在所述数据类集合中的第i个数据类与第j个数据类的距离,p表示聚类变量总数,p表示小于等于p的正整数,表示在所述第i个数据类中第p个聚类变量的重心,表示在所述第j个数据类中第p个聚类变量的重心;
21、s234.根据所述各对数据类的距离,在所述数据类集合中将具有最短距离的某对数据类合并为一个数据类,得到新的数据类集合,然后返回执行步骤s232。
22、在一个可能的设计中,针对在所述k个数据类中的各个数据类,对在属于对应类的键值数据中的所述多个因变量特征进行特征初筛处理,得到对应的离散特征组合,包括:
23、针对在所述k个数据类中的各个数据类,按照如下方式对在属于对应类的键值数据中的所述多个因变量特征进行连续特征离散化处理:先使用是否出险、出险频次和赔付强度作为目标变量,对因变量特征进行基于信息熵的离散化分箱处理,得到至少两个离散特征,然后计算在所述至少两个离散特征中的各个离散特征的信息熵大小;
24、针对所述各个数据类,按照如下方式对根据在属于对应类的键值数据中的所述多个因变量特征处理得到的所有离散特征进行特征初步筛选处理以得到对应的离散特征组合:先使用信息熵初步对所述所有离散特征的风险区分能力进行排名,并剔除区分能力太弱的离散特征,然后分别计算得到在剩余离散特征中的各对离散特征的相关性,并针对相关性超过预设阈值的某对离散特征,剔除该某对离散特征中具有较低信息熵的某个离散特征。
25、在一个可能的设计中,针对所述各个数据类,从该多个风险子集的每一个风险子集中分别抽取一部分所述样本数据组成对应的验证集,包括:
26、针对所述各个数据类,从该多个风险子集的每一个风险子集中,分别按照保单时间分布抽取一部分跨时间的所述样本数据,然后组合所有抽取结果,得到对应的验证集。
27、在一个可能的设计中,针对所述各个数据类,利用对应的训练集进行广义回归建模,得到对应的且基于广义线性模型的车险投保赔付风险预测模型,包括:
28、针对所述各个数据类,利用对应的训练集,基于广义线性模型构建对应的且目标变量满足泊松分布假设的出险率预测模型、目标变量满足伽马假设或逆高斯假设的赔付强度预测模型和/或目标变量满足tweedie分布的赔付额预测模型;
29、针对所述各个数据类,逐步筛选对应的离散特征组合以得到对应的最终特征组合;
30、针对所述各个数据类,按照如下方式进行假设分布检验及模型选择:统计模型及因子的统计量,然后根据统计结果对比出险率预测模型、赔付强度预测模型和/或赔付额预测模型在不同分布假设下的模型拟合效果及因子的显著性,最后根据对比结果选择在最优分布假设下的出险率预测模型、赔付强度预测模型和/或赔付额预测模型,其中,所述模型及因子的统计量包含有残差以及因子置信度p值。
31、在一个可能的设计中,针对所述各个数据类,逐步筛选对应的离散特征组合以得到对应的最终特征组合,包括有如下步骤s521~s525:
32、s521.结合业务含义和最大信息熵,从离散特征组合中挑选1~2个离散特征作为初始变量组合,然后执行步骤s522;
33、s522.针对在所述初始变量组合中的各个变量,将对应变量下的各个分类独热化,拆分成多个二分类变量,并将属于对应变量下的二分类变量赋值1,否则赋值0,然后执行步骤s523;
34、s523.基于所述初始变量组合分别计算残差、皮尔森卡方统计量以及aic值,然后执行步骤s524,其中,aic值的计算公式如下:
35、aic=2×k-2×lnl
36、式中,k表示变量数目,l表示在基于假设分布下对目标变量的似然函数;
37、s524.向所述初始变量组合添加在所述离散特征组合中的任意一个特征,然后执行步骤s525;
38、s525.分别评估添加特征后的共线性情况以及aic值,并保留aic值减小最多且满足共线性及显著性情况要求的添加特征,然后执行步骤s526;
39、s526.继续向所述初始变量组合添加在所述离散特征组合中的任意一个未添加特征,然后返回执行步骤s525,直到添加特征数目达到预期上限或者aic值没有减少及不能满足共线性要求,最后将此时的所述初始变量组合确定为最终特征组合。
40、第二方面,提供了一种车险投保赔付风险预测模型构建装置,包括有依次通信连接的原始数据获取模块、层次聚类分析模块、特征初筛处理模块、集合抽取处理模块、预测模型构建模块和预测模型验证模块;
41、所述原始数据获取模块,用于获取以目标车险的保单号为主键的原始数据集合,其中,在所述原始数据集合中与所述保单号对应的键值数据包含有建模所需的且基于保单赔付信息加工好的多个因变量特征,所述保单赔付信息包含有投保地区、保费、险种覆盖度、保费密度、出险赔付率、是否出险、出险频次和赔付强度;
42、所述层次聚类分析模块,用于基于不同投保地区的险种覆盖度、保费、保费密度和出险赔付率,对所述原始数据集合中的所有所述键值数据进行层次聚类分析处理,得到k个数据类,其中,k表示大于等于3的正整数;
43、所述特征初筛处理模块,用于针对在所述k个数据类中的各个数据类,对在属于对应类的键值数据中的所述多个因变量特征进行特征初筛处理,得到对应的离散特征组合;
44、所述集合抽取处理模块,用于针对所述各个数据类,将属于对应类的所有样本数据划分为对应的且与多个赔付风险等级一一对应的多个风险子集,并从该多个风险子集的每一个风险子集中分别抽取一部分所述样本数据组成对应的验证集,以及从所述每一个风险子集中分别抽取另一部分所述样本数据组成对应的训练集,其中,所述样本数据包含有根据在属于对应类的键值数据中的所述多个因变量特征处理得到的所述离散特征组合;
45、所述预测模型构建模块,用于针对所述各个数据类,利用对应的训练集进行广义回归建模,得到对应的且基于广义线性模型的车险投保赔付风险预测模型,其中,所述车险投保赔付风险预测模型包括有出险率预测模型、赔付强度预测模型和/或赔付额预测模型;
46、所述预测模型验证模块,用于针对所述各个数据类,利用对应的验证集和对应的车险投保赔付风险预测模型,进行模型效果评估,得到模型效果评估结果。
47、第三方面,本发明提供了一种计算机设备,包括有依次通信连接的存储器、处理器和收发器,其中,所述存储器用于存储计算机程序,所述收发器用于收发消息,所述处理器用于读取所述计算机程序,执行如第一方面或第一方面中任意可能设计所述的车险投保赔付风险预测模型构建方法。
48、第四方面,本发明提供了一种计算机可读存储介质,所述计算机可读存储介质上存储有指令,当所述指令在计算机上运行时,执行如第一方面或第一方面中任意可能设计所述的车险投保赔付风险预测模型构建方法。
49、第五方面,本发明提供了一种包含指令的计算机程序产品,当所述指令在计算机上运行时,使所述计算机执行如第一方面或第一方面中任意可能设计所述的车险投保赔付风险预测模型构建方法。
50、上述方案的有益效果:
51、(1)本发明创造性提供了一种基于层次聚类算法的车险投保赔付风险预测模型构建新方案,即在获取以目标车险的保单号为主键的原始数据集合后,先基于不同投保地区的险种覆盖度、保费、保费密度和出险赔付率,对所述原始数据集合中的所有所述键值数据进行层次聚类分析处理,得到k个数据类,然后针对各个数据类,对在属于对应类的键值数据中的所述多个因变量特征进行特征初筛处理,得到对应的离散特征组合,以及将属于对应类的所有样本数据划分为对应的且与多个赔付风险等级一一对应的多个风险子集,并组合得到对应的验证集和训练集,最后针对所述各个数据类,利用对应的训练集进行广义回归建模,得到对应的且基于广义线性模型的车险投保赔付风险预测模型,并完成模型效果评估,如此可以有效提高模型的风险预测能力以及稳定性,便于实际应用和推广;
52、(2)可对各个省份的车险收入,车险人均投保,各险种渗透情况作为聚类变量实现对各个地区的车险发展及风险水平进行层次归类;
53、(3)可根据车辆投保或停靠最多城市地区进行评估划分,并在足够样本下针对不同地区对投保用户定制化分群建模,可提高模型的风险预测能力;
54、(4)考虑在目前应用的车险费率厘定及风险评级的广义线性模型中,通常使用单因子分析根据信息熵大小来挑选特征,在有限的风险分类单元数情况下,选用因子数量由于相关性影响,难以挑选出最优的特征组合,而本发明创造是在建模过程中,先初步使用信息熵方式进行初步筛选后,再结合aic对变量进行逐步选择,可获得更优的特征组合,进一步提高模型预测效果。
1.一种车险投保赔付风险预测模型构建方法,其特征在于,包括:
2.根据权利要求1所述的车险投保赔付风险预测模型构建方法,其特征在于,基于不同投保地区的险种覆盖度、保费、保费密度和出险赔付率,对所述原始数据集合中的所有所述键值数据进行层次聚类分析处理,得到k个数据类,包括:
3.根据权利要求2所述的车险投保赔付风险预测模型构建方法,其特征在于,对所述各个原始数据子集合的至少两个数据类进行合并,得到k个数据类,包括如下步骤s231~s234:
4.根据权利要求1所述的车险投保赔付风险预测模型构建方法,其特征在于,针对在所述k个数据类中的各个数据类,对在属于对应类的键值数据中的所述多个因变量特征进行特征初筛处理,得到对应的离散特征组合,包括:
5.根据权利要求1所述的车险投保赔付风险预测模型构建方法,其特征在于,针对所述各个数据类,从该多个风险子集的每一个风险子集中分别抽取一部分所述样本数据组成对应的验证集,包括:
6.根据权利要求1所述的车险投保赔付风险预测模型构建方法,其特征在于,针对所述各个数据类,利用对应的训练集进行广义回归建模,得到对应的且基于广义线性模型的车险投保赔付风险预测模型,包括:
7.根据权利要求6所述的车险投保赔付风险预测模型构建方法,其特征在于,针对所述各个数据类,逐步筛选对应的离散特征组合以得到对应的最终特征组合,包括有如下步骤s521~s525:
8.一种车险投保赔付风险预测模型构建装置,其特征在于,包括有依次通信连接的原始数据获取模块、层次聚类分析模块、特征初筛处理模块、集合抽取处理模块、预测模型构建模块和预测模型验证模块;
9.一种计算机设备,其特征在于,包括有依次通信连接的存储器、处理器和收发器,其中,所述存储器用于存储计算机程序,所述收发器用于收发消息,所述处理器用于读取所述计算机程序,执行如权利要求1~7中任意一项所述的车险投保赔付风险预测模型构建方法。
10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有指令,当所述指令在计算机上运行时,执行如权利要求1~7中任意一项所述的车险投保赔付风险预测模型构建方法。
