本发明公开了一种基于随机森林算法的烟叶品质分类预测方法,涉及烟叶质量评价领域。
背景技术:
1、烟叶原料品质是卷烟产品抽吸品质的基础,对烟叶品质进行识别和分类对卷烟产品配方替代具有重要的现实意义。当前,全国烟叶产区众多,虽按照八大香型进行了生态区域化学,但同香型不同省份、地市及县级产区的烟叶因气候条件、生产措施不同也存在一定的品质差异,如何利用科学方法准确对不同产区烟叶品质进行分类并预测其品质类别是当前卷烟企业亟需攻关的难点之一。
2、传统的烟叶品质包含了烟叶外观质量、化学质量及内在感官质量,对烟叶的分类、分组也开展了部分研究分析,如公开号cn 102920005 a公开了一种烟叶原料分类和分组方法,采集烟草种植地的生态信息,提取所述生态信息的主成分,采用聚类分析法对提取得到的主成分进行聚类分析,获得分类结果,并采集烟叶原料化学成分指标,提取所述化学成分指标的主成分,采用聚类分析法进行聚类分析,得到分组结果,并对分组结果进行验证的方法对烟叶原料分类分组。该方法适用于大批量烟叶样本分类时,对于采集生态信息的全面性和准确性存在难度,且难以快速对即时性样本开展分类和预测;公开号cn 113657452a公开了一种基于主成分分析和超级学习的烟叶质量等级分类预测方法,该方法利用主成分降维后训练基础学习算法并建立分类预测模型,并优化权重组合,创建超级学习模型,利用多类别质量数据实现对烟叶质量等级的分类。该方法需要建立在较大数量样本的基础上,且实现对等级的分类判别,未能对烟叶的品质情况开展预测。
3、综上所述,如何建立一种快速、便捷,能够准确对烟叶品质进行分类预测的方法,是当前亟需解决的重点问题。
技术实现思路
1、本发明针对上述背景技术中的缺陷,提供一种基于随机森林算法的烟叶品质分类预测方法,通过一种专门为烟叶指标特征提出的数据处理过程,利用随机森林算法进行品质分类预测的方法,该方法能够有效的提高烟叶品质分类预测的效率和准确性。
2、为实现上述目的,本发明采用的技术方案如下:一种基于随机森林算法的烟叶品质分类预测方法,其特征在于,包括以下步骤:
3、预处理收集的烟叶样品;
4、获取烟叶样品外观质量、物理指标、化学成分和感官质量的特征指标数据;
5、对获取的特征指标数据进行预处理;
6、按照多维度方法对特征指标数据进行筛选;
7、通过网格搜索方法基于筛选后的特征指标数据获取随机森林模型的预设超参数,并基于随机森林模型的预设超参数,得到烟叶品质分类预测。
8、进一步的,所述预处理收集的烟叶样品具体包括以下步骤:
9、将烟叶样品全部去梗切成0.9±0.1mm宽的烟丝,混匀后选取80g样品;
10、将选取的样品以60℃温度进行烘干,粉碎后过40目筛。
11、进一步的,获取烟叶样品外观质量特征指标数据包括以下步骤:
12、按照《烤烟》gb2635-92进行外观性状鉴定,特征指标数据包括:颜色、成熟度、身份、结构、油分、色度、等级以及整体评价。
13、进一步的,获取烟叶样品物理指标特征指标数据包括以下步骤:
14、测量烟叶样品长度、宽度,并称重单叶重;
15、测量烟叶样品叶面密度:
16、每份烟叶样品随机抽取50片叶片,每片烟叶任取一个半叶;
17、沿着半叶的叶尖、叶中及叶基部等距离取5个点,用圆形打孔器打5片直径为1.5-2.0cm的圆形小片;
18、将250片圆形小片放入水分盒中,在100℃条件下烘2小时,冷却30分钟后称重;
19、计算叶面密度:
20、
21、其中:d为圆形小片的直径,g为冷却后烟叶样品质量。
22、进一步的,获取烟叶样品化学成分特征指标数据包括以下步骤:
23、对常规化学成分及中微量元素进行检测;
24、对挥发性致香成分进行检测;
25、所述对挥发性致香成分进行检测具体包括以下步骤:
26、称取1g烟叶样品,放入40ml离心管中,加入5ml的40-60℃石油醚涡旋,过夜;
27、超声提取5min,离心,将上清液倾入另一40ml离心管中;
28、再放入10ml石油醚,提取2次,上清液均倾入另一40ml离心管中;
29、将3次合并的上清液氮吹至干,准确加入2ml含有内标的乙酸乙酯溶液洗出,过膜,再通过gc/ms测定相应化学指标。
30、进一步的,获取烟叶样品感官质量特征指标数据包括以下步骤:
31、依据评价标准进行评价,感官质量评价包括:细腻感、清晰度、香气量、杂气、润感、刺激性、余味、烟气浓度、劲头,根据评吸总分,将评价结果分为可用(≥60分)、可拓展(30-60分)、不可用(≤30分))3类。
32、进一步的,对获取的特征指标数据进行预处理具体包括:异常数据处理、缺失值填充、数据归一化和离散数据的独热编码;
33、其中:异常数据处理包括:
34、首先,通过烟草行业领域专家的专业经验和判断力,删除特征指标数据中不符合常理的数据,
35、其次,删除特征指标数据中测量值与平均值上下差距超过三倍标准差的数据;
36、缺失值填充包括:特征指标数据中含有缺失值时,对于缺失的指标,统计其余同产区样本在该指标上的非空值的均值,作为缺失值的默认值进行填充;
37、数据归一化包括:使用极差标准化法处理特征指标数据,其公式如下:
38、
39、其中,x为特征指标数据的测量数值,xmin为对应特征指标数据的最小值,xmax为对应特征指标数据的最大值;
40、离散数据的独热编码包括:对于烟叶样品的离散特征,采用独热编码的方式。
41、进一步的,按照多维度方法对特征指标进行筛选具体包括以下步骤:
42、通过皮尔森相关系数计算各个特征指标和评价指标的线性相关程度,皮尔森相关系数的计算公式如下:
43、
44、其中,cov(x,y)为特征指标x和评价指标y的协方差,var|x|为特征指标x的方差,var|y|为评价指标y的方差,因此,r的取值范围为-1到1之间;
45、当皮尔森相关系数为1时表示完全相关,-1时表示完全负相关,对模型起到负向作用,0时表示完全不相关;计算后,将系数接近0的指标特征进行删除;
46、随机森林特征贡献度:
47、随机森林可以提供每一个特征指标的贡献度,
48、以烟叶样品外观质量、物理指标、化学成分作为自变量,将感官质量档次作为因变量进行随机森林建模,并进行随机森林特征权重分配。
49、进一步的,所述预设超参数包括:确定训练集数量,选择决策数数量,选择节点分裂标准,确定节点分裂最小样本数,选择叶节点最小样本数,设置树最大深度标注,限制最大特征数目,设置是否有放回采样要求和设置是否进行袋外数据测试要求。
50、有益效果:
51、本发明采用包含外观、物理、多类别化学成分及感官质量为评价指标开展品质分类,指标维度更多,对品质分类分析更加全面。
52、本发明利用随机森林算法进行品质分类预测的方法,该方法能够有效的提高烟叶品质分类预测的效率和准确性。
1.一种基于随机森林算法的烟叶品质分类预测方法,其特征在于,包括以下步骤:
2.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,所述预处理收集的烟叶样品具体包括以下步骤:
3.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,
4.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,
5.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,
6.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,
7.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,
8.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,按照多维度方法对特征指标进行筛选具体包括以下步骤:
9.根据权利要求1所述的基于随机森林算法的烟叶品质分类预测方法,其特征在于,所述预设超参数包括:确定训练集数量,选择决策数数量,选择节点分裂标准,确定节点分裂最小样本数,选择叶节点最小样本数,设置树最大深度标注,限制最大特征数目,设置是否有放回采样要求和设置是否进行袋外数据测试要求。
