本发明涉及自然语言处理,特别涉及一种用于检索特定信息的计算词间相似度的方法及装置。
背景技术:
1、关系抽取是信息抽取研究领域中的重要研究课题之一,其目的是从海量非结构化的自然语言文本中识别并抽取出实体之间的语义关系,最终生成计算机可以识别与处理的结构化信息。
2、大数据时代背景下,网络用户人数激增,各类信息数量爆发式增长,包含了文本数据、声音数据、图像数据等,这其中文本数据所占比例最大,因此如何处理和利用海量文本数据显得尤为重要。然而文本数据虽然数量巨大,但并非所有文本都具有实际价值或对特定用户有意义,简单检索容易导致检索得到的词集不够泛化,信息不够准确。
技术实现思路
1、针对现有技术的问题,本发明提出了一种通过实体词间跳数衡量相关性的方法,以相关性指标计算为依据,呈现各实体间的相关性程度,根据实体词组和实体词组之间的跳数,预测得到实体词组之间的关系程度。
2、为了达到上述目的,本发明提供了一种用于检索特定信息的计算词间相似度的方法,其特征在于。包括如下步骤:
3、获取文本数据集,并将所述文本数据集根据不同主题进行分类,获得子数据集;
4、针对每一个所述子数据集中的文本进行预处理,分类获取所述子数据集的高频关键词;
5、利用预先建立的相似度模型,针对每一个所述子数据集,抽取其高频关键词,两两组合,通过所述相似度模型确定它们之间的相似度。
6、进一步的,所述预处理包括:
7、对所述子数据集中文本进行语法层面的句子切割,得到分词结果并进行词频统计;
8、根据词特性筛选关键词,并根据所述关键词的词频统计结果从大到小排列,选取前n个所述关键词作为所述子数据集的高频关键词。
9、进一步的,所述筛选关键词,基于辅助处理文本分析的nltk、spacy、json第三方库获取,且所述关键词只保留名词。
10、进一步的,所述相似度模型具体为:
11、r=x×α+y×β+z×γ
12、其中:α、β、γ三个系数分别表示词间距离、段间距离、文章间距离所对应的权重值;x表示所述高频关键词组合出现在同一句子里的数量;y表示所述高频关键词组合出现在同一段落里的数量;z表示所述高频关键词组合出现在在同一篇文章中的数量。
13、进一步的,所述将所述文本数据集根据不同主题进行分类具体为:以会议与期刊、国家与地区、年份为主题分类为所述子数据集。
14、进一步的,将所述高频关键词的相关性结果进行可视化处理,生成实体关系树,方便检索。
15、进一步的,所述实体关系树的树干节点均由所述高频关键词组成,按照相似度自高向低查找关系词。
16、本发明还提供了一种用于检索特定信息的计算词间相似度的装置,包括:
17、获取模块:用于获取文本数据集,并将所述文本数据集根据不同主题进行分类,获得子数据集;
18、预处理模块:用于针对每一个所述子数据集中的文本进行预处理,分类获取所述子数据集的高频关键词;
19、计算模块:用于利用预先建立的相似度模型,针对每一个所述子数据集,抽取其高频关键词,两两组合,通过所述相似度模型确定它们之间的相似度。
20、进一步的,所述相似度模型具体为:
21、r=x×α+y×β+z×γ
22、其中:α、β、γ三个系数分别表示词间距离、段间距离、文章间距离所对应的权重值;x表示所述高频关键词组合出现在同一句子里的数量;y表示所述高频关键词组合出现在同一段落里的数量;z表示所述高频关键词组合出现在在同一篇文章中的数量。
23、本发明的有益效果:
24、本发明给出了一种用于检索特定信息的计算词间相似度的方法,利用自定义的相似度模型计算高频关键词间相似度,该方法扩大了相关词汇的方差,增加了相似度比较的准确性。另外根据得到的针对用户特定需求的关键词集绘制得到实体关系树,使得词汇与词汇之间的隐含路径可以通过跳数量化。实体关系树建立了隐含路径,解决了距离问题,使得单次能够检索任意两个词汇,并得到与目标词汇相关联的全部高频词,更为准确迅速。
1.一种用于检索特定信息的计算词间相似度的方法,其特征在于,包括如下步骤:
2.根据权利要求1所述的用于检索特定信息的计算词间相似度的方法,其特征在于,所述预处理包括:
3.根据权利要求2所述的用于检索特定信息的计算词间相似度的方法,其特征在于:所述筛选关键词,基于辅助处理文本分析的nltk、spacy、json第三方库获取,且所述关键词只保留名词。
4.根据权利要求1所述的用于检索特定信息的计算词间相似度的方法,其特征在于,所述相似度模型具体为:
5.根据权利要求1所述的用于检索特定信息的计算词间相似度的方法,其特征在于,将所述文本数据集根据不同主题进行分类具体为:以会议与期刊、国家与地区、年份为主题分类为所述子数据集。
6.根据权利要求1所述的用于检索特定信息的计算词间相似度的方法,其特征在于:将所述高频关键词的相似度结果进行可视化处理,生成实体关系树,方便检索。
7.根据权利要求6所述的用于检索特定信息的计算词间相似度的方法,其特征在于:所述实体关系树的树干节点均由高频关键词组成,按照相似度自高向低查找关系词。
8.一种用于检索特定信息的计算词间相似度的装置,其特征在于,包括:
9.根据权利要求8所述的用于检索特定信息的计算词间相似度的装置,其特征在于,所述相似度模型具体为:
