本发明涉及人工智能领域,尤其是涉及一种基于相似性检索的短文本匹配系统和方法。
背景技术:
1、随着技术的发展,商业银行正在加速数字化转型,以顺应数字经济发展。数字化转型时间紧任务重,对数据治理工作也提出新要求,如何为数据开发技术人员与业务需求人员提供一个高效数据对标工具,成为数据治理工作重点之一。数据治理面对的挑战不仅包含新需求字段与标准库内字段高质量对齐,还包含提升存量已开发字段的对齐质量。
2、传统新增字段中文名对齐常使用文本相似性匹配方法,开发人员使用业务含义关键词对标准库进行全局检索。检索工具根据文本相似性匹配方式,给出相似性从高到低排序结果。该方法检索匹配速度较快,但其推荐结果质量较低,需要人工进行二次匹配,即从推荐结果中,根据经验筛选较佳匹配对象。
3、随着自然语言处理算法模型快速发展,语义匹配也为文本相似匹配带来新的解决方案。在数字化转型关键期,短文本高效匹配成为数据治理研究重要课题之一。
4、使用基于深度学习bert算法和公共数据训练模型,对匹配短文本进行分词处理,再使用bert预训练模型进行向量化处理,通过余弦相似性计算匹配得到相似匹配短文本。因余弦相似性计算只考虑到待检索文本与目标文本之间的向量方向,未考虑到文本向量长度,忽略文本中词序位置,仅适合小批量数据筛查匹配,但无法适配特殊业务场景。
5、经过检索,中国发明专利公开号cn114428850b公开了一种文本检索匹配方法和系统,该方法包括:步骤一,采集不同领域的中文自然语言推理文本语料,作为句子表征模型的训练语料;步骤二,结合对比学习方法训练句子表征模型,再利用句子语义匹配基准数据集来测试并筛选出最佳句子表征模型;步骤三,使用筛选出的最佳句子表征模式,对要匹配的长短文本中的句子进行相似度计算;步骤四,根据相似度计算的结果,采用sigmod函数得到句子的匹配分数,来判断是否为相似句子,完成文本检索。该现有专利存在匹配精度不高的问题。
6、如何实现短文本的匹配精度,成为需要解决的技术问题。
技术实现思路
1、本发明的目的就是为了克服上述现有技术存在的缺陷而提供一种基于相似性检索的短文本匹配系统和方法。
2、本发明的目的可以通过以下技术方案来实现:
3、根据本发明的一个方面,提供了一种基于相似性检索的短文本匹配系统,该系统包括依次相连的数据标准库、nlp模型训练模块、相似性度量检索模块和结果聚合排序模块;
4、所述的数据标准库,用于动态维护具有特定业务含义的标准字段名,以批量形式定期提供全量数据给nlp模型训练模块;
5、所述的nlp模型训练模块,基于数据标准库的标准数据进行nlp模型场景化训练,用于产生分词和词向量;
6、所述的相似性度量检索模块,包括文本相似性检索引擎和词向量相似性检索引擎,用已训练的nlp模型,对待检索短文本和数据标准库的标准字段中文名进行处理,并做相似性计算;
7、所述的结果聚合排序模块将相似性度量检索模块输出的目标字段结果取并集,计算其与待检索短文本的余弦相似性,并根据余弦相似性给出聚合排序结果。
8、优选地,所述的nlp模型训练模块包括nlp分词模型训练子模块和nlp词向量模型训练子模块。
9、更加优选地,所述nlp分词模型训练子模块基于数据标准库的标准数据,对hanlp分词器提供的nlp模型进行校正,并训练hanlp中的感知机模型,形成自定义分词器;
10、所述nlp词向量模型训练子模块基于数据标准库的标准数据,对bert-as-service提供的中文预训练模型进行校正,得到定制化模型,并形成词向量库。
11、更加优选地,所述nlp分词模型训练子模块还包括训练前对输入数据进行命名实体识别,即识别句子中命名实体的边界和类别的任务,采用统计和规则相结合的方法,其中规则处理规则性大于阈值的命名实体,而未匹配的部分则由统计模型处理。
12、更加优选地,所述的文本相似性检索引擎使用已训练的nlp分词模型训练子模块将待检索短文本转换为若干词语,采用bm25算法计算待检索短文本与数据标准库的标准字段中文名的bm25得分,反馈排序前m的目标字段;
13、所述的词向量相似性检索引擎使用已训练的nlp词向量模型训练子模块将待检索短文本转换为词向量,计算词向量库内字段与待检索短文本转换词向量的相似性,按照相似性降序排序,反馈排序前n的目标字段。
14、根据本发明的一个方面,提供了一种基于相似性检索的短文本匹配方法,该方法包括以下步骤:
15、步骤s1,生成数据标准库,并批量定期提供全量数据给nlp模型训练模块;
16、步骤s2,基于数据标准库的标准数据,对nlp模型进行场景化训练;
17、步骤s3,用已训练的nlp模型将数据标准库中所有标准字段中文进行分词准换,并进行词向量转换并保存,形成词向量库;
18、步骤s4,待检索短文本匹配;
19、步骤s5,将步骤s4的结果进行聚合排序,给出聚合排序结果。
20、优选地,所述步骤s2中,对nlp模型进行场景化训练,包括nlp分词模型训练和nlp词向量模型训练。
21、优选地,步骤s4中,待检索短文本匹配包括待检索短文本采用文本相似性检索引擎的匹配,以及待检索短文本采用词向量相似性检索引擎的匹配。
22、更加优选地,所述的待检索短文本采用文本相似性检索引擎的匹配具体为:待检索短文本经已训练的nlp分词模型分成若干词语后,文本相似性检索引擎计算待检索短文本的若干词语与数据标准库中标准中文字段的bm25得分,并反馈排序前m的目标字段;
23、所述的待检索短文本采用词向量相似性检索引擎的匹配包括以下步骤:
24、首先,待检索短文本经已训练的nlp词向量模型转换为词向量;
25、然后,使用词向量相似性检索引擎计算词向量库内字段与待检索短文本转换的词向量的相似性;
26、最后,按照相似性分数从高到低排序,反馈排序前n的目标字段。
27、更加优选地,所述的词向量相似性检索引擎内置的相似性度量方法包括内积相似度、l2距离、jaccard相似度和pca。
28、与现有技术相比,本发明具有以下有益效果:
29、1)本发明基于数据标准库的标准数据进行nlp模型进行场景化的定制训练,并融合nlp模型中词向量相似性检索方法和文本相似性检索引擎,对短文本进行多重匹配,改善短文本相似匹配机制和精度,提高数据治理字段中文名对齐质量,提升增量数据开发与存量数据治理效率。
30、2)本发明实现高效数据治理字段中文名对齐,快速排查存量数据质量,批量输出推荐结果,从而达到降低数据治理人工成本目的,为数字化转型工作提供基础技术支撑。
1.一种基于相似性检索的短文本匹配系统,其特征在于,该系统包括依次相连的数据标准库、nlp模型训练模块、相似性度量检索模块和结果聚合排序模块;
2.根据权利要求1所述的一种基于相似性检索的短文本匹配系统,其特征在于,所述的nlp模型训练模块包括nlp分词模型训练子模块和nlp词向量模型训练子模块。
3.根据权利要求2所述的一种基于相似性检索的短文本匹配系统,其特征在于,所述nlp分词模型训练子模块基于数据标准库的标准数据,对hanlp分词器提供的nlp模型进行校正,并训练hanlp中的感知机模型,形成自定义分词器;
4.根据权利要求3所述的一种基于相似性检索的短文本匹配系统,其特征在于,所述nlp分词模型训练子模块还包括训练前对输入数据进行命名实体识别,即识别句子中命名实体的边界和类别的任务,采用统计和规则相结合的方法,其中规则处理规则性大于阈值的命名实体,而未匹配的部分则由统计模型处理。
5.根据权利要求3所述的一种基于相似性检索的短文本匹配系统,其特征在于,所述的文本相似性检索引擎使用已训练的nlp分词模型训练子模块将待检索短文本转换为若干词语,采用bm25算法计算待检索短文本与数据标准库的标准字段中文名的bm25得分,反馈排序前m的目标字段;
6.一种采用权利要求1所述的基于相似性检索的短文本匹配系统的方法,其特征在于,该方法包括以下步骤:
7.根据权利要求6所述的方法,其特征在于,所述步骤s2中,对nlp模型进行场景化训练,包括nlp分词模型训练和nlp词向量模型训练。
8.根据权利要求6所述的方法,其特征在于,步骤s4中,待检索短文本匹配包括待检索短文本采用文本相似性检索引擎的匹配,以及待检索短文本采用词向量相似性检索引擎的匹配。
9.根据权利要求8所述的方法,其特征在于,所述的待检索短文本采用文本相似性检索引擎的匹配具体为:待检索短文本经已训练的nlp分词模型分成若干词语后,文本相似性检索引擎计算待检索短文本的若干词语与数据标准库中标准中文字段的bm25得分,并反馈排序前m的目标字段;
10.根据权利要求9所述的方法,其特征在于,所述的词向量相似性检索引擎内置的相似性度量方法包括内积相似度、l2距离、jaccard相似度和pca。
