代表性文本抽样方法、系统、终端及介质与流程

专利2026-08-18  12


本发明涉及医疗数据处理,特别是涉及一种代表性文本抽样方法、系统、终端及介质。


背景技术:

1、在利用自然语言处理(nlp)技术从文本数据中提取信息的过程中,对已提取出的信息进行人工质检是必不可少的步骤。在大规模文本数据中提取有用信息的过程中,出于人力、财力的限制,以及质控速度跟不上数据生成速度这一事实,使得无法对所有数据进行质控。传统的抽样质控方法存在着抽样量少、覆盖特征面小的缺点。如何选择合适的样本进行质检,以保证样本和所提取出的信息的代表性,是文本抽样的一项挑战。


技术实现思路

1、鉴于以上所述现有技术的缺点,本发明的目的在于提供一种代表性文本抽样方法、系统、终端及介质,用于解决现有技术中的抽样质控方法存在着抽样量少导致覆盖特征面小的技术问题。

2、为实现上述目的及其他相关目的,本发明提供一种代表性文本抽样方法,所述方法包括:对原始病历文本进行数据预处理,获得多个目标文本;对各目标文本进行词向量化以及相似度计算,获得相似度计算结果;基于所述相似度计算结果,对各目标文本进行聚类,获得聚类结果;根据所述聚类结果抽取多个目标文本作为质检代表文本。

3、于本发明的一实施例中,所述对原始病历文本进行数据预处理,获得多个目标文本包括:采用正则表达式截取原始病历文本中的目标短句;通过设置停用词去除截取的目标短句中的无关短句,并将去除无关短句后剩余的目标短句分别作为目标文本。

4、于本发明的一实施例中,所述对各目标文本进行词向量化以及相似度计算,获得相似度计算结果包括:对各目标文本进行分词,并根据分词结果进行词向量化,获得各目标文本对应的向量;基于各目标文本对应的向量,计算各目标文本的向量之间的余弦相似度,并形成相似度矩阵。

5、于本发明的一实施例中,采用jieba分词工具对各目标文本进行分词,获得每个目标文本的词序列。

6、于本发明的一实施例中,所述基于所述相似度计算结果,对各目标文本进行聚类,获得聚类结果包括:基于亲和力传播算法,根据所述相似度矩阵对各目标文本进行聚类,将各目标文本分为多个簇。

7、于本发明的一实施例中,所述根据所述聚类结果抽取多个目标文本作为质检代表文本包括:基于值域抽样方法,对所述聚类结果中的每个簇进行值域分析,并根据值域分析结果抽取多个目标文本作为质检代表文本。

8、于本发明的一实施例中,所述基于值域抽样方法,对所述聚类结果中的每个簇进行值域分析,并根据值域分析结果抽取多个目标文本作为质检代表文本包括:基于每个簇包含的目标文本的向量确定每个簇的值域,并根据每个簇的值域从各簇中抽取目标文本作为质检代表文本。

9、为实现上述目的及其他相关目的,本发明提供一种代表性文本抽样系统,所述系统包括:预处理模块,用于对原始病历文本进行数据预处理,获得多个目标文本;相似度计算模块,连接所述预处理模块,用于对各目标文本进行词向量化以及相似度计算,获得相似度计算结果;聚类模块,连接所述相似度计算模块,用于基于所述相似度计算结果,对各目标文本进行聚类,获得聚类结果;文本抽样模块,连接所述聚类模块,用于根据所述聚类结果抽取多个目标文本作为质检代表文本。

10、为实现上述目的及其他相关目的,本发明提供一种代表性文本抽样终端,包括:一或多个存储器及一或多个处理器;所述一或多个存储器,用于存储计算机程序;所述一或多个处理器,连接所述存储器,用于运行所述计算机程序以执行所述代表性文本抽样方法。

11、为实现上述目的及其他相关目的,本发明提供一种计算机可读存储介质,存储有计算机程序,所述计算机程序被一个或多个处理器运行时执行所述代表性文本抽样方法。

12、如上所述,本发明是一种代表性文本抽样方法、系统、终端及介质,具有以下有益效果:本发明通过对原始病历文本进行数据预处理获得多个目标文本,再对各目标文本进行词向量化以及相似度计算,并基于相似度计算结果对各目标文本进行聚类,再根据所述聚类结果抽取多个目标文本作为质检代表文本。本发明通过尽可能少的数据量选择代表性样本进行质检,可以覆盖尽可能多样的文本和提取结果,进而可以大大减少人工质检的工作量,提高效率。



技术特征:

1.一种代表性文本抽样方法,其特征在于,所述方法包括:

2.根据权利要求1中所述的代表性文本抽样方法,其特征在于,所述对原始病历文本进行数据预处理,获得多个目标文本包括:

3.根据权利要求2中所述的代表性文本抽样方法,其特征在于,所述对各目标文本进行词向量化以及相似度计算,获得相似度计算结果包括:

4.根据权利要求3中所述的代表性文本抽样方法,其特征在于,采用jieba分词工具对各目标文本进行分词,获得每个目标文本的词序列。

5.根据权利要求3中所述的代表性文本抽样方法,其特征在于,所述基于所述相似度计算结果,对各目标文本进行聚类,获得聚类结果包括:

6.根据权利要求5中所述的代表性文本抽样方法,其特征在于,所述根据所述聚类结果抽取多个目标文本作为质检代表文本包括:

7.根据权利要求6中所述的代表性文本抽样方法,其特征在于,所述基于值域抽样方法,对所述聚类结果中的每个簇进行值域分析,并根据值域分析结果抽取多个目标文本作为质检代表文本包括:

8.一种代表性文本抽样系统,其特征在于,所述系统包括:

9.一种代表性文本抽样终端,其特征在于,包括:一或多个存储器及一或多个处理器;

10.一种计算机可读存储介质,其特征在于,存储有计算机程序,所述计算机程序被一个或多个处理器运行时执行如权利要求1至7中任一项所述的方法。


技术总结
本发明提供一种代表性文本抽样方法、系统、终端及介质,通过对原始病历文本进行数据预处理获得多个目标文本,再对各目标文本进行词向量化以及相似度计算,并基于相似度计算结果对各目标文本进行聚类,再根据所述聚类结果抽取多个目标文本作为质检代表文本。本发明通过尽可能少的数据量选择代表性样本进行质检,可以覆盖尽可能多样的文本和提取结果,进而可以大大减少人工质检的工作量,提高效率。

技术研发人员:马汉东,张少典,顾根
受保护的技术使用者:上海森亿医疗科技有限公司
技术研发日:
技术公布日:2024/6/26
转载请注明原文地址:https://doc.8miu.com/read-1833093.html

最新回复(0)