表格标准化处理方法、装置、设备及存储介质与流程

专利2022-05-09  35



1.本申请属于数据处理技术领域,尤其涉及表格标准化处理方法、装置、设备及存储介质。


背景技术:

2.表格是一种常见的数据统计方式,企业可以根据表格中的数据了解各项业务的运营状态及客户喜好等信息,并根据这些信息做出相应的决策。但是不同存储类型的表格中的数据格式存在差异,将这些表格进行标准化处理需要耗费大量的人力。并且表格中还存在一些不相关的冗余信息,不利于企业对表格中的数据进行分析。
3.识别表格中的标题部分和数据部分是表格标准化处理方法中的关键步骤。现有的对表格的数据部分和标题部分的识别方法包括:首先识别表格中的每个单元格,然后提取每个单元格中的文本,最后基于各类算法对每个文本进行分类和标准化处理。由于这类方法需要对每个单元格中的文本进行分类,从而判断每个文本属于标题部分还是数据部分,算法的复杂度较高。


技术实现要素:

4.本申请实施例提供了表格标准化处理方法、装置、设备及存储介质,可以降低表格标准化处理方法的复杂度。
5.第一方面,本申请实施例提供了一种表格标准化处理方法,该方法包括:
6.获取待处理的表格,待处理的表格包括n行m列;从待处理的表格中的第1行开始,对相邻两行的文本进行相似度检测,直至检测到第i行和第i 1行的文本不一致时,确定第1行到第i行为标题行,且第i 1行至第n行为数据行,1≤i≤n

1;从待处理的表格中的第1列开始,对相邻两列的文本进行相似度检测,直至检测到第j列和第j 1行的文本不一致时,确定第1列到第j列为标题列,第j 1列至第m列为数据列,1≤j≤m

1;对确定的标题行和标题列中的标题文本进行分类筛选处理,得到预设的标准化标题;根据标准化标题和标准化标题在待标准化的表格中对应的数据,得到待处理的表格的标准化表格。
7.基于本申请提供的表格标准化处理方法,利用表格中标题文本与数据文本之间的差异,从待处理的表格的前两行或者前两列开始检测相邻文本之间的相似度,一旦检测到文本不一致,则认为识别到了待处理的表格中的数据部分和标题部分,因此不需要对待标准化表格中剩余的行或列进行检测,降低了算法的复杂度。然后确定每个标题文本的类别并对每个标题文本进行筛选处理,根据需求去除标题文本中的冗余信息,得到标准化的标题。按照标准库中的种类对待处理的表格中的每个标题行和标题列进行分类和标准化,去除冗余信息。最终将待处理的表格中的数据及其对应的标准化的标题行和标题列存储到数据库中,便于企业对数据进行分析。
8.可选地,待处理的表格中任一相邻两行的文本为一组文本对,所述待处理的表格中任一相邻两列的文本为一组文本对,对待处理的表格的任一文本对进行相似度检测的方
法,包括:
9.将文本对中的第一文本和第二文本输入到已训练的相似度检测模型中进行处理,得到第一文本和第二文本的相似度检测结果,相似度检测结果指示第一文本和第二文本一致或者不一致,第一文本和第二文本为待处理的表格中的相邻两行的文本或者相邻两列的文本;
10.其中,相似度检测模型包括预训练语言模型、交叉注意层和全连接层,利用相似度检测模型对文本对进行处理包括:
11.将第一文本和第二文本输入到预训练语言模型中进行特征提取,得到第一特征向量和第二特征向量;将第一特征向量和第二特征向量输入到交叉注意层中进行融合处理,得到高维特征向量;将高维特征向量输入全连接层中进行全连接计算,得到相似度检测结果。
12.可选地,将第一特征向量和第二特征向量输入到交叉注意层中进行融合处理,得到高维特征向量,包括:
13.计算第一特征向量中的每个值相对于第二特征向量中每一个值的第一权重;根据第一权重对第一特征向量进行加权求和计算,得到第三特征向量;计算第二特征向量中的每个值相对于第一特征向量中每一个值的第二权重;根据第二权重对第二特征向量进行加权求和计算,得到第四特征向量;将第三特征向量和第四特征向量进行级联,得到高维特征向量。
14.基于上述可选方式,在文本相似度检测的过程中,充分考虑到两个输入文本之间特征的相关性,在现有的预训练语言模型基础上增加交叉注意层,利用交叉方式来计算高维特征向量,可以有效地表征两个输入文本的特征之间的映射关系,增强两个输入文本之间的关联性,从而提高了相似度检测模型文本识别的准确率。
15.可选地,表格标准化处理方法还包括:若待处理的表格中每一组文本对的相似度检测结果均为第一文本和第二文本一致,则确定待处理的表格为跨页表格,并将跨页表格与排序在跨页表格前一位的第一表格进行合并。
16.可选地,将跨页表格与排序在跨页表格前一位的第一表格进行合并的方法,包括:分别获取跨页表格和第一表格的行列数;若跨页表格的行数与第一表格的行数相同,则进行列合并;若跨页表格的列数与第一表格的列数相同,则进行行合并。
17.可选地,对确定的标题行和标题列中的标题文本进行分类筛选处理,得到预设的标准化标题,包括:利用已训练的文本分类模型对标题文本进行分类,确定标题文本在预设的标准库中对应的类别;根据标题文本在预设的标准库中对应的类别对标题文本进行文本筛选,得到预设的标准化标题。
18.基于上述可选方式,可以根据业务需求对表格中的标题文本进行筛选,过滤掉无效信息,从而便于企业根据表格中的信息进行准确的数据分析。
19.可选地,获取待处理的表格,包括:从表格数据源中获取待处理的表格,表格数据源包括图片格式型、pdf型或表格型。
20.第二方面,本申请实施例提供了一种表格标准化装置,该装置包括:
21.获取单元,用于获取待处理的表格,待处理的表格包括n行m列;
22.识别单元,从待处理的表格中的第1行开始,对相邻两行的文本进行相似度检测,
直至检测到第i行和第i 1行的文本不一致时,确定第1行到第i行为标题行,且第i 1行至第n行为数据行,1≤i≤n;从待处理的表格中的第1列开始,对相邻两列的文本进行相似度检测,直至检测到第j列和第j 1行的文本不一致时,确定第1列到第j列为标题列,第j 1列至第m列为数据列,1≤j≤m;
23.分类单元,对确定的标题行和标题列中的标题文本进行分类筛选处理,得到预设的标准化标题;
24.标准化单元,根据标准化标题和标准化标题在待处理的表格中对应的数据,得到待处理的表格的标准化表格。
25.第三方面,本申请实施例提供了一种终端设备,包括存储器、处理器以及存储在所述存储器中并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如第一方面中任一实施例所述的方法。
26.第四方面,本申请实施例提供了一种计算机可读存储介质,所述计算机可读存储介质存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如第一方面中任一实施例所述的方法。
27.第五方面,本申请实施例提供了一种计算机程序产品,当计算机程序产品在终端设备上运行时,使得终端设备执行上述第一方面中任一项所述的方法。
28.可以理解的是,上述第二方面至第五方面的有益效果可以参见上述第一方面中的相关描述,在此不再赘述。
附图说明
29.为了更清楚地说明本申请实施例中的技术方案,下面将对实施例或现有技术描述中所需要使用的附图作简单地介绍,显而易见地,下面描述中的附图仅仅是本申请的一些实施例,对于本领域普通技术人员来讲,在不付出创造性劳动性的前提下,还可以根据这些附图获得其他的附图。
30.图1是本申请一实施例提供的一种表格抽取解析方法的流程图;
31.图2是本申请一实施例提供的一种待处理的表格的示意图;
32.图3是本申请一实施例提供的一种标准化表格的示意图;
33.图4是本申请一实施例提供的一种相似度检测模型的结构示意图;
34.图5是本申请一实施例提供的一种交叉注意层的结构示意图;
35.图6是本申请一实施例提供的一种基于相似度检测模型对文本对进行相似度检测的流程图;
36.图7是本申请一实施例提供的一种相似度检测模型的训练流程图;
37.图8是本申请一实施例提供的一种表格抽取解析装置的结构示意图;
38.图9是本申请一实施例提供的一种终端设备的结构示意图。
具体实施方式
39.表格是一种常见的数据统计方式,企业可以根据表格中的数据了解各项业务的运营情况及客户喜好等信息,并根据这些信息做出相应的决策。但是不同存储类型的表格中的数据格式存在差异,将这些表格进行标准化处理需要耗费大量的人力。并且表格中还存
在一些无效信息,不利于企业对表格中的数据进行分析。
40.识别表格中的标题部分和数据部分是表格标准化处理方法中的关键步骤。现有的对表格的数据部分和标题部分的识别方法包括:首先识别表格中的每个单元格,然后提取每个单元格中的文本,最后基于各类算法对每个文本进行分类和标准化处理。由于这类方法需要对每个单元格中的文本进行识别分类,从而判断每个文本属于标题部分还是数据部分,算法的复杂度较高。
41.为了降低降低表格抽取解析方法的复杂度,本申请提供了一种表格抽取解析方法、装置、设备及存储介质。充分考虑到两个输入文本之间特征的相关性,在现有的预训练语言模型的基础上提出了新的文本相似度检测模型,通过判断待处理的表格中相邻两行和相邻两列的文本一致性,确定表格中的数据部分和标题部分。本申请提供的方法从待处理的表格的前两行或者前两列开始检测文本的一致性,一旦识别到数据的起始行和起始列,则不需要对待标准化表格中剩余的行列进行检测,降低了算法的复杂度。
42.下面以具体地实施例对本申请的技术方案进行详细说明。下面这几个具体的实施例可以相互结合,对于相同或相似的概念或过程可能在某些实施例不再赘述。
43.图1示出了本申请提供的一种表格抽取解析方法的流程图。该方法包括:
44.s11,获取待处理的表格,待处理的表格包括n行m列。
45.在本实施例中,可以从多个表格数据源中获取待处理的表格。表格数据源包括:图片格式型(例如jpg、png等)、pdf格式型和表格型(例如excel、csv、tsv等)。
46.在一个实施例中,针对图片格式型的数据源,利用ocr(optical character recognition)工具对图片格式型的数据源进行处理,得到待处理的表格及该待处理的表格对应的行列数。
47.在另一个实施例中,基于计算机视觉算法和pdfplumber工具对pdf格式型的数据源进行处理,得到待处理的表格及该待处理的表格对应的行列数。示例性地,该方法包括:
48.步骤一,将pdf文件转化为png图像;
49.步骤二,将png图像二值化,并通过数学形态学中的腐蚀和膨胀处理对二值化图像进行降噪,得到png图像中的表格轮廓;
50.步骤三,获取png图像中表格轮廓的左上顶点的坐标和右下顶点的坐标;
51.步骤四,将png图像中表格轮廓的左上顶点与右下顶点的坐标映射至pdf文件中,确定pdf文件中表格的范围,并在该范围内对pdf文件进行截取;
52.步骤五,使用pdfplumber工具对截取范围内的表格进行处理,得到待处理的表格及该表格对应的行列数。
53.s12,从待处理的表格中的第1行开始,对相邻两行的文本进行相似度检测,直至检测到第i行和第i 1行的文本不一致时,确定第1行到第i行为标题行,第i 1行至第n行为数据行,1≤i≤n

1。
54.具体地,表格包括标题部分和数据部分,标题部分包括标题行和标题列。i为从1到n

1的变量,且i为正整数。待处理的表格中任一相邻两行的文本为一组文本对。文本对包括第一文本和第二文本,第一文本和第二文本分别为待处理的表格中的相邻两行的文本。
55.在一个实施例中,可以从待处理的表格中的第1行开始,将相邻两行的文本对直接输入到已训练的相似度检测模型中进行相似度检测。也可以从待处理的表格中的第1行开
始,将相邻两行单元格中的文本分别进行合并,得到第一文本字符串和第二文本字符串,将第一文本字符串和第二文本字符串输入到已训练的相似度检测模型中进行相似度检测。相似度检测结果指示的是第一文本和第二文本一致或者不一致。示例性的,相似度检测模型可以为albert模型、xlnet模型等。
56.示例性的,假设待处理的表格包括6行。将待处理的表格中第1行对应的第一文本以及第2行对应的第二文本输入到已训练的相似度检测模型中,若检测结果为第一文本和第二文本一致,则从第2行开始,继续对表格中相邻两行的文本对进行相似度检测。将表格第2行对应的第一文本以及第3行对应的第二文本输入到已训练的相似度检测模型中,若检测结果为文本不一致,则可以确定第1行和第2行均为标题行,第3行至第6行均为数据行。
57.s13,从待处理的表格中的第1列开始,对相邻两列的文本进行相似度检测,直至检测到第j列和第j 1列的文本不一致时,确定第1列到第j列为标题列,第j 1列至第m列为数据列,1≤j≤m

1。
58.具体地,j为从1到m

1的变量,且j为正整数。待处理的表格中任一相邻两列的文本为一组文本对。文本对包括第一文本和第二文本,第一文本和第二文本分别为待处理的表格中的相邻两列的文本。将相邻两列的文本输入到已训练的相似度检测模型中进行相似度检测的具体过程可以参考上述s12中将相邻两行的文本输入到已训练的相似度检测模型中进行相似度检测的具体过程,此处不再赘述。
59.s14,对确定的标题行和标题列中的标题文本进行分类筛选处理,得到预设的标准化标题。
60.在一种可能的实现方式中,首先利用已训练的文本分类模型对确定的标题行和标题列中的标题文本进行分类,确定标题文本在预设的标准库中对应的类别。示例性的,分类的类别包括:保险期间、投保年龄和性别等。文本分类模型可以为textcnn或textrnn。
61.然后根据标题文本在预设的标准库中对应的类别对标题文本进行筛选,得到预设的标准化标题。在一个实施例中,可以通过正则表达式从标题文本中提取出与该标题本文的类别匹配的特定文本,即根据需求从标题文本中提取我们想要的特定部分,去除标题文本中的无效信息。
62.示例性的,假设待处理的表格中的一个标题文本为“投保人为男性”,在该标题文本中“投保人为”为需要去除的无效信息,该标题文本中“男性”为需要保留的特定部分。因此,首先通过已训练的textcnn文本分类模型确定该标题文本的类别为“性别”,然后利用正则表达式可以从该标题文本中提取出与“性别”特征匹配的文本“男性”,最终将该标题文本“投保人为男性”转化成预设的标准化标题“男性”。
63.s15,根据标准化标题和标准化标题在待处理的表格中对应的数据,得到待处理的表格的标准化表格。
64.在一种可能的实现方式中,一方面,如图3(a)所示,可以将标准化标题和标准化标题在待处理的表格中对应的数据提取出来,组成标准化的表格。并且可以根据需求将标准化的表格存储成不同类型的格式,例如:pdf型、excel型和png型等。
65.另一方面,可以将标准化标题和标准化标题在数据部分对应的数据转化成特定的数据格式,并存储到数据库中。示例性的,数据格式可以为sql、json或xml等。示例性的,可以将图3(a)的表格中所示的标准化行标题“三年交”和标准化列标题“投保年龄18”在表格
的数据部分对应的数据14716,转化成如图3(b)所示的sql类型的数据格式。
66.对于pdf格式型或者图片格式型的表格数据源,同一数据源中的表格可能存在跨页的现象。在这种情况下,需要先识别同一数据源中的跨页表格,并将跨页表格与排序在该跨页表格前一位的第一表格进行合并后,再执行上述s14。因此,在上述s13之后,本申请所述的表格标准化处理方法还包括:
67.s16,若待处理的表格中每一组文本对的相似性检测结果均为文本一致,则确定该表格为跨页表格,并将跨页表格与排序在该跨页表格前一位的第一表格进行合并。
68.跨页表格与排序在该跨页表格前一位的第一表格为上述s11中从同一表格数据源中获取到的相邻的表格。在上述s11中,从同一表格数据源中抽取到多个待处理的表格后,将多个待处理的表格按照顺序进行存储。然后执行上述s12和s13,利用已训练的相似度检测模型对每个待处理的表格中相邻两行和相邻两列的文本对进行相似度检测,若待处理的表格中每一组文本对的相似性检测结果均为文本一致,则确定该表格为跨页表格,并将跨页表格与排序在该跨页表格前一位的第一表格进行合并。
69.示例性的,以pdf格式型的数据源为例。假设,从同一pdf表格数据源中获取到了两个待处理的表格,将第一个待处理的表格和第二个待处理的表格按照先后顺序进行处理,且通过已训练的相似度检测模型检测到第一个待处理的表格既包含标题部分又包含数据部分。若通过已训练的相似度检测模型检测到第二个待处理的表格中相邻两行的文本对均为文本一致,且相邻两列的文本对存在文本不一致,即该表格不包含标题行但包含标题列,则该表格为跨页表格。若通过已训练的相似度检测模型检测到第二个待处理的表格中相邻两列的文本对均为文本一致,且相邻两行的文本对存在文本不一致,即该表格包含标题行但不包含标题列,则该表格为跨页表格。在这两种情况下,需要将跨页表格与排序在该跨页表格前一位的第一个待处理的表格进行合并。
70.在一种可能的实现方式中,将跨页表格与排序在该跨页表格前一位的第一表格进行合并的方法包括:
71.步骤一,分别计算跨页表格和第一表格的行列数。
72.示例性的,通过pdfplumber解析库可以计算pdf表格的行列数。通过ocr工具可以计算图片表格的行列数。
73.步骤二,将第一表格的行列数与跨页表格的行列数进行匹配,根据匹配结果进行行合并或者列合并。
74.在本实施例中,若跨页表格的行数与第一表格的行数相同,则进行列合并。若跨页表格的列数与第一表格的列数相同,则进行行合并。
75.在另一种可能的实现方式中,出现特殊情况时,可以人为的对跨页表格进行合并。
76.在一个实施例中,通过已训练的相似度检测模型检测到待处理的表格中相邻两列的文本对均为文本一致,且相邻两行的文本均为文本不一致,即该待处理的表格为跨页表格,且该跨页表格中既不包含标题行也不包含标题列,只包含数据部分。这种情况下,需要人为判断该跨页表格是否与排序在该跨页表格前一位的第一表格的内容匹配,如果内容匹配,则将跨页表格中数据部分的行列数与第一表格中数据部分的行列数对比后进行合并。若跨页表格中数据部分的行数与第一表格中数据部分的行数相同,则将数据部分进行列合并。若跨页表格中数据部分的行数与第一表格中数据部分的列数相同,则将数据部分进行
行合并。
77.本申请提供的表格标准化处理方法,根据表格中标题文本和数据文本之间的差异性,从待处理的表格的前两行或者前两列开始检测文本的相似度,当相似度检测结果为本文不一致时,则认为检测到了待处理的表格中的标题部分和数据部分。且一旦识别到数据的起始行和起始列,则不需要对待处理的表格中剩余的行列进行检测,降低了算法的复杂度。然后再按照标准库中的种类对每个数据对应的标题行和标题列进行筛选得到标准化的标题文本,去除不相关的信息。根据标准化的标题文本在待处理的表格中对应的数据构建对应的标准化表格,有利于企业可以根据标准化表格中的信息进行有效的分析,从而做出相应的决策。
78.在另一种可能的实现方式中,本申请针对上述s12和s13中对待处理的表格中相邻两行或相邻两列的文本进行相似度检测的方法,提出了一种相似度检测模型,该模型的结构如图4所示。
79.该相似度检测模型包括预训练语言模型、交叉注意层(cross attention layer)和全连接层。该模型包含两个输入分支,每个输入分支中包含相同的预训练语言模型。将待处理的表格中第一文本对应的第一文本字符串和第二文本对应的第二文本字符串分别输入到预训练语言模型中,预训练语言模型可以将文本的特征信息编码成embedding特征向量,即分别得到与第一文本对应的第一特征向量和与第二文本对应的第二特征向量。将第一特征向量和第二特征向量输入到交叉注意层中进行融合处理,得到高维特征向量。将高维特征向量输入到全连接层中进行全连接计算,得到相似度检测结果。
80.图5为交叉注意层的结构示意图。交叉注意层(cross attention layer)可以表征一个特征向量与另一个特征向量之间的映射关系。将第一特征向量和第二特征向量输入到交叉注意层中进行融合处理,可以得到高维特征向量。具体地融合过程如下:
81.首先对第一特征向量和第二特征向量进行相似度计算。示例性的,将第一特征向量表示为q={q1,q2,

,q
n
},第二特征向量表示为p={p1,p2,

,p
m
}。其中,n表示第一文本字符串中字的个数,m表示第二文本字符串中字的个数。则第二特征向量相对于第一特征向量的第一相似特征a可以表示为公式(1):
82.a
t
={a1,a2,

,a
n
}
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(1)
83.a
k
={q
k
*p1,q
k
*p2,

,q
k
*p
m
}(k∈1,

,n)
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(2)
84.第一特征向量相对于第二特征向量的第二相似特征b可以表示为公式(3):
85.b
t
={b1,b2,

,b
m
}
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(3)
86.b
l
={p
l
*q1,p
l
*q2,

,p
l
*q
n
}(l∈1,

,m)
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(4)
87.然后利用softmax函数分别对第一相似特征a和第二相似性b进行归一化处理,得到第一权重w和第二权重v。其中,第一权重w可以表示为公式(5):
88.w
t
={w1,w2,

,w
n
}
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(5)
[0089][0090][0091]
公式(5)中,w
t
表示w的转置矩阵。第二权重v可以表示为公式(8):
[0092]
v
t
={v1,v2,

,v
m
}
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(8)
[0093][0094][0095]
在公式(8)中,v
t
表示v的转置矩阵。根据第一权重和第二特征向量可以得到大小为1
×
n的第三特征向量q',根据第二权重和第一特征向量可以得到大小为1
×
m的第四特征向量p'。具体地可以表示为公式(11)和公式(12):
[0096]
q'=wp
t
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(11)
[0097]
p'=vq
t
ꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀꢀ
(12)
[0098]
公式(5)中,p
t
表示p的转置矩阵。q
t
表示q的转置矩阵。
[0099]
最终,将第三特征向量q'和第四特征向量p'进行级联,得到大小为1
×
(m n)的高维特征向量{q',p'},并将高维特征向量输入到全连接层中,得到相似性检测结果。
[0100]
在本申请中,将待处理的表格划分成多组文本对,针对每个文本对,均可采用如图4所示的相似度检测模型进行相似度检测。
[0101]
在一个实施例中,利用图4所示的相似度检测模型将待处理的表格中的任一文本对进行相似度检测的方法如图6所示。示例性的,该方法包括:
[0102]
s61,获取相邻两行或相邻两列的文本字符串。
[0103]
文本字符串对包括第一文本字符串和第二文本字符串,第一文本字符串和第二文本字符串为待处理的表格中的相连两行文本对应的文本字符串或者相邻两列文本对应的文本字符串。
[0104]
在本实施例中,从待处理的表格中的第1行开始,将相邻两行或两列单元格中的文本分别进行合并,且每行或每列中不同单元格中的文本之间使用逗号隔开,组成一个完整的文本字符串:[cls]单元格文本1,单元格文本2[sep]。
[0105]
示例性的,以图2所示的待处理的表格中的行为例。将待处理的表格中第1行单元格中的文本合并后可以得到第一文本字符串,第一文本字符串可以表示为:[cls]投保年龄,交费期间,男性[sep]。将待处理的表格中第2行单元格中的文本合并后的第二文本字符串,第二文本字符串可以表示为:[cls]18,10年,1540[sep]。
[0106]
s62,从待处理的表格中的第1行或第1列开始,将相邻两行或相邻两列的文本字符串输入到已训练的相似度检测模型中进行相似度检测。
[0107]
该步骤具体的实现方式如上述所示,此处不再赘述。
[0108]
现有的文本相似度检测方法一般都是利用预训练语言模型分别对两个输入文本进行特征提取,得到对应的高维特征向量,然后直接输入到全连接网络中进行分类,没有考虑到两个输入文本之间特征的相关性,导致深度学习模型的分类准确率较低。因此,针对两个输入文本的相似度判定,本申请在现有的预训练语言模型基础上增加了交叉注意层,利用交叉方式来计算高维特征向量,可以有效地表征两个输入文本特征之间的映射关系,增强两个输入文本特征之间的关联性,从而提高相似度检测模型检测地准确率。
[0109]
对图4所示的相似度检测模型的训练流程图如图7所示,训练过程如下:
[0110]
s71,获取训练样本集。
[0111]
训练样本集中包括多个训练样本,每个训练样本包括第一文本字符串样本和第二文本字符串样本,第一文本字符串样本和第二文本字符串样本为表格样本中相邻两行或相邻两列的文本样本对应的文本字符串样本。
[0112]
具体地,首先按照上述s11中所述的方法从不同的表格数据源中获取表格样本。然后按照上述s61所述的方法对表格样本进行处理,得到表格样本中相邻两行或相邻两列的文本字符串样本。
[0113]
此外,若第一文本字符串样本和第二文本字符串样本分别为标题文本和数据文本,则将该组文本字符串对样本的标签设置为第一文本和第二文本不一致。若第一文本字符串样本和第二文本字符串样本均为标题文本或者均为数据文本,则将该文本对样本的标签设置为第一文本和第二文本一致。
[0114]
s72,将训练样本集输入到初始的相似度检测模型中进行迭代训练。
[0115]
将每个训练样本中的第一文本字符串样本和第二文本字符串样本分别输入到初始的预训练语言模型中进行特征提取,分别得到第一特征向量和第二特征向量。将第一特征向量和第二特征向量输入到交叉注意层中进行融合处理,得到高维特征向量。将高维特征向量输入到全连接层中,利用二分类交叉熵损失函数对初始的相似度检测模型进行迭代训练,得到已训练的深度学习模型。具体过程可以参见上述对图4所示的相似度检测模型的具体描述,此处不再赘述。
[0116]
基于本申请提供的表格标准化处理方法,一方面,在本文相似性检测的过程中,充分考虑到两个输入文本之间特征的相关性,在现有的预训练语言模型基础上增加交叉注意层,利用交叉方式来计算高维特征向量,可以有效地表征两个输入文本特征之间的映射关系,增强两个输入文本特征之间的关联性,从而提高相似性检测模型识别的准确率。另一方面,本申请从待处理的表格的前两行或者前两列开始检测文本的一致性,一旦识别到数据的起始行和起始列,则不需要对待处理的表格中剩余的行列进行检测,降低了算法的复杂度。再按照标准库中的种类对每个数据对应的标题行和标题列进行筛选,去除不相关的信息。有利于企业根据业务需求对标准化表格中的信息进行精确分析。
[0117]
应理解,上述实施例中各步骤的序号的大小并不意味着执行顺序的先后,各过程的执行顺序应以其功能和内在逻辑确定,而不应对本申请实施例的实施过程构成任何限定。
[0118]
对应于上文实施例所述的表格标准化处理方法,图8示出了本申请实施例提供的表格标准化装置的结构框图,为了便于说明,仅示出了与本申请实施例相关的部分。
[0119]
参照图8,该装置800包括:获取单元801、识别单元802、分类单元803和标准化单元801。
[0120]
具体地,获取单元801用于获取待处理的表格,待处理的表格包括n行m列。
[0121]
识别单元802可以从待处理的表格中的第1行开始,对相邻两行的文本进行相似度检测,直至检测到第i行和第i 1行的文本不一致时,确定第1行到第i行为标题行,且第i 1行至第n行为数据行,1≤i≤n

1;从待处理的表格中的第1列开始,对相邻两列的文本进行相似度检测,直至检测到第j列和第j 1行的文本不一致时,确定第1列到第j列为标题列,第j 1列至第m列为数据列,1≤j≤m

1。
[0122]
分类单元803可以对确定的标题行和标题列中的标题文本进行分类筛选处理,得
到预设的标准化标题。
[0123]
标准化单元801可以根据标准化标题和标准化标题在待处理的表格中对应的数据,得到待处理的表格的标准化表格。
[0124]
图9是本申请提供的一种表格标准化设备的结构示意图。设备900可以是终端设备或服务器或芯片。设备900包括一个或多个处理器901,该一个或多个处理器901可支持设备900实现上述方法实施例中描述的方法。处理器901可以是通用处理器或者专用处理器。例如,处理器901可以是中央处理器(central processing unit,cpu)。cpu可以用于对设备900进行控制,执行软件程序,处理软件程序的数据。
[0125]
在一个是实施例中,设备900可以包括通信单元905,用以实现信号的输入(接收)和输出(发送)。例如,设备900可以是芯片,通信单元905可以是该芯片的输入和/或输出电路,或者,通信单元905可以是该芯片的通信接口,该芯片可以作为终端设备或网络设备或其它电子设备的组成部分。又例如,设备900可以是终端设备或服务器,通信单元905可以是该终端设备或该服务器的收发器,或者,通信单元905可以是该终端设备或该服务器的收发电路。
[0126]
在另一个实施例中,设备900中可以包括一个或多个存储器902,其上存有程序904,程序904可被处理器901运行,生成指令903,使得处理器901根据指令903执行上述方法实施例中描述的表格标准化处理方法。
[0127]
在其它实施例中,存储器902中还可以存储有数据。可选地,处理器901还可以读取存储器902中存储的数据,该数据可以与程序904存储在相同的存储地址,该数据也可以与程序904存储在不同的存储地址。
[0128]
处理器901和存储器902可以单独设置,也可以集成在一起,例如,集成在终端设备的系统级芯片(system on chip,soc)上。
[0129]
处理器901执行上述实施例提供的表格标准化处理方法的具体方式可以参见上述实施例中的相关描述。
[0130]
应理解,上述方法实施例的各步骤可以通过处理器901中的硬件形式的逻辑电路或者软件形式的指令完成。处理器901可以是cpu、数字信号处理器(digital signal processor,dsp)、专用集成电路(application specific integrated circuit,asic)、现场可编程门阵列(field programmable gate array,fpga)或者其它可编程逻辑器件,例如,分立门、晶体管逻辑器件或分立硬件组件。
[0131]
本申请实施例还提供了一种网络设备,该网络设备包括:至少一个处理器、存储器以及存储在所述存储器中并可在所述至少一个处理器上运行的计算机程序,所述处理器执行所述计算机程序时实现上述任意各个方法实施例中的步骤。
[0132]
本申请实施例还提供了一种计算机可读存储介质,所述计算机可读存储介质存储有计算机程序,所述计算机程序被处理器执行时实现可实现上述各个方法实施例中的步骤。
[0133]
本申请实施例提供了一种计算机程序产品,当计算机程序产品在移动终端上运行时,使得移动终端执行时实现可实现上述各个方法实施例中的步骤。
[0134]
以上所述实施例仅用以说明本申请的技术方案,而非对其限制;尽管参照前述实施例对本申请进行了详细的说明,本领域的普通技术人员应当理解:其依然可以对前述各
实施例所记载的技术方案进行修改,或者对其中部分技术特征进行等同替换;而这些修改或者替换,并不使相应技术方案的本质脱离本申请各实施例技术方案的精神和范围,均应包含在本申请的保护范围之内。

技术特征:
1.一种表格标准化处理方法,其特征在于,包括:获取待处理的表格,所述待处理的表格包括n行m列;从所述待处理的表格中的第1行开始,对相邻两行的文本进行相似度检测,直至检测到第i行和第i 1行的文本不一致时,确定第1行到第i行为标题行,且第i 1行至第n行为数据行,1≤i≤n

1;从所述待处理的表格中的第1列开始,对相邻两列的文本进行相似度检测,直至检测到第j列和第j 1行的文本不一致时,确定第1列到第j列为标题列,第j 1列至第m列为数据列,1≤j≤m

1;对确定的所述标题行和所述标题列中的标题文本进行分类筛选处理,得到预设的标准化标题;根据所述标准化标题和所述标准化标题在所述待处理的表格中对应的数据,得到所述待处理的表格的标准化表格。2.如权利要求1所述的方法,其特征在于,所述待处理的表格中任一相邻两行的文本为一组文本对,所述待处理的表格中任一相邻两列的文本为一组文本对,对所述待处理的表格的任一文本对进行相似度检测的方法,包括:将所述文本对中的第一文本和第二文本输入到已训练的相似度检测模型中进行处理,得到所述第一文本和所述第二文本的相似度检测结果,所述相似度检测结果指示所述第一文本和所述第二文本一致或者不一致,所述第一文本和所述第二文本为所述待处理的表格中的相邻两行的文本或者相邻两列的文本;其中,所述相似度检测模型包括预训练语言模型、交叉注意层和全连接层,利用所述相似度检测模型对所述文本对进行处理包括:将所述第一文本和所述第二文本输入到所述预训练语言模型中进行特征提取,得到第一特征向量和第二特征向量;将所述第一特征向量和所述第二特征向量输入到所述交叉注意层中进行融合处理,得到高维特征向量;将所述高维特征向量输入所述全连接层中进行全连接计算,得到所述相似度检测结果。3.如权利要求2所述的方法,其特征在于,所述将所述第一特征向量和所述第二特征向量输入到所述交叉注意层中进行融合处理,得到高维特征向量,包括:计算所述第一特征向量中的每个值相对于所述第二特征向量中每个值的第一权重;根据所述第一权重对所述第一特征向量进行加权求和计算,得到第三特征向量;计算所述第二特征向量中的每个值相对于所述第一特征向量中每个值的第二权重;根据所述第二权重对所述第二特征向量进行加权求和计算,得到第四特征向量;将所述第三特征向量和所述第四特征向量进行级联,得到所述高维特征向量。4.如权利要求2所述的方法,其特征在于,所述方法还包括:若所述待处理的表格中每一组文本对的相似度检测结果均为所述第一文本和所述第二文本一致,则确定所述待处理的表格为跨页表格,并将所述跨页表格与排序在所述跨页表格前一位的第一表格进行合并。5.如权利要求4所述的方法,其特征在于,所述将所述跨页表格与排序在所述跨页表格
前一位的第一表格进行合并的方法,包括:分别获取所述跨页表格和所述第一表格的行列数;若所述跨页表格的行数与所述第一表格的行数相同,则进行列合并;若所述跨页表格的列数与所述第一表格的列数相同,则进行行合并。6.如权利要求1至5任一所述的方法,其特征在于,所述对确定的所述标题行和所述标题列中的标题文本进行分类筛选处理,得到预设的标准化标题,包括:利用已训练的文本分类模型对所述标题文本进行分类,确定所述标题文本在预设的标准库中对应的类别;根据所述标题文本在预设的标准库中对应的类别对所述标题文本进行文本筛选,得到预设的标准化标题。7.如权利要求1至5任一所述的方法,其特征在于,所述获取待处理的表格,包括:从表格数据源中获取待处理的表格,所述表格数据源包括图片格式型、pdf型或表格型。8.一种表格标准化装置,其特征在于,包括:获取单元,用于获取待处理的表格,所述待处理的表格包括n行m列;识别单元,从所述待处理的表格中的第1行开始,对相邻两行的文本进行相似度检测,直至检测到第i行和第i 1行的文本不一致时,确定第1行到第i行为标题行,且第i 1行至第n行为数据行,1≤i≤n

1;从所述待处理的表格中的第1列开始,对相邻两列的文本进行相似度检测,直至检测到第j列和第j 1行的文本不一致时,确定第1列到第j列为标题列,第j 1列至第m列为数据列,1≤j≤m

1;分类单元,对确定的所述标题行和所述标题列中的标题文本进行分类筛选处理,得到预设的标准化标题;标准化单元,根据所述标准化标题和所述标准化标题在所述待处理的表格中对应的数据,得到所述待处理的表格的标准化表格。9.一种终端设备,包括存储器、处理器以及存储在所述存储器中并可在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1至7任一项所述的方法。10.一种计算机可读存储介质,所述计算机可读存储介质存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1至7任一项所述的方法。
技术总结
本申请提供了一种表格标准化处理方法,包括:获取N行M列的待处理的表格;从表格的第1行开始对相邻两行的文本进行相似度检测,检测到第i行和第i 1行的文本不一致时,确定第1行到第i行为标题行且第i 1行至第N行为数据行,1≤i≤N


技术研发人员:戚思骅
受保护的技术使用者:中国平安人寿保险股份有限公司
技术研发日:2021.04.23
技术公布日:2021/6/25

转载请注明原文地址:https://doc.8miu.com/read-150428.html

最新回复(0)