1.本发明属于图像识别和处理技术领域,更具体的是涉及一种文本页面图像还原方法及系统、采用所述方法的电子设备和计算机可读介质。
背景技术:
2.办公自动化极大地便利了办公一族,扫描、复印、打印、传真、电邮几种技术的结合,非常方便文案设计的传播与创作。而这种技术的发展也影响到学生的学习,现在老师布置作业有时就是发一份电子试卷,然后学生利用自己家里的打印机打印之后,进行试卷解答。新技术的发展,也带来了新的问题,如果学生看见一份别人做过的试卷,题目特别适合自己练习,或者一张没有电子试卷的卷子,做过之后想再做一次,如何去获取这份试卷的一份新的、未做过的版本呢?去网上搜索可能会找到一部分电子版,但并不能保证所有的试卷均能够找到对应的空白电子版,因此迫切需要研究开发一种试卷还原的方法及系统来满足学生的这种需求。
技术实现要素:
3.有鉴于此,本发明的主要目的在于提出一种文本页面图像还原的方法及系统、采用所述方法的电子设备和计算机可读介质,以期至少部分地解决上述技术问题中的至少之一。
4.为了实现上述目的,作为本发明的第一个方面,提出了一种文本页面图像还原方法,包括如下步骤:
5.对待还原的文本页面图像中的每一个像素提取扭曲系数,作为文本页面图像的还原处理的一个分支;对待还原的文本页面图像进行页面高端化和/或去除手写痕迹,作为另一分支;两个分支进行并行处理;
6.基于得到的所述扭曲系数,对并行处理得到的文本页面图像进行扭曲矫正,得到还原的文本页面图像。
7.作为本发明的第二个方面,还提出了一种文本页面图像还原系统,包括:
8.输入模块,用于输入待还原的文本页面图像:
9.预处理模块,用于视情况对输入的待还原的文本页面图像执行方向矫正和/或页面主体矫正;
10.并行处理模块,包括扭曲系数提取模块,用于对待还原的文本页面图像中的每一个像素提取扭曲系数,作为并行处理的一个分支;以及页面高端化模块和/或去除手写痕迹模块,用于对待还原的文本页面图像进行页面高端化和/或去除手写痕迹处理,作为并行处理的另一个分支;以及局部扭曲矫正模块,用于基于得到的所述扭曲系数,对并行处理后得到的文本页面图像进行扭曲矫正;
11.后处理模块,用于视情况对并行处理模块处理后的文本页面图像进行后处理;
12.输出模块,用于输出还原处理后的文本页面图像。
13.作为本发明的第三个方面,还提出了一种电子设备,包括处理器和存储器,所述存储器用于存储计算机可执行程序,当所述计算机可执行程序被所述处理器执行时,所述处理器执行如上所述的文本页面图像还原方法。
14.作为本发明的第四个方面,还提出了一种计算机可读介质,存储有计算机可执行程序,所述计算机可执行程序被执行时,实现如上所述的文本页面图像还原方法。
15.基于上述技术方案可知,本发明的文本页面图像还原方法及系统相对于现有技术至少具有如下有益效果之一:
16.本发明的文本页面图像还原方法通过并行处理模式,极大地节约了处理时间,处理迅速而效果优异;
17.本发明的扭曲矫正方案简单快捷,能够通过机器学习训练的简单模型,快速准确地辨别出图像中存在的扭曲程度,且能够达到逐像素的程度;
18.本发明的文本页面图像还原方法采用模块化的方式,可以通过灵活地组合各种模块,来适应于不同场景,解决不同的技术问题;
19.本发明的文本页面图像还原方法针对不同模块均提出了相应地改进,均比现有技术的相应模块效果更好,效率更高。
附图说明
20.图1是本发明的文本页面图像还原方法的方框流程图;
21.图2是本发明的文本页面图像还原系统的结构示意图;
22.图3是本发明的电子设备的结构示意图;
23.图4是本发明的计算机可读介质的示意图;
24.图5是本发明实施例3的文本页面图像还原系统的结构示意图;
25.图6a、6b是现有技术的实际处理效果照片的一个示例;
26.图7a
‑
7f是本发明实施例的实际处理效果照片的另一个示例(包括灰度和彩色两种模式)。
具体实施方式
27.在对于具体实施例的介绍过程中,对结构、性能、效果或者其他特征的细节描述是为了使本领域的技术人员对实施例能够充分理解。但是,并不排除本领域技术人员可以在特定情况下,以不含有上述结构、性能、效果或者其他特征的技术方案来实施本发明。
28.附图中的流程图仅是一种示例性的流程演示,不代表本发明的方案中必须包括流程图中的所有的内容、操作和步骤,也不代表必须按照图中所显示的顺序执行。例如,流程图中有的操作/步骤可以分解,有的操作/步骤可以合并或部分合并,等等,在不脱离本发明的发明主旨的情况下,流程图中显示的执行顺序可以根据实际情况改变。
29.附图中的框图一般表示的是功能实体,并不一定必然与物理上独立的实体相对应。即,可以采用软件形式来实现这些功能实体,或在一个或多个硬件模块或集成电路中实现这些功能实体,或在不同网络和/或处理模块装置和/或微控制器装置中实现这些功能实体。
30.各附图中相同的附图标记表示相同或类似的元件、组件或部分,因而下文中可能
省略了对相同或类似的元件、组件或部分的重复描述。还应理解,虽然本文中可能使用第一、第二、第三等表示编号的定语来描述各种器件、元件、组件或部分,但是这些器件、元件、组件或部分不应受这些定语的限制。也就是说,这些定语仅是用来将一者与另一者区分。例如,第一器件亦可称为第二器件,但不偏离本发明实质的技术方案。此外,术语“和/或”、“及/或”是指包括所列出项目中的任一个或多个的所有组合。
31.本发明的一个方面是针对已经答过题的试卷需要去除痕迹,重新生成新的试卷的任务而提出来的,其可以将用户上传的作答后的试卷以及习题,去除学生以及老师的笔迹,矫正扭曲,去除拍摄以及试卷中的不美观噪声,还原成一张平整未作答的、高质量的试卷,方便学生再次答题。本发明的技术方案同样适用于其它文本页面图像,例如有批改、损毁痕迹的教科书、图书、宣传资料等的电子图像。
32.本发明的另一个方面是针对客户想要将曾经答过的题进行收藏整理,便于以后复习,此时对于已经答过题的试卷就不需要去除手写答案的笔迹,而只是将拍摄的试卷调整还原到页面规整、字体清晰、卷面整洁的状态。本发明的这一技术方案同样适用于其它文本页面图像,例如学生做的笔记,实验记录、采访手记等。
33.基于此,如图1所示,本发明提出了一种文本页面图像的还原方法,包括如下步骤:
34.对待还原的文本页面图像中的每一个像素提取扭曲系数,作为文本页面图像的还原处理的一个分支;
35.对待还原的文本页面图像进行页面高端化和/或去除手写痕迹,作为另一分支;
36.两个分支进行并行处理;
37.基于得到的所述扭曲系数,对并行处理得到的文本页面图像进行扭曲矫正,得到还原的文本页面图像。
38.其中,所述文本页面图像例如包括但不限于书籍、杂志、报纸、宣传页、试卷等等以文本为主页面的电子图像。
39.其中,所述提取扭曲系数的步骤通过一预先训练的人工智能模型来实现;
40.其中,所述人工智能模型例如为带有空洞卷积结构的u
‑
net模型,空洞卷积的作用在于扩大感受野的同时保证了特征的分辨率。所述人工智能模型的输入为扭曲图像,输出为扭曲系数,即x方向偏移量和y方向偏移量。其中,对于输出的网络回归的扭曲系数,例如可以采用高斯模糊进行局部平滑,消除局部的异常扭曲。
41.其中,所述人工智能模型在进行训练时,训练网络无需标注样本,全部基于生成的样本,例如基于完全平整的文档图像进行扭曲变换以模拟模型需要处理的扭曲图像,同时记录扭曲恢复时所需要的x方向和y方向的偏移量。由此可见,本发明的方案简单快捷,能够通过机器学习训练的简单模型,快速准确地辨别出图像中存在的扭曲程度,且能够达到逐像素的程度。
42.其中,所述基于得到的扭曲系数,对并行处理得到的文本页面图像进行扭曲矫正的步骤,是基于编码器
‑
解码器(encoder
‑
decoder)结构的深度学习模型来实现图像重建的,其中encoder从输入图像中提取特征,decoder从提取的特征中还原出平整的图像,整个过程中使用批归一化(batch_normalization)和层归一化(layer_normalization)进行归一化。
43.其中,所述深度学习模型的损失函数通过如下方法计算:
44.基于获取的扭曲系数,计算所述深度学习模型输出的图像x方向上的偏移量和y方向上的偏移量,并将这两个方向的格点数据与扭曲图像生成时保存的真实x方向的偏移量与真实y方向上的偏移量进行均方差计算,作为网络的格点损失函数(loss);计算所述深度学习模型输出的图像和真实平整图像之间的均方差损失函数(loss);根据上述两个损失函数(loss)计算梯度,更新整个深度学习模型。
45.其中,所述页面高端化的步骤至少包括去除污渍、水印和摩尔纹,例如可以采用如下方法:
46.采用一种文本图像增强模型,包括生成器和判别器,通过生成器和判别器的对抗学习,将待处理的原始彩色文本图像(文本页面图像)增强生成不含图像噪声、水印的灰度/彩色图像。其中,本发明的方案可以输出两种模式:灰度图像模式或彩色图像模式,两种方案只是处理时输出为灰度图像或彩色图像,整个处理过程是一样的,可以根据用户的需要进行选择。
47.其中,所述的生成器包括编码模块,所述的编码模块包括r个卷积层级,每个层级都是由卷积层、in归一化层和prelu激活层组成;对编码模块的卷积层进行卷积运算,提取输入图像的不同特征,第一层卷积层可能只能提取一些低级的特征如边缘、线条和角等层级,更多层的网路能从低级特征中迭代提取更复杂的特征。优选地,r个所述卷积层级的第一层的卷积核多于其余r
‑
1层的卷积核。
48.其中,所述的生成器包括残差网络模块,所述的残差网络模块包括s个残差模块,每个残差模块包括至少三层卷积层,至少一个中间层卷积层的卷积核多于其它层卷积层的卷积核。残差网络模块的使用可以使由编码模块提取的特征在不怎么丢失原有信息的情况下向需要生成的风格转换。这里残差模块包的中间层卷积层能够对通道数(channel)起到升维或者降维的作用,从而其它卷积层以相对较低维度的输入进行卷积运算,提高计算效率。
49.其中,所述的生成器包括与编码模块结构对称的解码模块,所述的解码模块包括r个反卷积层级,各个反卷积层级的卷积核与编码模块的各个卷积层级的卷积核分别对应。
50.其中,所述判别器采用卷积神经网络,包括t个卷积层和1个全连接层,所述全连接层输出生成图片和真实图像的接近程度,用于优化生成器的效果。
51.其中,所述文本图像增强模型通过如下方法训练得到:
52.获取含有各类图像噪声和/或水印的彩色文本图像样集a和不含图像噪声、水印的灰度/彩色图像样集b,并分别输入到文本图像增强模型中,通过反向传播的方法对文本图像增强模型的参数进行回归,模型训练完成后,提取出所述生成器g
ab
。
53.本发明的上述文本图像增强模型通过生成器和判别器的对抗学习,将待处理的原始彩色文本图像增强生成不含图像噪声、水印的灰度/彩色图像,实现了对原始彩色文本图像的去除图像噪声、水印等干扰及图像灰度化/彩色化的同时处理,提升读者观感,而且具有更好的图像处理效果,鲁棒性高。同时,通过采用本发明的文本图像增强模型处理过的原始彩色文本图像,更加突出文本区域,可极大的提升ocr的检测和识别准确率。
54.可选地,将彩色文本图像样集输入到文本图像增强模型中包括:
55.将彩色文本图像样集的彩色文本图像随机剪裁成不同尺寸规格,将不同尺寸规格的图像调整至同一设定尺寸规格输入到文本图像增强模型中;
56.优选地,将彩色文本图像等比例随机剪裁成至少两种尺寸规格;
57.进一步优选地,通过采用“crop”的方式将彩色文本图像进行剪裁,裁剪后的图像重新调整尺寸(resize)到设定尺寸规格输入到文本图像增强模型中。
58.本发明的上述文本图像增强模型的训练方法,通过将彩色文本图像样集的彩色文本图像随机剪裁成不同尺寸规格,将不同尺寸规格的图像调整至同一设定尺寸规格输入到文本图像增强模型中,实现了训练图像的多尺度输入,生成的文本图像增强模型可适应各种尺寸的图像,提高模型的鲁棒性和稳定性。
59.其中,所述文本图像增强模型的损失函数包括:
60.对抗损失:
61.从a
→
b对抗损失:
62.l
gan
(g,d
b
,a,b)=e[logd
b
(b)] e[log(1
‑
d
b
(g(a))];
[0063]
从b
→
a对抗损失:
[0064]
l
gan
(g,d
a
,a,b)=e[logd
a
(a)] e[log(1
‑
d
a
(g(b))];
[0065]
循环一致性损失:
[0066]
l
cyc
(g
a
,g
b
)=e[||g
b
(g
a
(a))
‑
a]||] e[||g
a
(g
b
(b))
‑
b]||];
[0067]
总体损失:
[0068]
l
total
=l
gan
(g,d
b
,a,b) l
gan
(g,d
a
,a,b) l
cyc
(g
a
,g
b
)。
[0069]
其中,第一判别器d
a
、第二判别器d
b
、第一生成器g
a
、第二生成器g
b
、彩色文本图像样集(数据集a)、灰度/彩色图像样集(数据集b)。
[0070]
本发明的文本图像增强模型的训练方法将彩色文本图像样集a中的图像输入到预训练的文本图像增强模型,经过多次卷积处理后输出图像,并按照从a
→
b对抗损失函数计算输出图像相对于灰度/彩色图像样集b中图像的第一损失值。将输出图像输入到预训练的文本图像增强模型,经过多次卷积处理后输出判别值,并按照从b
→
a对抗损失函数计算该判别值相对于预设标签值的第二损失值。结合第一损失值和第二损失值来更新生成器和判别器的参数,直到第一损失值和第二损失值的综合满足预设条件时,训练结束,得到训练后的文本图像增强模型。
[0071]
其中,去除手写痕迹的方法例如包括:
[0072]
基于多任务学习的训练框架,设计了多路信号监督的生成对抗网络,将印刷和手写分割的dice
‑
loss也融入到模型中,使其对印刷手写区域的局部关注度有所提升,手写去除同样也包含了灰度模型和彩色模型,其中的难点在于去除手写笔迹的同时保留手写覆盖的印刷字体。
[0073]
作为优选,去除手写痕迹的方法采用如下方法:
[0074]
采用预先训练好的人工智能模型对所述文本页面图像进行处理,输出去除了手写痕迹的文本页面图像;
[0075]
其中,所述预先训练好的人工智能模型例如为高分辨率网络(hrnet)模型,所述模型采用预先训练好的人工智能模型对所述文本页面图像进行处理,输出去除了手写痕迹的文本页面图像;
[0076]
其中,所述预先训练好的人工智能模型例如为高分辨率网络(hrnet)模型,所述模型输入图像,输出三部分信息:印刷轨迹、手写轨迹和去除手写轨迹后的图像;模型的训练
样本包含四部分:含手写的原图、印刷轨迹、手写轨迹、不含手写的图;模型结构例如可以采用高分辨率网络(hrnet),以提取到多种感受野融合的特征;使用反卷积和堆叠(concat)的方式构建特征图金字塔,反卷积可以增大特征图的尺度,使用堆叠(concat)的方式将不同卷积层的特征进行拼接从而实现融合的效果,最终形成multi
‑
head结构的输出,输出包含以下3个部分:(1)w*h*2的印刷轨迹、(2)w*h*2的手写轨迹、(3)w*h*3的去除轨迹后图像;其中,w为输入图像的宽,h为输入图像的高。在本优选实施方式中,印刷轨迹和手写轨迹的分别输出是一种语义分割任务,在印刷和手写重叠的场景下,将印刷、手写、背景像素的3分类问题改进为两个2分类问题,可以实现印刷和手写像素的非互斥分割。分割极端的损失函数如下所示,采取了dice
‑
loss和交叉熵损失融合的损失函数,形成两者的优势互补。dice
‑
loss和交叉熵损失分别由各自的手写和印刷两部分loss组成。
[0077]
l
seg
=αl
dice
(1
‑
α)l
ce
;
[0078]
l
dice
=βl
dice_print
(1
‑
β)l
dice_hw
;
[0079]
l
ce
=γl
ce_print
(1
‑
γ)l
ce_hw
;
[0080]
其中,l
seg
、l
dice
、l
ce
分别为分割损失函数、dice损失函数、交叉熵损失函数,α为dice损失和交叉熵损失的调节权重,β为dice损失内部印刷和手写的调节权重、γ为交叉熵损失内部印刷和手写的调节权重;
[0081]
最终阶段网络的损失函数l如下所示:
[0082]
l=δl
seg
(1
‑
δ)l1;
[0083]
其中,l为图像分割修复的总损失函数,δ为分割损失函数和图像修复损失函数的调节权重;l1为图像修复损失函数。
[0084]
本实施方式的多任务学习在训练过程中易产生训练不收敛的情况,因此通过分步学习的方法进行网络的更新,首先使用分割任务的标签监督网络训练,此时网络学习会相对容易,训练例如约30个阶段(epoch),加入图像修复的l1‑
loss,此时网络的重点在于优化修复效果,所以l1‑
loss的权重会有所增加。
[0085]
其中,本发明的方法在执行上述并行处理步骤之前例如还可以包括输入步骤,例如包括但不限于如下方式的一种或多种:
[0086]
通过电子相机等图像采集设备拍摄得到电子图像文件;
[0087]
通过扫描仪、电分机等扫描得到电子扫描文件;
[0088]
通过网络传输已经存在在网络上的电子文件。
[0089]
由于输入步骤是可选的,因此在图1中输入步骤的方框是虚线表示的。
[0090]
其中,本发明的方法在执行上述并行处理步骤之前例如还可以包括对待还原的文本页面图像进行预处理的步骤,例如以下步骤中的一步或多步的组合:
[0091]
调整文本页面图像的主体,目的是调整纸张页面的四个顶角,使纸张页面主体充盈整个文本页面图像,不再包含与纸张页面无关的区域;和/或
[0092]
调整文本页面图像的方向,使文本页面图像中的文字行与水平方向的夹角为0度。
[0093]
由于预处理步骤是可选的,因此在图1中预处理步骤的方框是虚线表示的。
[0094]
其中,所述调整页面主体的步骤例如通过如下所述的提取页面主体区域并对页面主体进行矫正的方法实现:
[0095]
将所述图片的四个顶点作为参考点,采用回归计算确定若干定位关键点,该些定
位关键点用于确定所述图片的主体区域;根据所述定位关键点,对所述主体区域进行识别并校正,以去除无关的信息并规范化所述主体区域。
[0096]
其中,所述图片的主体区域包括页面区域,所述若干定位关键点包括页面的四个顶点。通过将所述图片的四个顶点作为参考点进行回归计算得到待校正的主体区域的定位关键点,并根据该定位关键点从待处理图片中直接截取主体区域,能够精确地识别出待处理图片中的主体区域,无需图像分割处理,提高了图片处理的速度,有效避免了图片分割边缘不稳定的问题,同时能够准确识别出待处理图片中有无主体区域。
[0097]
其中,所述采用回归计算确定若干定位关键点的步骤,包括:建立图像定位回归模型,使用训练好的图像定位回归模型获取所述图片的定位关键点的位置信息。
[0098]
其中,所述建立图像定位回归模型的步骤包括:标注样本数据并使用样本数据对该图像定位回归模型进行训练,其中,所述标注样本数据指对样本图片进行了标注,以标注出样本图片中主体区域的定位关键点以及是否包含主体区域。
[0099]
其中,所述图像定位回归模型输入待处理图片,输出所述图片中主体区域的定位关键点的位置坐标和置信度,该置信度表示输出的所述定位关键点坐标的可靠概率;可选地,当置信度小于预定阈值时,停止对所述主体区域进行校正并输出无主体区域的警示信息。本发明可以通过计算定位关键点的位置坐标的置信度,从而识别出待处理图片中有无主体区域,以便确定是否继续进行后续的校正处理。
[0100]
其中,所述图片的主体区域为页面区域时,所述对样本图片进行标注的步骤包括:当所述样本图片的页面区域均位于所述样本图片内时,直接将该页面的四个顶点标注为所述定位关键点;当所述样本图片的页面区域部分位于所述样本图片之外时,根据位于所述样本图片内的页面顶点,和,所述页面的边线与所述图片的边线的交点,来推算出位于所述样本图片之外的页面顶点的位置,并将图片内的页面顶点和推算出的位于所述样本图片外的页面顶点标注为所述定位关键点。这主要是针对有些应用场景,例如拍搜场景下,图片的主体区域为页面区域时,通过对图片进行标注处理,能够更准确地标注出多情况下的页面区域的四个顶点,以便后续使用标注有页面区域的四个顶点的图片建立训练数据集,并使用该训练数据集对图像定位回归模型进行训练。更进一步地,可以例如通过计算机,根据位于样本图片内的页面顶点,和,页面边线与图片边线的交点,来推算出位于样本图片之外的页面顶点的位置。
[0101]
本发明通过将所述图片的四个顶点作为参考点进行回归计算得到待处理图片的主体区域的定位关键点,并根据这些定位关键点从待处理图片中直接截取主体区域进行校正。本发明方案能够较精确地识别出待处理图片中的主体区域,无需进行图像分割处理,提高了图片处理的速度,有效避免了图片分割边缘不稳定的问题。本方案还可以去除主体区域之外的无关背景。
[0102]
可选地,所述推算出位于所述样本图片之外的页面顶点的位置的步骤,包括:标注出样品图片的位于图片内的顶点,和,页面的边线与所述图片的边线的交点;遍历样本图片的所有标注点,依次判断相邻两个标注点是否同时位于同一图片边线,所述标注点包括所述位于图片内的顶点和所述交点;在判断为该相邻两个标注点是同时位于同一图片边线时,继续判断该两个标注点所在的两条页面区域边线延长相交所形成的夹角是否满足大于等于第一阈值角度;在所述夹角满足大于等于第一阈值角度时,将该相邻两个标注点标记
为非顶点,并将该两个非顶点对应的两条页面区域的边线延长相交后形成的交汇点标注为所述页面区域的位于图片外的预测顶点,同时删除该两个标记为非顶点的标注点,最后得到标注有四个定位关键点的样本图片;可选地,所述第一角度阈值为60度。
[0103]
其中,所述对主体区域进行校正的步骤包括:根据所述定位关键点,对所述主体区域进行放射变换和/或方向校正,以得到校正后图片。
[0104]
本发明方法还可以如下实现:
[0105]
将待处理图片输入根据本发明第二方面所述的页面检测模型的搭建方法生成的页面检测模型,获得所述待处理图片的页面区域的四个顶点及置信度;判断所述置信度是否大于等于第一阈值,当所述置信度大于第一阈值时,根据所述待处理图片的页面区域的四个顶点,对所述待处理图片进行页面区域识别及校正;
[0106]
其中,所述页面检测模型的搭建方法包括如下步骤:搭建关键点检测模型;使用标注有页面区域的四个顶点的图片,对所述关键点检测模型进行训练,使得经过训练的所述关键点检测模型能够输出所述页面区域的四个顶点及置信度;其中,所述标注有页面区域的四个顶点的图片通过前述的对样本图片进行标注的步骤完成。
[0107]
由此可见,本发明的两种方法均无需图像分割处理,提高了图片处理的速度,有效避免了图片分割边缘不稳定的问题,同时能够更准确识别出待处理图片中有无页面区域,还提高了图像分类精度,由此解决了因页面区域相对于图片倾斜、带有无关背景、非主体区域等影响因素引起的图像识别精度低的问题,同时能够更准确识别出有无页面区域的图片。
[0108]
其中,调整文本页面图像的旋转方向的步骤例如通过识别文字行,确定文字行与水平线的夹角,调整所述夹角的方法来实现。
[0109]
其中,所述步骤也可以采用试探的方式来实现,例如同时试探若干旋转方向,检测是否是合适的旋转方向,然后确定真正要旋转的方向。
[0110]
作为优选,所述调整文本页面图像的旋转方向的步骤例如通过如下方法来实现:
[0111]
获取第一文本图像;
[0112]
对所述第一文本图像按照n个预定旋转角度进行旋转操作,得到n个旋转图像,其中,n为大于等于二的自然数;
[0113]
根据所述n个旋转图像预估所述第一文本图像的矫正方向,所述矫正方向指为便于后续图像识别对所述第一文本图像进行旋转操作后的方向,该方向一般相对用户而言是符合阅读习惯的方向,即用户看图像中的字体是正的,不反也不偏斜;
[0114]
根据所述第一文本图像的矫正方向对第一文本图像进行方向矫正。
[0115]
其中,根据所述n个旋转图像预估所述第一文本图像的矫正方向的步骤,包括:
[0116]
将所述n个旋转图像输入训练好的方向预估模型中评估各旋转图像的方向正确的概率;并将概率最大的旋转图像的方向作为所述第一文本图像的矫正方向。
[0117]
可选地,所述方向预估模型为图像分类模型经训练后生成。
[0118]
其中,所述方向预估模型包括:n个神经网络,和分别与所述n个神经网络连接的判断模块;所述n个神经网络分别计算输入的旋转图像的方向正确的概率;所述判断模块根据各旋转图像的方向正确的概率水平判断所述第一文本图像的矫正方向;
[0119]
可选地,所述神经网络包括依次连接的浅层卷积网络和自注意力神经网络,所述
自注意力神经网络与所述判断模块连接;所述浅层卷积网络用于提取旋转图像的特征数据;所述自注意力神经网络用于根据特征数据获取所述旋转图像的方向正确的概率;
[0120]
可选地,所述浅层卷积网络包括:多个卷积块和一个全连接层;
[0121]
可选地,每个所述卷积块包括卷积层、池化层、批量归一化层和激励层。
[0122]
其中,所述自注意力神经网络基于transformer模型;
[0123]
可选地,所述自注意力神经网络包括:自注意力模块和二分类模块,所述自注意力模块用于将输入图像转化为满足所述二分类模块要求的规格,所述二分类模块用于得到所述旋转图像的方向正确的概率;示例性的,自注意力模块包括位置相关的前馈网络和多头自注意层,位置相关的前馈网络在编码阶段对输入的数据进行编码的同时对其位置信息进行编码。多头自注意层在每个子层中使用自注意机制来关联输入数据及其在相同输入序列中的位置。此外,注意力被称为多头是因为几个注意力层是并行堆叠的,具有相同输入的不同线性变换。这有助于模型捕获输入的各个方面,并提高其表达能力。
[0124]
可选地,所述二分类模块包括全连接层和softmax层,这种结构实现了并行处理、更短的训练时间和更高的转换精度,而没有任何重复组件。
[0125]
其中,对所述第一文本图像按照n个预定旋转角度进行旋转操作,得到n个旋转图像包括:
[0126]
将所述第一文本图像转换为第一文本图像矩阵;
[0127]
对所述第一文本图像矩阵进行矩阵操作,得到与所述n个旋转图像对应的n个旋转矩阵。
[0128]
其中,所述预定旋转角度为四个,包括:所述第一文本图像不作旋转、将所述第一文本图像沿第一方向旋转90度、将所述第一文本图像方向沿第一方向旋转180度和将所述第一文本图像方向沿第一方向旋转270度;
[0129]
其中,所述对所述第一文本图像矩阵进行矩阵操作,得到与所述n个旋转图像对应的n个旋转图像矩阵的步骤,包括:
[0130]
将所述第一文本图像矩阵直接作为所述第一旋转图像矩阵;
[0131]
将所述第一文本图像矩阵进行转置后,再将转置后矩阵的竖直平分线作为对称轴对矩阵元素做轴对称处理,得到所述第二旋转图像矩阵;
[0132]
将所述第一文本图像矩阵的竖直平分线作为对称轴对矩阵元素做轴对称处理后,再将处理后矩阵的水平平分线作为对称轴对矩阵元素做轴对称处理,得到所述第三旋转图像矩阵;
[0133]
将所述第一文本图像矩阵进行转置后,再将转置后矩阵的水平平分线作为对称轴对矩阵元素做轴对称处理,得到所述第四旋转图像矩阵。
[0134]
本发明上述方案能够提高文字识别准确率,提升用户体验;相较于现有技术,本发明方案根据第一文本图像同步旋转后得到的多个方向的旋转图像综合识别第一文本图像的矫正方向,具有更高的准确率。并且,本发明只需输入文本图像,无需检测和识别文字行,就可快速识别文本图像的矫正方向,同时还可以识别不包含文字的文本图像的矫正方向,具有操作简便、识别快速、应用范围广等优点。
[0135]
其中,本发明的方法在执行上述并行处理步骤之后,例如还可以包括对文本页面图像进行后处理的步骤,例如包括如下步骤中的一步或多步的组合:
[0136]
对文本页面图像调整亮度和对比度的步骤;和/或
[0137]
根据用户需要对文本页面图像部分内容进行擦除、修改或添加的步骤,具体来说,就是本发明提供供用户自由操作的编辑工具,可以根据其需要对文本页面图像中的部分内容进行修改,例如未擦干净的手写痕迹可以通过橡皮擦手动擦干净,手写内容存在谬误时可以先擦去再写上正确的,有新的内容或想法需要添加时可以添加新的文字,等等;和/或
[0138]
识别文本页面图像中的印刷字体,替换成用户设定的字体重新输出;和/或
[0139]
对文本页面图像中的字体和线条(例如表示空格的横线、分割线等)进行加黑处理;和/或
[0140]
给新生成的文本页面图像加上个性化的标签或水印;和/或
[0141]
将文本页面图像的背景色调成客户设定的颜色;等等。
[0142]
上述步骤的具体实现方式例如为本领域的公知手段。由于后处理步骤是可选的,因此在图1中后处理步骤的方框是虚线表示的。
[0143]
其中,本发明的方法例如还可以包括输出步骤,例如将所述还原的文本页面图像输出到屏幕、打印机、投影仪、通讯设备上。其中,所述打印机包括色带打印机、喷墨打印机、激光打印机和热转印打印机,所述热转印打印机例如包括作业帮公司最新推出的喵喵机,一种专门供学生使用、可以随时打印便签或试卷的小巧打印机。
[0144]
由于输出步骤也是可选的,因此在图1中输出步骤的方框也是虚线表示的。
[0145]
如图2所示,本发明还公开了一种文本页面图像还原系统,包括:
[0146]
输入模块,用于输入待还原的文本页面图像:
[0147]
预处理模块,用于视情况对输入的待还原的文本页面图像执行方向矫正和/或页面主体矫正;
[0148]
并行处理模块,包括扭曲系数提取模块,用于对待还原的文本页面图像中的每一个像素提取扭曲系数,作为并行处理的一个分支;以及页面高端化模块和/或去除手写痕迹模块,用于对待还原的文本页面图像进行页面高端化和/或去除手写痕迹处理,作为并行处理的另一个分支;以及局部扭曲矫正模块,用于基于得到的所述扭曲系数,对并行处理后得到的文本页面图像进行扭曲矫正;其中,扭曲系数提取模块和局部扭曲矫正模块合称扭曲矫正模块;
[0149]
后处理模块,用于视情况对并行处理模块处理后的文本页面图像进行后处理;
[0150]
输出模块,用于输出还原处理后的文本页面图像。
[0151]
其中,所述文本页面图像例如包括但不限于书籍、杂志、报纸、宣传页、试卷等等的页面。
[0152]
其中,所述扭曲系数提取模块通过如上所述的训练带有空洞卷积结构的u
‑
net模型的方式来实现。
[0153]
其中,所述页面高端化模块例如通过一训练好的人工智能模型来实现,所述人工智能模型用于识别页面上的污渍和文本噪声(包括摩尔纹),所述人工智能模型例如采用生成对抗网络模型,区分为灰度和彩色两种输出模型。
[0154]
作为优选,所述页面高端化模块例如为如上所述的采用优选页面高端化方法的页面高端化模块(简称“优选页面高端化模块”)。
[0155]
其中,所述去除手写痕迹模块例如采用生成对抗网络模型来实现,也区分为灰度
和彩色两种输出模型。
[0156]
作为优选,所述去除手写痕迹模块例如为如上所述的采用优选去除手写痕迹方法的去除手写痕迹模块(简称“优选手写痕迹去除模块”)。
[0157]
其中,所述文本页面图像还原系统例如还包括输入模块。所述输入模块例如可以包括摄像头、电子相机、带拍照功能的手机、扫描仪、通讯模块等,从而所述输入模块例如可以通过如下方式中的一种或多种输入图像文件:
[0158]
通过电子相机等图像采集设备拍摄得到电子图像文件;
[0159]
通过扫描仪扫描得到电子扫描文件;
[0160]
通过网络传输已经存在网络上的电子文件;等等。
[0161]
其中,所述文本页面图像还原系统例如还包括预处理模块,所述预处理模块中例如可以包括方向矫正模块和/或页面主体矫正模块等。
[0162]
其中,所述方向矫正模块用于调整文本页面图像的方向,使文本页面图像中的文字行与水平方向的夹角为0度,例如通过识别文字行,确定文字行与水平线的夹角,调整所述夹角的方法来实现;作为优选,所述方向矫正模块例如为如上所述的采用优选方向矫正方法的方向矫正模块(简称“优选方向矫正模块”)。
[0163]
其中,所述页面主体矫正模块用于调整页面主体位置;作为优选,所述页面主体矫正模块例如为如上所述的采用优选页面主体矫正方法的页面主体矫正模块(简称“优选页面主体矫正模块”)。
[0164]
其中,所述文本页面图像还原系统例如还可以包括后处理模块,用于对经过并行处理的文本页面图像进行后处理。后处理方式例如包括但不限于:
[0165]
对文本页面图像调整亮度和对比度的步骤;和/或
[0166]
根据用户需要对文本页面图像部分内容进行擦除、修改或添加的步骤,具体来说,就是本发明提供供用户自由操作的编辑工具,可以根据其需要对文本页面图像中的部分内容进行修改,例如未擦干净的手写痕迹可以通过橡皮擦手动擦干净,手写内容存在谬误时可以先擦去再写上正确的,有新的内容或想法需要添加时可以添加新的文字,等等;和/或
[0167]
识别文本页面图像中的印刷字体,替换成用户设定的字体重新输出;和/或
[0168]
对文本页面图像中的字体和线条(例如表示空格的横线、分割线等)进行加黑处理;和/或
[0169]
给新生成的文本页面图像加上个性化的标签或水印;和/或
[0170]
将文本页面图像的背景色调成客户设定的颜色;等等。
[0171]
上述步骤的具体实现方式例如为本领域的公知手段。
[0172]
其中,所述文本页面图像还原系统例如还可以包括输出模块,用于输出经还原的所述文本页面图像。其中,所述输出模块例如还可以执行如下输出步骤,例如将所述还原的文本页面图像输出到屏幕、打印机、投影仪、通讯设备上。其中,所述打印机包括色带打印机、喷墨打印机、激光打印机、热转印打印机和热敏打印机,所述热敏打印机例如包括作业帮公司最新推出的喵喵机,一种专门供学生使用、只有打印头不需换墨、可以随时打印便签或试卷的小巧打印机。
[0173]
如图3所示,本发明还公开了一种电子设备,其包括处理器和存储器,所述存储器用于存储计算机可执行程序,其中当所述计算机可执行程序被所述处理器执行时,所述处
理器执行如上所述的文本页面图像还原方法。
[0174]
该电子设备例如可以以通用计算设备的形式表现。其中,处理器可以是一个,也可以是多个且协同工作。本发明也不排除进行分布式处理,即处理器可以分散在不同的实体设备中。本发明的电子设备并不限于单一实体,也可以是多个实体设备的总和。
[0175]
其中,存储器存储有计算机可执行程序,通常是机器可读的代码,该计算机可执行程序可以被所述处理器执行,以使得电子设备能够执行本发明的方法,或者方法中的至少部分步骤。
[0176]
该存储器包括易失性存储器,例如随机存取存储模块(ram)和/或高速缓存存储模块,还可以是非易失性存储器,如只读存储模块(rom)。
[0177]
可选的,该实施方式中,电子设备还包括有i/o接口,其用于电子设备与外部的设备进行数据交换。i/o接口可以为表示几类总线结构中的一种或多种,包括存储模块总线或者存储模块控制器、外围总线、图形加速端口、处理模块或者使用多种总线结构中的任意总线结构的局域总线。
[0178]
本发明的电子设备中还可以包括上述示例中未示出的元件或组件。例如,有些电子设备中还包括有显示屏等显示模块,有些电子设备还包括人机交互元件,例如按钮、键盘等。只要该电子设备能够执行存储器中的计算机可读程序以实现本发明方法或方法的至少部分步骤,均可认为是本发明所涵盖的电子设备。
[0179]
作为优选,所述电子设备例如为一种热转印打印机,进一步优选为猫猫机。
[0180]
如图4所示,本发明还公开了一种计算机可读介质,其上存储有计算机可执行程序,其中所述计算机可执行程序被执行时,实现如上所述的文本页面图像还原方法。
[0181]
计算机可读存储介质可以包括在基带中或者作为载波一部分传播的数据信号,其中承载了可读程序代码。这种传播的数据信号可以采用多种形式,包括但不限于电磁信号、光信号或上述的任意合适的组合。可读存储介质还可以是可读存储介质以外的任何可读介质,该可读介质可以发送、传播或者传输用于由指令执行系统、装置或者器件使用或者与其结合使用的程序。可读存储介质上包含的程序代码可以用任何适当的介质传输,包括但不限于无线、有线、光缆、rf等等,或者上述的任意合适的组合。
[0182]
可以以一种或多种程序设计语言的任意组合来编写用于执行本发明操作的程序代码,所述程序设计语言包括面向对象的程序设计语言—诸如python、java、c 等,还包括常规的过程式程序设计语言—诸如c语言、汇编语言或类似的程序设计语言。程序代码可以完全地在用户计算设备上执行、部分地在用户设备上执行、作为一个独立的软件包执行、部分在用户计算设备上部分在远程计算设备上执行、或者完全在远程计算设备或服务器上执行。在涉及远程计算设备的情形中,远程计算设备可以通过任意种类的网络,包括局域网(lan)或广域网(wan),连接到用户计算设备,或者,可以连接到外部计算设备(例如利用因特网服务提供商来通过因特网连接)。
[0183]
本发明还公开了一种计算机可执行程序,当所述计算机可执行程序被执行时,其执行如上所述的文本页面图像还原方法。
[0184]
为使本发明的目的、技术方案和优点更加清楚明白,以下结合具体实施例,并参照附图,对本发明作进一步的详细说明。需要注意的是,下述实施例仅是用于说明本发明,而不是用于对本发明作出限制。
[0185]
实施例1
[0186]
本实施例的文本页面图像还原的系统装载于网络服务器端(云端),通过扫描仪等扫描拍摄试卷上传并调用相应功能来实现其目的,所述文本页面图像还原的系统包括输入模块、优选页面高端化模块、优选手写痕迹去除模块、页面扭曲提取模块和输出模块,从而对于通过扫描仪输入的试卷图像(文本页面图像),可以高效去除其中的各种痕迹和手写笔迹,得到完整如新的试卷。
[0187]
由于扫描仪扫描时是将试卷纸面紧密贴合在扫描仪上进行扫描,其中的旋转方向和主体区域的偏差均可忽略不计,因此可以省略相应模块。
[0188]
实施例2
[0189]
本实施例的文本页面图像还原的系统装载于网络服务器端(云端),通过手机等拍摄试卷上传并调用相应功能来实现其目的,所述文本页面图像还原的系统包括输入模块、优选页面高端化模块、优选手写痕迹去除模块、扭曲系数提取模块、优选页面主体矫正模块和输出模块,从而对于通过手机拍摄输入的试卷图像(文本页面图像),同样可以高效去除其中的各种痕迹和手写笔迹,并对扭曲变形进行矫正,得到完整如新的试卷。
[0190]
其中,该实施例的方案适合于采用手机拍摄输入的试卷图像(文本页面图像),不管拍摄者的水平如何,只要满足清晰度要求,就可以高效去除其中的各种痕迹和手写笔迹,并对卷面主体画面和扭曲变形进行矫正,得到完整如新的试卷。
[0191]
实施例3
[0192]
如图5所示,本实施例的文本页面图像还原的系统装载于网络服务器端(云端),通过手机等拍摄试卷上传并调用相应功能来实现其目的,其设计目的是将用户上传的、作答后的试卷以及习题,去除学生以及老师的笔迹,矫正扭曲,去除拍摄以及试卷中的不美观噪声,还原成一张平整且未作答的高质量试卷。所述文本页面图像还原的系统包括输入模块、优选页面高端化模块、优选手写痕迹去除模块、扭曲系数提取模块、优选方向矫正模块、优选页面主体矫正模块和输出模块,后端服务全部使用tensorrt进行优化,从而节约所述模块处理的时间。其中,针对使用场景不同,本实施例提供还原到黑白试卷以及彩色试卷两种不同的技术方案。
[0193]
图7a
‑
7f是通过本实施例处理后的一系列照片,其中,图7a表示用手机拍摄的待处理的文本页面图像,其中可以看见纸张页面位于图像的上方,右侧和下方还有大块的与页面无关的内容;图7b表示采用优选方向矫正模块和优选页面主体矫正模块处理后的图像,整个页面都被纸张页面填满;图7c是继续采用优选试卷高端化模块中的灰度图像模块处理后的图像,整个页面变成了灰度图像,去除了摩尔纹等痕迹;图7d表示继续采用优选手写去除模块中的灰度图像模块处理后的图像,去除了手写痕迹,剩下的是空白的灰度图像;图7e表示采用优选试卷高端化模块中的彩色图像模块中的彩色图像模块处理后的图像,整个页面还是保持彩色图像,去除了摩尔纹等痕迹,保留手写痕迹;图7f表示继续采用优选手写去除模块中的彩色图像模块处理后的图像,整个页面还是保持彩色图像,去除了手写痕迹。
[0194]
实施例4
[0195]
本实施例的文本页面图像还原的系统装载于网络服务器端(云端),通过手机等拍摄试卷上传并调用相应功能来实现其目的,所述文本页面图像还原的系统包括输入模块、优选页面高端化模块、扭曲系数提取模块、优选方向矫正模块、优选页面主体矫正模块、后
处理模块和输出模块,从而对于通过手机拍摄输入的笔记图像(文本页面图像),不管拍摄者的水平如何,只要满足清晰度要求,就可以高效去除其中的各种污渍痕迹而保留手写痕迹,并对卷面旋转方向、主体画面和扭曲变形进行矫正,得到完整如新的保留手写笔迹的笔记。
[0196]
实施例5
[0197]
本实施例的文本页面图像还原的系统装载于网络服务器端(云端),通过与喵喵机关联的手机app上传试卷并调用相应功能来实现其目的,所述文本页面图像还原的系统包括输入模块、优选页面高端化模块、优选手写痕迹去除模块、扭曲校正模块、优选方向矫正模块、优选页面主体矫正模块和输出模块,从而对于需要通过所述喵喵机输出的试卷图像(文本页面图像),不管其来源和拍摄者的水平如何,只要满足清晰度要求,就可以高效去除其中的各种痕迹和手写笔迹,并对卷面旋转方向、主体画面和扭曲变形进行矫正,并通过喵喵机打印得到完整如新的试卷。
[0198]
对比现有技术的扭曲矫正,如图6a、6b所示,文字有一些重叠,而本发明实施例则不存在这样的问题,如上述实施例1
‑
5及图7a
‑
7f的描述,本领域的技术人员易于理解,本发明采用模块化的方式,可以通过灵活地组合各种模块,来适应于不同场景,解决不同的技术问题;且相对于现有技术,本发明各模块的处理能力和效率均优于现有的方式,适应能力更强,还原效果更好。
[0199]
以上所述的具体实施例,对本发明的目的、技术方案和有益效果进行了进一步详细说明,应理解的是,本发明不与任何特定计算机、虚拟装置或者电子设备固有相关,各种通用装置也可以实现本发明。以上所述仅为本发明的具体实施例而已,并不用于限制本发明,凡在本发明的精神和原则之内,所做的任何修改、等同替换、改进等,均应包含在本发明的保护范围之内。
转载请注明原文地址:https://doc.8miu.com/read-1750080.html