一种基于图神经网络的真值发现方法与流程

专利2022-05-10  118



1.本发明涉及一种真值发现方法,具体是一种基于图神经网络的真值发现方法,属于真值发现技术领域。


背景技术:

2.近年来,图嵌入学习已经成为处理现实世界问题的强大技术,它可以自然地整合节点信息,获得每个节点的有意义的向量表示。图嵌入或网络嵌入是数据挖掘和机器学习界日益关注的另一个课题,主要通过图神经网络(graph neural network,gnn)来实现。图嵌入旨在通过保留图的网络拓扑结构和节点内容信息,将图中顶点表示为低维向量,以便使用简单的机器学习算法(例如,支持向量机分类)进行处理。图嵌入学习的这一优势为推进真值发现带来了巨大潜力,因为真值发现中的数据可以自然地表示为source

claim图和source

source图。
3.真值发现(truth discovery,td)作为解决数据融合过程中的信息冲突问题的一种手段,在传统数据库领域已经得到了广泛的研究。真值发现主要指的是给定多个数据源提供的对于多个实体的大量具有冲突的描述信息,如何从这些冲突信息中为每一个实体找出准确的描述。国内外大多数真值发现方法主要根据源的可靠性来估计真值,目前的真值发现方法大致可以分为以下四类:迭代方法、概率图模型方法、基于优化的方法、基于深度学习的方法。
4.迭代方法:在真值发现的一般原理中,真值计算和源可靠性估计相互依赖。因此,有一些真值发现方法被设计为迭代过程,其中真值计算步骤和源权重估计步骤被迭代地进行直到收敛,其基本思想是每一个数据源都有一个可信度,直观上来说,在给出的观测值中用户更愿意相信那些可信度比较高的数据源所提供的观测值,所以数据源的可信度对观测值正确性的影响是存在的,而数据源的可信度又是根据它所提供的观测值的正确性决定的,因此数据源的可信度与观测值的正确性是相互影响的,一般利用迭代算法的思想计算数据源的可信度和观测值的正确性。伊利诺伊香槟分校xiaoxin yin等人利用数据源的可信度和观测值的正确性之间的相互影响,以及观测值之间的相互影响,提出truthfinder迭代算法(yin,x.,j.han and p.s.yu,truth discovery with multiple conflicting information providers on the web.ieee transactions on knowledge and data engineering,2008.20(6):p.796

808.);伊利诺伊香槟分校jeff pasternack等人在truthfinder工作基础上引入用户的先验知识,将通用常识推理和用户已有的知识用约束不等式表示,应用整数线性规划方法在真值发现过程中施加约束,同时提出了三个新的真值计算方法:averagelog,investment和pooledinvestment(jeff,p.and d.roth,knowing what to believe(when you already know something),in proceedings of the 23rd international conference on computational linguistics.2010:china,beijing.p.877

885.)。随后,该研究组又设计一个框架,在推断过程中引入背景知识,比如,从数据源抽取出的记录的准确度等。法国国家信息与自动化研究院alban galland等人
将观测值的真值发现的难度引入到模型中,提出了3

estimates算法,比如,正确断言一个难判断的观测值所传递的可信度要大于正确断言一个容易判断的观测值,也就是说不能仅仅因为一个数据源提供一些常识知识就单纯信任它。纽约州立大学水牛分校yaliang li等人在多个异构类型的数据源之间提出优化框架,迭代优化观测真值和数据源可信度的值。
5.中国人民大学艾静等人提出一种为deep web数据记录计算可信度的有效方法c

rank,该方法为每一条记录构造一个s

r可信度网络,利用迭代方法评价数据记录的可信度(艾静,王仲远与孟小峰,c

rank:一种deep web数据记录可信度评估方法.计算机科学与探索,2009.3(06):第585

593页.)。哈尔滨工业大学考明军等人在此基础上提出ivote和irvote两个算法,ivote采用概率投票方式迭代计算,irvote在此基础上考虑数据源权威性(考明军,张炜与高宏,冲突数据中的真值发现算法.计算机研究与发展,2010.47(0z1):第000188

192页.)。中国人民大学马如霞等人提出基于数据源分类可信性的真值发现方法,给出2种方法探测数据源分类可信性差异,采用贝叶斯方法迭代计算数据源分类可信性和属性值准确性(马如霞与孟小峰,基于数据源分类可信性的真值发现方法研究.计算机研究与发展,2015(9):第1931

1940页.)。以上方法均是在数据源独立的情况下展开的研究。
6.贝尔实验室xin luna dong等人主要考虑数据源之间的依赖关系,提出一种基于贝叶斯模型的真值发现方法。后续,该研究组针对数据源之间依赖关系又展开深入研究,比如,数据源之间拷贝的动态性问题、数据源之间传递拷贝、协同拷贝、关联拷贝等复杂拷贝问题,并开发了一个真值发现原型系统——solomon系统(dong,x.l.,et al.,solomon:seeking the truth via copying detection.proceedings of the vldb endowment,2010.3(2):p.1617

1620.)。哈尔滨工程大学张志强等人对accu算法进行了改进,考虑了同一观测值的不同表现形式,改进了选票算法(张志强等,基于数据源依赖关系的信息评价方法研究.计算机学报,2012.35(11):第2392

2402页.)。基于迭代的方法主要依赖源可信度来估计真值,在迭代求解的开始,采用统一权重初始化策略,这也导致了真值发现方法的聚合结果在一定程度上依赖于多数的现象。如今,真相发现已被应用于更困难的任务,如填补空缺,其中大多数数据源提供了不准确的信息。因此,真值发现的性能可能会受到这些任务的统一权重初始化的影响。这些缺点促使人们研究初始化数据源可靠性的新方法。
7.概率图模型方法:其基本思想是利用概率图构建数据源可信度和观测值正确性的模型,通过概率推理技术获取数据源的可信度和观测值的正确性。伊利诺伊大学香槟分校bozhao等人利用概率图建模方法,将两类错误类型(负阳性和正阴性)的产生过程建模为数据源质量的两个不同维度(敏感性和专一性),采用基于采样的推理方法获取数据源可信度和观测值正确性,该方法可用于观测值多值情况。随后,该研究组又专门针对数值型观测值,利用数值型数据特征,通过概率图模型gtm建模数据源质量、真值与观测值之间的关系。南京理工大学liyan zhang等人提出一种潜狄利克雷真值发现方法,该方法在数据源和观测值的可信度的所有可能值上定义一个随机场,根据观测值,通过最大后验准则推理出数据源和观测值的可信度。山东大学张永新等人提出一种基于马尔科夫逻辑网的两阶段数据冲突解决方法,该方法按照冲突程度对属性进行划分,第一阶段对弱冲突属性利用简单规则进行真值发现,第二阶段针对强冲突增加数据源与观测值以及数据源之间的依赖关系进行真值发现(张永新,李庆忠与彭朝晖,基于markov逻辑网的两阶段数据冲突解决方法.计算机学报,2012.35(01):第101

111页.)。此类方法的存在一个很大的缺陷是一旦模型确定
了就不可更改,不支持动态因子的添加,若要引入其他影响因子,需要重新设计新的模型。此外,模型所需参数是根据主观的先验知识选取的,无法自动选取,这在处理复杂数据时可能会有所影响。
8.基于优化的方法:基于优化的方法的基本思想是根据优化理论,依靠设置一个优化函数:
[0009][0010]
在上式中,d(
·
)为距离函数,计算的是数据源所提供的值与真实值之间的差异。此类方法可以通过迭代的方法学习源质量和观测值可信度之间的关系,共同计算两组参数,其中距离函数定义为衡量来源提供的信息与所识别的真相之间的差异。此类方法最小化目标函数后获得最终的最优解,该最优解即作为计算出的真值以及数据源的可信度,但该方法没有处理数据源间的数据复制,这在很大程度上影响了真值发现的效果。
[0011]
基于深度学习的方法是当前研究的热门方向。2017年shanshan lyu等人,2021年luyang li等人分别提出了一种新的基于表征学习和记忆神经网络的真值发现模型(li,l.,et al.,truth discovery with memory network.tsinghua science and technology,2017.22(6):p.609

618.lyu,s.,et al.,truth discovery by claim and source embedding.ieee transactions on knowledge and data engineering,2021.33(3):p.1264

1275.),其基本思想是利用神经网络可以估计或近似可能依赖于大量输入的复杂函数的特点,构建基于神经网络的真值发现模型可以准确估计可能非常复杂的源

观测值关系依赖函数。2020年,alireza heidari等人使用属性级,记录级和数据库级信号的组合为一个实体的每个观测值构造一个特征向量。使用此特征向量以及真实信息来学习数据库的每个属性的分类器。在每个阶段,都将原始特征向量的一部分与前一阶段的预测所计算出的特征相结合,构造出一个新的特征向量,从而设计了一个阶段性增量真值发现模型。
[0012]
现有方法均从各自角度,不同的影响因子进行了较好的尝试,但是还存在以下问题:(1)这些模型大多数使用实数来量化源的可靠性。但是,由实数表示的“可靠性”或“质量”通常没有任何语义,导致目前的真值发现方法准确率不高。(2)这些模型在源可靠性估计阶段考虑的因子较少,这不可避免地导致信息匮乏。实际上,源可靠性与两种交互高度相关。一个是源

观测值交互,在这种交互中不仅包含获取观测值的过程,而且还蕴含源的可靠性的潜在分布。另一个是源

源交互,其中具有强关联的源之间可能具有相似的可靠性。然而,现有方法仅从单一角度来建模源可靠性,而并没有联合上述两种交互。(3)大多数现有模型都是针对特定数据类型设计的,很少有可以同时处理异构类型数据的模型,而这种数据在现实中广泛存在,导致设计的模型应用范围受限,不便于推广。


技术实现要素:

[0013]
本发明的目的是提供一种基于图神经网络的真值发现方法,能够同时聚合源

观测值交互和源

源交互中的潜在因子,为真值发现提供更充分的证据,可以处理分类型数据在多源信息融合时的数据冲突问题,还可以有效解决连续型数据的真值发现问题,进一步提高真值发现方法的准确率。
[0014]
为了实现上述目的,本发明提供一种基于图神经网络的真值发现方法,包括以下步骤:
[0015]
步骤1:源可靠性建模
[0016]
步骤1

1:引入源可靠性建模的第一种交互:源

观测值交互source

claim interaction:g
sc
=(s∪c,ge
sc
),也称为claim

space,式中,s表示源的集合,c表示观测值集合,ge
sc
表示源和观测值之间的边,并定义源s
i
提供的观测值c
j
的源感知得分r
ij
作为边上权值;
[0017]
步骤1

2:将所有源、观测值和源感知得分嵌入,得到它们的向量表示;
[0018]
步骤1

3:将源

观测值交互中的每一个交互向量化;
[0019]
步骤1

4:引入变量观测值注意力α
ia
,其中α
ia
表示在源s
i
的观测值集合中的c
a
对源s
i
在claim

space潜在因子的注意力权值,设置注意力网络来参数化α
ia
,在实现过程中使用两层神经网络来获取,可靠性感知交互表示x
ia
和目标源s
i
的嵌入p
i
被作为网络的输入;
[0020]
步骤1

5:计算源s
i
在源

观测值交互中的潜在因子
[0021]
步骤1

6:引入源可靠性建模的第二种交互:源

源交互source

source interaction:g
ss
=(s,ge
ss
),也称为source

space,式中,s表示源的集合,ge
ss
表示源和源之间的边,并定义源s
i
与源s
j
之间的相似度sim
ij

[0022]
步骤1

7:引入变量源注意力β
io
,其中β
io
表示在源s
i
的相似源集合中的s
o
对源s
i
在源

源交互中的潜在因子的注意力权值;
[0023]
步骤1

8:计算源s
i
在源

源交互中的潜在因子
[0024]
步骤1

9:图神经网络模型聚合步骤1

5和步骤1

8两种交互中的潜在因子,学习源的可靠性嵌入h
i

[0025]
步骤2:观测值可信度建模
[0026]
步骤2

1:根据学习到的源的可靠性嵌入来表示观测值的可信度嵌入;
[0027]
步骤3:真值推断
[0028]
步骤3

1:将步骤2

1得到的所有观测值的可信度嵌入按照训练集:测试集=1:9比例划分,然后结合训练集中的观测值的标签,使用机器学习库scikit

learn中的梯度提升决策树gradient boosting decision tree(gbdt)分类器,训练分类模型td分类器td

classifier;
[0029]
步骤3

2:推断未知真值的每一个条目的真值,使用已经学习到的td分类器计算并输出每一个观测值为真的概率值,最后取条目entry的互斥观测值集合中为真概率最大的观测值作为此条目entry的真值输出。
[0030]
进一步,所述步骤1

1中如果一个源s
i
提供了一个观测值c
j
,则定义观测值c
j
的源感知得分r
ij
作为权值,否则为0,其中r
ij
的定义如下:
[0031][0032]
式中:为提供观测值c
j
的源的集合;
[0033]
为提供观测值c
i
的源的集合;
[0034]
为条目e
i
的所有互斥观测值集合。
[0035]
进一步,所述步骤1

2中源s
i
的嵌入向量表示为p
i
,对于源s
i
提供的一个观测值c
a
,得到观测值的嵌入向量q
a
,源感知得分r
ia
的嵌入向量表示为u
r
,其中对应的嵌入向量p
i
,q
a
和u
r
的维度相同,都设置为d。
[0036]
进一步,所述步骤1

3中每一个交互向量化,源s
i
与观测值c
a
之间的交互嵌入x
ia
公式如下:
[0037][0038]
式中:g
c
为多层感知器;
[0039]
为将两个向量拼接。
[0040]
进一步,所述步骤步骤1

5中源s
i
在源

观测值交互中的潜在因子公式如下:
[0041][0042]
式中:w为神经网络的权重;
[0043]
b为神经网络的偏置;
[0044]
σ为非线性激活函数rectified linear unit(relu)。
[0045]
进一步,所述步骤1

6中的相似度sim
ij
大于设定的阈值θ,则它们之间的权重被设置为1,否则为0,相似度sim
ij
计算公式如下:
[0046][0047]
式中:为源s
i
提供的观测值集合;
[0048]
为源s
j
提供的观测值集合。
[0049]
进一步,所述步骤1

7中β
io
的计算公式如下:
[0050][0051][0052]
式中:为未经过softmax函数处理的相似源s
o
对源s
i
的注意力权值;
[0053]
为第二层隐藏层的权重。
[0054]
进一步,所述步骤1

8中源s
i
在源

源交互中的潜在因子公式如下:
[0055][0056]
式中:为源s
i
的相似源集合;
[0057]
为源s
i
的相似源s
o
在源

观测值交互中的潜在因子。
[0058]
进一步,所述步骤1

9中通过多层感知器将源

观测值交互与源

源交互中的潜在
因子集成到一起的策略,具体地,源

观测值交互中的源s
i
的潜在因子和源

源交互中的潜在因子被拼接在一起作为多层感知器的输入,正式的将源s
i
的潜在因子定义如下:
[0059][0060]
c2=σ(w2·
c1 b2)
[0061]
...
[0062]
h
i
=σ(w
l
·
c
l
‑1 b
l
)
[0063]
式中:c1为两种交互中的潜在因子的连接向量,作为网络的输出,同时也作为第二层的输入;c2为第二层的输出,同时也作为下一层的输入,以此类推;
[0064]
l为隐藏层的索引;
[0065]
训练图神经网络模型,将设计的模型应用于学习源可靠性的嵌入的任务,使用源的可靠性嵌入h
i
,将其送入多层感知器以进行优化:
[0066]
g1=[h
i
]
[0067]
g2=σ(w2·
g1 b2)
[0068]
...
[0069]
g
l
=σ(w
l
·
g
l
‑1 b
l
)
[0070]
r

ij
=w
t
·
g
l
[0071]
式中:g1为源的可靠性嵌入,也作为第二层的输入;
[0072]
g2为第二层的输出,也作为下一层是输入,以此类推;
[0073]
l为隐藏层的索引;
[0074]
r

ij
为预测的源s
i
提供的观测值c
j
的源感知得分;
[0075]
w2…
w
l
分别为每一层的权值矩阵;
[0076]
b2…
b
l
分别为每一层的偏置;
[0077]
w
t
为输出层的权值矩阵的转置表示。
[0078]
为了训练模型参数,需要为优化过程分配损失函数,与传统方法不同,选择大多数或中位数作为优化的真实值,通过预测观测值的源感知评分来优化,定义损失函数,如下所示:
[0079][0080]
式中:|o|为观测到的源感知得分的数量。
[0081]
进一步,步骤2

1中对于任意一个条目entry e
i
,在其互斥观测值集合中的一个观测值c
j
,构造观测值c
j
的可信度嵌入z
j
为:
[0082][0083]
与现有技术相比,本发明包括三个阶段,即源可靠性建模、观测值可信度建模和真值推断,首先构建了一个包含源

观测值交互(又称claim

space)和源

源交互(又称source

space)的图神经网络模型来学习源的可靠性嵌入;其次,用一个基于平均值的聚合器聚合相关源的嵌入来获取观测值的可信度嵌入;最后使用这些观测值的嵌入和地面真值
来学习分类器,以估计出具有最高概率的观测值作为真值,本发明能够同时聚合源

观测值交互和源

源交互中的潜在因子,以学习源和观测值的嵌入,同时在模型中引入注意力机制,以学习语义上更丰富的嵌入,为真值发现提供更充分的证据,可以处理分类型数据在多源信息融合时的数据冲突问题,还可以有效解决连续型数据的真值发现问题,扩展了真值发现的应用范围,具有较高的准确率,保证大数据的准确性,进一步提升数据质量;本发明利用比实数表示有更好的表示能力的图表示学习,来表示来源的可靠性和观测值的可信度,增加了更多的语义信息。
[0084]
本发明的真值发方法能够自动识别、判断、推理出真值或接近真值的数据,从而辅助用户,企业和政府决策,提高决策效率和质量;除此之外,本发明可以应用于现实世界的很多应用,如数据融合系统、知识库的建设、人群感知以及医疗领域等,对进一步发展数据科学、完善数据管理、提高数据质量有重要作用。
附图说明
[0085]
图1是本发明的原理框图;
[0086]
图2为本发明的关键技术图。
具体实施方式
[0087]
下面结合附图对本发明作进一步说明。
[0088]
如图1和图2所示,一种基于图神经网络的真值发现方法,包括以下步骤:
[0089]
步骤1:源可靠性建模
[0090]
步骤1

1:引入源可靠性建模的第一种交互:源

观测值交互:g
sc
=(s∪c,ge
sc
),也称为claim

space,式中,s表示源的集合,c表示观测值集合,ge
sc
表示源和观测值之间的边,并定义源s
i
提供的观测值c
j
的源感知得分r
ij
作为权值;s
i
为第i个源,c
j
为第j个观测值;
[0091]
步骤1

2:将所有源、观测值和源感知得分嵌入,得到它们的向量表示;
[0092]
步骤1

3:将源

观测值交互中的每一个交互向量化;
[0093]
步骤1

4:引入变量观测值注意力α
ia
,其中α
ia
表示在源s
i
的观测值集合中的c
a
对源s
i
在claim

space潜在因子的注意力权值,设置注意力网络来参数化α
ia
,在实现过程中使用两层神经网络来获得注意力,可靠性感知表示x
ia
和目标源s
i
的嵌入p
i
被作为网络的输入;
[0094]
步骤1

5:计算源s
i
在源

观测值交互中的潜在因子
[0095]
步骤1

6:引入源可靠性建模的第二种交互:源

源交互:g
ss
=(s,ge
ss
),也称为source

space,式中,s表示源的集合,ge
ss
表示源和源之间的边,并定义源s
i
与源s
j
之间的相似度sim
ij

[0096]
步骤1

7:引入变量源注意力β
io
,其中β
io
表示在源s
i
的相似源集合中的s
o
对源s
i
在源

源交互中的潜在因子的注意力权值;
[0097]
步骤1

8:计算源s
i
在源

源交互中的潜在因子
[0098]
步骤1

9:图神经网络模型聚合步骤1

5和步骤1

8两种交互中的潜在因子,学习源的可靠性嵌入h
i

[0099]
步骤2:观测值可信度建模
[0100]
步骤2

1:根据学习到的源的可靠性嵌入来表示观测值的可信度嵌入;
[0101]
步骤3:真值推断
[0102]
步骤3

1:将步骤2

1得到的所有观测值的可信度嵌入按照训练集:测试集=1:9的比例划分,然后结合训练集中的观测值的标签,使用机器学习库scikit

learn中的梯度提升决策树gradient boosting decision tree(gbdt)分类器,训练分类模型td分类器td

classifier;
[0103]
步骤3

2:推断未知晓真值的每一个条目entry的真值,使用学习到的td分类器td

classifier计算并输出每一个观测值为真的概率值,最后取条目entry的互斥观测值集合中为真概率最大的观测值作为此条目entry的真值输出。
[0104]
所述步骤1

1中如果一个源s
i
提供了一个观测值c
j
,则定义观测值c
j
的源感知得分r
ij
作为权值,否则为0,其中r
ij
的定义如下:
[0105][0106]
式中:为提供观测值c
j
的源的集合;
[0107]
为提供观测值c
i
的源的集合;
[0108]
为条目e
i
的所有互斥观测值集合。
[0109]
所述步骤1

2中源s
i
的嵌入向量表示为p
i
,对于源s
i
提供的一个观测值c
a
,得到观测值的嵌入向量q
a
,源感知得分r
ia
的嵌入向量表示为u
r
,其中对应的嵌入向量p
i
,q
a
和u
r
的维度相同,都设置为d。
[0110]
所述步骤1

3中每一个交互向量化,源s
i
与观测值c
a
之间的交互嵌入x
ia
公式如下:
[0111][0112]
式中:g
c
为多层感知器;
[0113]
为将两个向量拼接。
[0114]
所述步骤1

5中源s
i
在源

观测值交互中的潜在因子公式如下:
[0115][0116]
式中:w为神经网络的权重;
[0117]
b为神经网络的偏置;
[0118]
σ为非线性激活函数rectified linear unit(relu)。
[0119]
所述步骤1

6中的相似度sim
ij
大于设定的阈值θ,则它们之间的权重被设置为1,否则为0,相似度sim
ij
计算公式如下:
[0120][0121]
式中:为源s
i
提供的观测值集合;
[0122]
为源s
j
提供的观测值集合。
[0123]
所述步骤1

7中β
io
的计算公式如下:
[0124][0125][0126]
式中:为未经过softmax函数处理的相似源s
o
对源s
i
的注意力权值;
[0127]
为第二层隐藏层的权重。
[0128]
所述步骤1

8中源s
i
在源

源交互中的潜在因子公式如下:
[0129][0130]
式中:为源s
i
的相似源集合;
[0131]
为源s
i
的相似源s
o
在源

观测值交互中的潜在因子。
[0132]
所述步骤1

9中通过多层感知器将源

观测值交互与源

源交互中的潜在因子集成到一起的策略,具体地,源

观测值交互中的源s
i
的潜在因子和源

源交互中的潜在因子被拼接在一起作为多层感知器的输入,正式的将源s
i
的潜在因子定义如下:
[0133][0134]
c2=σ(w2·
c1 b2)
[0135]
...
[0136]
h
i
=σ(w
l
·
c
l
‑1 b
l
)
[0137]
式中:c1为两种交互中的潜在因子的连接向量,作为网络的输出,同时也作为第二层的输入;
[0138]
c2为第二层的输出,同时也作为下一层的输入,以此类推;
[0139]
l为隐藏层的索引;
[0140]
训练图神经网络模型,将设计的模型应用于学习源可靠性的嵌入的任务,使用源的可靠性嵌入h
i
,将其送入多层感知器以进行优化:
[0141]
g1=[h
i
]
[0142]
g2=σ(w2·
g1 b2)
[0143]
...
[0144]
g
l
=σ(w
l
·
g
l
‑1 b
l
)
[0145]
r

ij
=w
t
·
g
l
[0146]
式中:g1为源的可靠性嵌入,是网络的输入层,也作为第二层的输入;
[0147]
g2为第二层的输出,也作为下一层是输入,以此类推;
[0148]
l为隐藏层的索引;
[0149]
r

ij
为预测的源s
i
提供的观测值c
j
的源感知得分;
[0150]
w2…
w
l
分别为每一层的权值矩阵;
[0151]
b2…
b
l
分别为每一层的偏置;
[0152]
w
t
为输出层的权值矩阵的转置表示。
[0153]
为了训练模型参数,需要为优化过程分配损失函数,与传统方法不同,选择大多数或中位数作为优化的真实值,本发明通过预测观测值的源感知评分来优化,定义损失函数,如下所示:
[0154][0155]
式中:|o|为观测到的源感知得分的数量。
[0156]
所述步骤2

1中对于任意一个条目e
i
,e
i
为第i个条目,在其互斥观测值集合中的一个观测值c
j
,构造观测值c
j
的可信度嵌入z
j
为:
[0157][0158]
数据集:
[0159]
(1)股票数据集(http://www.lunadong.com/fusiondatasets.htm)。它包含了21个工作日内从55个网站收集的1000支股票的16个属性的数据。在实验中,属性volume、share outstanding和market cap被视为连续类型,而其他属性被用作分类类型。
[0160]
(2)航班数据集(http://www.lunadong.com/fusiondatasets.htm)。它包含了1200个航班的数据,有6个属性,从38个网站收集,为期一个月。在实验中,预定起飞时间、实际起飞时间、预定到达时间和实际到达时间属性被视为连续类型,而登机口和到达口被作为分类类型。
[0161]
(3)天气数据集(y.li,q.li,j.gao,l.su,b.zhao,w.fan,and j.han,"conflicts to harmony:a framework for resolving conflicts in heterogeneous data by truth discovery,"ieee t.knowl.data en.,28,pp.1986

1999,2016)。这个数据集包含美国20个城市一个月内的每日天气信息,它包含三个属性,高温和低温属性被视为连续类型,天气状况被视为分类类型。
[0162]
实验结果:
[0163]
分类型数据指标:错误率(error rate)
[0164]
连续型数据指标:平均归一化绝对距离(mean normalized absolute distance)mnad
[0165][0166][0167]
本发明可以应用于现实世界的很多应用,如数据融合系统、知识库的建设、人群感知以及医疗领域等,对进一步发展数据科学、完善数据管理、提高数据质量有重要作用。
转载请注明原文地址:https://doc.8miu.com/read-1750287.html

最新回复(0)