本发明涉及数据处理,尤其涉及一种社交媒体内容分布式存储方法、装置及电子设备。
背景技术:
1、随着社交媒体平台的数据量急剧增加,传统的中心化存储方式已经难以满足高效、安全和可扩展的数据存储需求。现有的社交媒体数据存储方法大多集中于单一的数据中心,面临着数据安全、存取效率及扩展性等多重挑战。
2、1.数据同步和一致性问题:在分布式存储系统中,保持数据的同步和一致性是一个挑战,元数据和目标数据的分离可能导致更新操作复杂化,需要额外的机制来确保数据一致性,特别是在高并发环境下。
3、2.复杂的数据管理:分开存储元数据和目标数据虽然可以提高检索效率,但也增加了数据管理的复杂性。需要精细的策略来管理不同类型的数据,确保它们的有效关联和快速访问。
4、3.元数据的瓶颈问题:在某些实现中,元数据可以成为系统的瓶颈。如果所有的查询和操作都需要先访问元数据,当元数据存储未能高效扩展以应对大量请求时,会影响整个系统的性能。
5、4.数据恢复和容错能力:分布式存储系统需要有效的数据恢复和容错机制。在元数据和目标数据分开存储的情况下,任何一个部分的损坏都可能导致数据的不完整或不可用,恢复过程可能变得更加复杂。
6、5.安全性和隐私保护:分布式存储系统需要额外注意数据的安全性和隐私保护。元数据和目标数据的分离需要确保两者都受到同等级别的保护,防止未授权访问或数据泄露。
7、6.网络延迟和带宽问题:在分布式环境中,数据在不同节点间的传输可能受到网络延迟和带宽限制的影响,尤其是在元数据和目标数据频繁交互的场景下。
8、上述问题成为需要解决的技术问题。
技术实现思路
1、有鉴于此,本发明实施例提供一种社交媒体内容分布式存储方法、装置及电子设备,至少部分解决现有技术中存在的问题。
2、第一方面,本发明实施例提供了一种社交媒体内容分布式存储方法,包括:
3、在元数据管理层获取社交媒体内容的元数据集合y={yl,yf,ys,yi},yl表示社交媒体内容存储的位置信息,yf表示社交媒体内容的访问频率信息,ys表示社交媒体内容的缓存状态信息,yi表示社交媒体内容的索引信息;
4、对所述索引信息yi进行特征提取,形成分类向量f,以便于基于所述分类向量f和自定义的区分度函数q,对社交媒体内容在实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn};
5、在所述元数据管理层和所述实际数据存储层之间设置数据缓存层,将所述分类数据集合d={d1,d2,…dn}对应的第一特征值集合kd={kd1,kd2,…kdm}存储在所述数据缓存层中;
6、根据社交媒体内容存储的位置信息yl、社交媒体内容的访问频率信息yf以及社交媒体内容的缓存状态信息ys,对所述分类数据集合d={d1,d2,…dn}进行数据筛选操作,得到筛选数据集合d’={d’1,d’2,…d’p},p<n,将所述筛选数据集合d’={d’1,d’2,…d’p}存储在所述数据缓存层,将所述筛选数据集合d’={d’1,d’2,…d’p}对应的第二特征值集合ks={ks1,ks2,…ksq}存储在所述元数据管理层;
7、当获得针对社交媒体内容的查询请求后,基于第二特征值集合ks={ks1,ks2,…ksq}查询元数据管理层以确定查询数据是否在数据缓存层,如果查询数据存在于数据缓存层,则直接从数据缓存层提取数据,如果查询数据不在数据缓存层,则基于数据缓存层存储的第一特征值集合kd={kd1,kd2,…kdm}在实际数据存储层的分类数据集合d={d1,d2,…dn}中检索数据。
8、根据本公开实施例的一种具体实现方式,所述在元数据管理层获取社交媒体内容的元数据集合y={yl,yf,ys,yi},包括:
9、基于文件路径、数据库记录、云存储的url,确定社交媒体内容存储的具体位置信息;
10、基于预设时间段的统计信息,确定社交媒体内容的访问频率;
11、基于社交媒体内容是否已缓存、缓存位置和缓存有效时间,确定社交媒体内容的缓存状态;
12、基于社交媒体内容的关键字、标签、分类和时间戳,确定社交媒体内容的索引信息。
13、根据本公开实施例的一种具体实现方式,所述对所述索引信息yi进行特征提取,形成分类向量f,包括:
14、从元数据集合 y 中提取出索引信息yi中包括的关键词、标签数据、描述数据以及分类数据,形成索引数据;
15、基于确定的特征类型,从索引数据中提取相关特征,将提取的特征转换为数值形式,并对数值特征进行标准化或归一化;
16、将提取并编码的特征组合成一个分类向量 ,所述分类向量 f包含了所有用于分类的特征信息。
17、根据本公开实施例的一种具体实现方式,所述基于所述分类向量f和自定义的区分度函数q,对社交媒体内容在实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn},包括:
18、构建区分度函数q:
19、
20、类别元素,∈{-1,1},为分类向量元素 的区分度值,。
21、根据本公开实施例的一种具体实现方式,所述基于所述分类向量f和自定义的区分度函数q,对社交媒体内容在实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn},还包括:
22、构建针对q的求解函数:
23、
24、,
25、为第一调整参数,b为第二调整参数,c为第三调整系数,为第四调整系数,为映射函数;
26、利用求解后的区分度函数q,对实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn}。
27、根据本公开实施例的一种具体实现方式,所述利用求解后的区分度函数q,对实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn},包括:
28、遍历实际数据存储层中存储的每个数据点,应用区分度函数q计算每个数据点与当前所有分类中心的区分度;
29、将数据点分配到具有最高区分度的分类中,使得每个数据点都被分配到了一个分类中;
30、将分类结果组织成包含n个不同属性的分类数据集合d={d1,d2,…,dn}。
31、根据本公开实施例的一种具体实现方式,所述根据社交媒体内容存储的位置信息yl、社交媒体内容的访问频率信息yf以及社交媒体内容的缓存状态信息ys,对所述分类数据集合d={d1,d2,…dn}进行数据筛选操作,得到筛选数据集合d’={d’1,d’2,…d’p},包括:
32、确定需要筛选的存储区域cq、访问频率的阈值yfz以及确定缓存状态为未缓存状态shn;
33、遍历分类数据集合 d,对于集合中的每个分类 di,遍历其包含的所有社交媒体内容;
34、对于每个社交媒体内容,应用筛选条件{cq,yfz,shn},检查其位置信息、访问频率信息和缓存状态信息是否满足设定的筛选条件;
35、如果不满足筛选条件{cq,yfz,shn}中的任何一项筛选条件,则将该内容从分类di 中移除,如果满足所有筛选条件,则保留该内容在分类 di 中;
36、完成遍历和筛选后,更新每个分类 di 的内容,确保只包含符合筛选条件的数据。
37、根据本公开实施例的一种具体实现方式,所述根据社交媒体内容存储的位置信息yl、社交媒体内容的访问频率信息yf以及社交媒体内容的缓存状态信息ys,对所述分类数据集合d={d1,d2,…dn}进行数据筛选操作,得到筛选数据集合d’={d’1,d’2,…d’p},还包括:
38、重新组织分类或合并空的分类,将所有经过筛选并重新组织的分类组合成新的数据集合 d'={d'1,d'2,…,d'p},其中p是筛选后剩余的分类数量。
39、第二方面,本发明实施例提供了一种社交媒体内容分布式存储装置,包括:
40、获取模块,在元数据管理层获取社交媒体内容的元数据集合y={yl,yf,ys,yi},yl表示社交媒体内容存储的位置信息,yf表示社交媒体内容的访问频率信息,ys表示社交媒体内容的缓存状态信息,yi表示社交媒体内容的索引信息;
41、提取模块,对所述索引信息yi进行特征提取,形成分类向量f,以便于基于所述分类向量f和自定义的区分度函数q,对社交媒体内容在实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn};
42、设置模块,在所述元数据管理层和所述实际数据存储层之间设置数据缓存层,将所述分类数据集合d={d1,d2,…dn}对应的第一特征值集合kd={kd1,kd2,…kdm}存储在所述数据缓存层中;
43、筛选模块,根据社交媒体内容存储的位置信息yl、社交媒体内容的访问频率信息yf以及社交媒体内容的缓存状态信息ys,对所述分类数据集合d={d1,d2,…dn}进行数据筛选操作,得到筛选数据集合d’={d’1,d’2,…d’p},p<n,将所述筛选数据集合d’={d’1,d’2,…d’p}存储在所述数据缓存层,将所述筛选数据集合d’={d’1,d’2,…d’p}对应的第二特征值集合ks={ks1,ks2,…ksq}存储在所述元数据管理层;
44、查询模块,当获得针对社交媒体内容的查询请求后,基于第二特征值集合ks={ks1,ks2,…ksq}查询元数据管理层以确定查询数据是否在数据缓存层,如果查询数据存在于数据缓存层,则直接从数据缓存层提取数据,如果查询数据不在数据缓存层,则基于数据缓存层存储的第一特征值集合kd={kd1,kd2,…kdm}在实际数据存储层的分类数据集合d={d1,d2,…dn}中检索数据。
45、第三方面,本发明实施例还提供了一种电子设备,该电子设备包括:
46、至少一个处理器;以及,
47、与该至少一个处理器通信连接的存储器;其中,
48、该存储器存储有可被该至少一个处理器执行的指令,该指令被该至少一个处理器执行,以使该至少一个处理器能够执行前述任第一方面或第一方面的任一实现方式中的社交媒体内容分布式存储方法。
49、第四方面,本发明实施例还提供了一种非暂态计算机可读存储介质,该非暂态计算机可读存储介质存储计算机指令,该计算机指令用于使该计算机执行前述第一方面或第一方面的任一实现方式中的社交媒体内容分布式存储方法。
50、第五方面,本发明实施例还提供了一种计算机程序产品,该计算机程序产品包括存储在非暂态计算机可读存储介质上的计算程序,该计算机程序包括程序指令,当该程序指令被计算机执行时,使该计算机执行前述第一方面或第一方面的任一实现方式中的社交媒体内容分布式存储方法。
51、本发明实施例中的社交媒体内容分布式存储方案,包括:在元数据管理层获取社交媒体内容的元数据集合y={yl,yf,ys,yi},yl表示社交媒体内容存储的位置信息,yf表示社交媒体内容的访问频率信息,ys表示社交媒体内容的缓存状态信息,yi表示社交媒体内容的索引信息;对所述索引信息yi进行特征提取,形成分类向量f,以便于基于所述分类向量f和自定义的区分度函数q,对社交媒体内容在实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn};在所述元数据管理层和所述实际数据存储层之间设置数据缓存层,将所述分类数据集合d={d1,d2,…dn}对应的第一特征值集合kd={kd1,kd2,…kdm}存储在所述数据缓存层中;根据社交媒体内容存储的位置信息yl、社交媒体内容的访问频率信息yf以及社交媒体内容的缓存状态信息ys,对所述分类数据集合d={d1,d2,…dn}进行数据筛选操作,得到筛选数据集合d’={d’1,d’2,…d’p},p<n,将所述筛选数据集合d’={d’1,d’2,…d’p}存储在所述数据缓存层,将所述筛选数据集合d’={d’1,d’2,…d’p}对应的第二特征值集合ks={ks1,ks2,…ksq}存储在所述元数据管理层;当获得针对社交媒体内容的查询请求后,基于第二特征值集合ks={ks1,ks2,…ksq}查询元数据管理层以确定查询数据是否在数据缓存层,如果查询数据存在于数据缓存层,则直接从数据缓存层提取数据,如果查询数据不在数据缓存层,则基于数据缓存层存储的第一特征值集合kd={kd1,kd2,…kdm}在实际数据存储层的分类数据集合d={d1,d2,…dn}中检索数据。本发明具有如下有益效果:
52、1. 提高数据访问速度:数据缓存层存储高频访问的数据,大大减少了数据检索时间,加快了数据访问速度,提高了用户体验。
53、2. 增强系统稳定性:通过分布式存储和数据冗余,即使某些节点发生故障,系统仍能保持高可用性。负载均衡和弹性扩展进一步增强了系统的稳定性和可靠性。
54、3. 优化资源利用:数据缓存层减轻了对后端存储的直接访问压力,使存储资源得到更有效的利用。同时,根据实际负载动态调整资源,提升资源利用率。
55、4. 支持大规模数据处理:分布式架构和高效的数据访问策略使得这种方法能够支持海量社交媒体数据的存储和处理,满足大规模数据需求。
56、5. 保证数据一致性和准确性:通过有效的元数据管理和缓存一致性机制,确保用户访问的数据是最新和准确的,增强了数据的可信度。
57、6. 灵活的应用场景:这种方法适用于各种需要高效数据访问和处理的大数据场景,特别适合数据变化频繁且访问集中的社交媒体环境。
1.一种社交媒体内容分布式存储方法,其特征在于,包括:
2.根据权利要求1所述的方法,其特征在于,所述在元数据管理层获取社交媒体内容的元数据集合y={yl,yf,ys,yi},包括:
3.根据权利要求2所述的方法,其特征在于,所述对所述索引信息yi进行特征提取,形成分类向量f,包括:
4.根据权利要求3所述的方法,其特征在于,所述基于所述分类向量f和自定义的区分度函数q,对社交媒体内容在实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn},包括:
5.根据权利要求4所述的方法,其特征在于,所述基于所述分类向量f和自定义的区分度函数q,对社交媒体内容在实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn},还包括:
6.根据权利要求5所述的方法,其特征在于,所述利用求解后的区分度函数q,对实际数据存储层中存储的数据进行数据分类,形成包含n个不同属性的分类数据集合d={d1,d2,…dn},包括:
7.根据权利要求6所述的方法,其特征在于,所述根据社交媒体内容存储的位置信息yl、社交媒体内容的访问频率信息yf以及社交媒体内容的缓存状态信息ys,对所述分类数据集合d={d1,d2,…dn}进行数据筛选操作,得到筛选数据集合d’={d’1,d’2,…d’p},包括:
8.根据权利要求7所述的方法,其特征在于,所述根据社交媒体内容存储的位置信息yl、社交媒体内容的访问频率信息yf以及社交媒体内容的缓存状态信息ys,对所述分类数据集合d={d1,d2,…dn}进行数据筛选操作,得到筛选数据集合d’={d’1,d’2,…d’p},还包括:
9.一种社交媒体内容分布式存储装置,其特征在于,包括:
10.一种电子设备,其特征在于,所述电子设备包括:
