本公开涉及计算机,具体而言,涉及数据拆分方法、计算机设备及计算机存储介质。
背景技术:
1、在二代核酸测序的过程中,为了提高测序速度,降低测序成本,一般会将多种样本的核酸样本一同上机进行测序,这里,多种样本的核酸样本是指多种文库制备的核酸样本。标签序列为用于标识不同样本的序列,由于不同文库的核酸样本在制备时,核酸样本中所包含的标签序列的长度、数量可能都不相同,因此在混合样本的测序过程中,如何进行数据拆分显得尤为重要。
技术实现思路
1、本公开实施例至少提供一种数据拆分方法、计算机设备及存储介质。
2、第一方面,本公开实施例提供了一种数据拆分方法,应用于混合样本数据,所述混合样本数据包括来源于多个样本的多个样本测序数据,所述多个样本中的任一样本包括标签序列和核酸序列,所述标签序列用于指示样本来源,所述多个样本中的标签序列的序列长度不完全相同,针对所述多个样本测序数据中的任一样本测序数据,所述数据拆分方法包括:
3、获取所述样本测序数据,所述样本测序数据包括标签序列的测序数据和核酸序列的测序数据;
4、将所述标签序列的测序数据按照至少一个序列长度从所述样本测序数据中切分出来,得到所述标签序列的至少一个测序数据;其中,所述至少一个序列长度涵盖所述多个样本中的至少部分标签序列的序列长度;
5、将所述标签序列的至少一个测序数据分别与参考标签序列进行匹配,并根据匹配结果确定所述样本测序数据的样本来源;
6、根据识别出的样本来源将来源于同种生物样本的至少一个样本测序数据从所述多个样本测序数据中进行拆分。
7、一种可能的实施方式中,所述将所述标签序列的至少一个测序数据分别与参考标签序列进行匹配,并根据匹配结果确定所述样本测序数据的样本来源,包括:
8、对所述标签序列的至少一个测序数据分别进行编码,转化为预先建立的哈希表中的键,得到至少一待处理键;
9、将所述至少一个待处理键在所述预先建立的哈希表中进行查询;
10、如果从所述预先建立的哈希表中查询到与所述至少一个待处理键中的任一个待处理键匹配的键,根据所述预先建立的哈希表的映射关系获得映射值,并根据映射值确定所述样本测序数据的样本来源;
11、其中,所述预先建立的哈希表中的键为参考标签序列的编码数据,值为指示样本来源的编号。
12、一种可能的实施方式中,还包括:
13、如果从所述预先建立的哈希表中未查询到与所述至少一个待处理键中的任一个待处理键匹配的键,确定所述样本测序数据的样本来源为未知样本。
14、一种可能的实施方式中,所述预先建立的哈希表中的键还包括参考标签序列的容错标签序列的编码数据;
15、所述容错标签序列为将所述参考标签序列中的至多预设数量个碱基位置的碱基分别替换为,除该碱基位置当前对应的碱基类型外的其他碱基类型,得到所述参考标签序列的容错标签序列,其中,所述预设数量为碱基容错值。
16、一种可能的实施方式中,所述对所述标签序列的至少一个测序数据分别进行编码,转化为预先建立的哈希表中的键,得到至少一待处理键,包括:
17、确定各碱基的出现频次,并基于所述出现频次,确定各碱基分别对应编码值;
18、基于各碱基分别对应的编码值对所述标签序列的至少一个测序数据分别进行编码,得到至少一个待处理键。
19、一种可能的实施方式中,所述将所述至少一个待处理键在所述预先建立的哈希表中进行查询,包括:
20、基于所述至少一个待处理键在各序列长度分别对应的哈希表中查询;其中,同一哈希表中键对应的参考标签序列的序列长度相同。
21、一种可能的实施方式中,所述基于所述至少一个待处理键在各序列长度分别对应的哈希表中查询,包括:
22、建立k个线程,并基于各个线程和所述至少一个待处理键,并行查询对应的哈希表;其中,k为所述哈希表的个数;或者,
23、确定各个哈希表中所包含的键的个数,并基于所述键的个数确定各个哈希表的查找顺序,按照所述查找顺序,依次基于所述至少一个待处理键查询各个哈希表。
24、第二方面,本公开实施例还提供一种计算机设备,包括:处理器、存储器和总线,所述存储器存储有所述处理器可执行的机器可读指令,当计算机设备运行时,所述处理器与所述存储器之间通过总线通信,所述机器可读指令被所述处理器执行时执行上述第一方面,或第一方面中任一种可能的实施方式中的步骤。
25、一种可能的实施方式中,所述计算机设备为核酸测序仪机载的计算机设备,或者为与核酸测序仪进行无线通信的计算机设备。
26、第三方面,本公开实施例还提供一种计算机可读存储介质,该计算机可读存储介质上存储有计算机程序,该计算机程序被处理器运行时执行上述第一方面,或第一方面中任一种可能的实施方式中的步骤。
27、为使本公开的上述目的、特征和优点能更明显易懂,下文特举较佳实施例,并配合所附附图,作详细说明如下。
1.一种数据拆分方法,其特征在于,应用于混合样本数据,所述混合样本数据包括来源于多个样本的多个样本测序数据,所述多个样本中的任一样本包括标签序列和核酸序列,所述标签序列用于指示样本来源,所述多个样本中的标签序列的序列长度不完全相同,针对所述多个样本测序数据中的任一样本测序数据,所述数据拆分方法包括:
2.根据权利要求1所述的方法,其特征在于,所述将所述标签序列的至少一个测序数据分别与参考标签序列进行匹配,并根据匹配结果确定所述样本测序数据的样本来源,包括:
3.根据权利要求2所述的方法,其特征在于,还包括:
4.根据权利要求2所述的方法,其特征在于,所述预先建立的哈希表中的键还包括参考标签序列的容错标签序列的编码数据;
5.根据权利要求2或4所述的方法,其特征在于,所述对所述标签序列的至少一个测序数据分别进行编码,转化为预先建立的哈希表中的键,得到至少一待处理键,包括:
6.根据权利要求2或4所述的方法,其特征在于,所述将所述至少一个待处理键在所述预先建立的哈希表中进行查询,包括:
7.根据权利要求6所述的方法,其特征在于,所述基于所述至少一个待处理键在各序列长度分别对应的哈希表中查询,包括:
8.一种计算机设备,其特征在于,包括:处理器、存储器和总线,所述存储器存储有所述处理器可执行的机器可读指令,当计算机设备运行时,所述处理器与所述存储器之间通过总线通信,所述机器可读指令被所述处理器执行时执行如权利要求1至7任一项所述的数据拆分方法的步骤。
9.根据权利要求8所述的计算机设备,其特征在于,所述计算机设备为核酸测序仪机载的计算机设备,或者为与核酸测序仪进行无线通信的计算机设备。
10.一种计算机可读存储介质,其特征在于,该计算机可读存储介质上存储有计算机程序,该计算机程序被处理器运行时执行如权利要求1至7任一项所述的数据拆分方法的步骤。
