本发明涉及数据分析领域,尤其涉及一种基于特征交融网络的ncrna-药物耐药性关联预测方法。
背景技术:
1、非编码rna(non-coding rna,ncrna)在细胞发育、分化和衰老的过程中发挥着特殊的作用,ncrna广泛地参与了人类的病理活动,作为一种生物标志物,ncrna也为癌症等疾病的治疗提供了新的靶点。一些常见的ncrna,如microrna(mirna)、环状rna(circularrna,circrna)和长链ncrna(long non-coding rna,lncrna),激发了相关领域研究人员的极大兴趣。近年来的多项研究强调了ncrna在通过调节各种分子途径诱导药物耐药性方面扮演的重要角色。例如,在非小细胞肺癌(non-small cell lung cancer,nsclc)中,已经证明了circrna“cdr1as/mir-641/hoxa9”途径是顺铂耐药的关键因素,该途径通过调节干细胞特性,从而增强nsclc细胞对顺铂治疗的耐药性。在膀胱癌中,circrna“circrna_103809”已被确认通过激活“mir-516a-5p/fbxl18”调节轴(指在生物学或分子生物学中,涉及多个分子或因子相互作用的一条信号传导通路,用于调节特定细胞过程、生物学功能或生理现象)加速癌症进展并促进化疗耐药性,这一调节轴在调控膀胱癌细胞对化疗药物的耐药性方面发挥着关键作用。此外,在结直肠癌(colorectal cancer)细胞中,hotair的高表达与化疗药物的耐药性相关。hotair可能通过与某些化疗药物的靶标基因结合,影响这些基因的表达,这会导致药物靶标的表达下调,从而影响药物对结直肠癌细胞的作用,如参与细胞生存和增殖有关的信号通路wnt/β-catenin和mapk/erk,来促进癌细胞的生存和增殖。这些发现揭示了ncrna如何影响药物耐药性的复杂机制,并为开发有针对性的治疗策略提供了宝贵的见解。
2、现有基于机器学习和深度学习的ncrna-药物耐药性关联预测算法的处理步骤一般是:①从ncrna的基因表达谱中提取ncrna特征;②从药物的分子指纹中提取药物特征;③利用ncrna特征和药物特征重构ncrna-药物耐药性关联矩阵。尽管ncrna基因表达谱和药物子结构是ncrna-药物耐药性关联预测的关键元素,但ncrna与药物耐药性之间的紧密相关性强调了ncrna在特定疾病细胞耐药性中的关键调控作用,这种相关性表明,ncrna不仅是细胞出现耐药性的标志之一,还可能积极介入细胞耐药性的发展和维持过程,进而显著影响了药物针对特定疾病的治疗效果。因此,在考虑ncrna和药物的特征时,还应该充分考虑与ncrna和药物相关的疾病特征,这将有助于更全面地理解耐药性的机制;然而,现有的方法在建模时主要关注了ncrna和药物这两个元素,未能在模型中充分纳入疾病信息,这将限制模型的预测性能,因此,需要进一步探索如何将疾病信息融入预测模型中,以提高其准确性和适用性;此外,考虑更多关于ncrna和药物的特征,例如药物的理化物质,也是提高模型性能的重要因素之一,因为这些特征可以提供有关药物与ncrna相互作用的更多新兴,有助于更准确地预测药物耐药性。
3、现有研究表明,ncrna可以通过调节药物代谢途径、药物靶点的表达以及细胞信号传导途径等方式影响药物的效果,这意味着ncrna、药物和药物耐药性之间存在紧密的联系,但现有的方法在建模时并未体现药物、ncrna和药物耐药性三者特征之间的关联。此外,ncrna基因表达谱、ncrna-疾病关联信息以及疾病-药物耐药性关联信息存在明显的信息缺失问题。然而,现有的方法在建模时,要么没有考虑到这一问题,要么仅仅采用简单的平均和填充策略。这样的做法严重影响了模型预测的准确性和可信度。因此,为了确保模型在引入外部知识后能够更具鲁棒性和可靠性,进而更好地理解ncrna、疾病和药物之间的复杂关系以为药物耐药性预测提供更精确的指导,需要同时考虑信息缺失和信息融合这两个问题。
技术实现思路
1、本发明的目的在于克服现有技术的缺点,提供了一种基于特征交融网络的ncrna-药物耐药性关联预测方法,解决了现有技术存在的问题。
2、本发明的目的通过以下技术方案来实现:一种基于特征交融网络的ncrna-药物耐药性关联预测方法,所述预测方法包括:
3、步骤一、构造ncrna序列相似度矩阵、疾病语义相似度矩阵和药物整合相似度矩阵;
4、步骤二、基于ncrna-疾病关联信息、疾病-药物耐药性关联信息和ncrna-药物耐药性关联信息为ncrna、疾病和药物构造gip相似度矩阵,并通过邻域约束矩阵迭代融合补全算法构造ncrna相似度融合矩阵、疾病相似度融合矩阵和药物相似度融合矩阵;
5、步骤三、通过特征交融网络分别对ncrna与疾病特征、药物与疾病的特征进行交融,并利用预测网络结合多阶段训练策略对ncrna-药物耐药性关联进行预测。
6、所述步骤一包括以下内容:
7、ncrna序列相似度矩阵构造步骤:计算ncrna的k-mer特征向量,基于k-mer特征向量计算不同ncrna之间的spearman相似度,以此构造ncrna序列相似度矩阵;
8、疾病语义相似度矩阵构造步骤:利用从disease ontology数据库获取的疾病关联信息构造有向无环图,通过疾病节点之间的语义贡献计算疾病节点的语义值,根据疾病节点的语义贡献和语义值计算不同疾病之间的语义相似度,以此构造疾病语义相似度矩阵;
9、药物整合相似度矩阵构造步骤:基于药物smiles提取得到药物的macc分子指纹,采用tanimoto相似性度量方法计算药物macc分子指纹之间的相似度,以此构造药物结构相似度矩阵;将药物理化性质的所有数据值归一化,得到药物分子的理化性质对应的特征向量,通过计算不同药物分子属性向量之间的余弦相似度,得到不同药物分子之间的理化性质相似度,以此构造药物理化性质相似度矩阵;对药物结构相似度矩阵和药物理化性质相似度矩阵进行融合得到药物整合相似度矩阵。
10、所述通过特征交融网络分别对ncrna和疾病的特征、药物与疾病的特征进行交融包括以下内容:
11、对输入特征交融网络的特征向量进行嵌入操作,得到嵌入向量;
12、使用多层感知机从嵌入向量中提取特征,构造堆叠特征;
13、基于自注意力权重矩阵分别对ncrna和疾病堆叠特征、药物与疾病堆叠特征进行融合,得到融合堆叠特征。
14、所述利用预测网络结合多阶段训练策略对ncrna-药物耐药性关联进行预测包括以下内容:
15、预测ncrna和疾病之间的关联关系:将ncrna和疾病融合堆叠特征输入预测网络实现对ncrna-疾病关联矩阵的重构;
16、预测疾病和药物耐药性之间的关联关系:将疾病和药物融合堆叠特征输入预测网络实现对疾病-药物关联矩阵的重构;;
17、预测ncrna-药物耐药性关联关系:基于ncrna和药物的堆叠特征和融合特征,进行ncrna-药物耐药性关联预测。
18、所述ncrna序列相似度矩阵构造步骤包括以下内容:
19、设分割序列得到的片段长度为k;
20、生成所有ncrna序列对应的k-mer全集,提取互异k-mer片段加入到k-mer全集中,k-mer全集中包括k种k-mer;
21、统计k-mer全集中不同k-mer在所有ncrna中出现次数的总和,将第i种k-mer的出现次数记为ni,i=1,2,...,k;
22、对于第i个ncrna其k-mer特征为一个k维向量,通过公式计算该向量的每一个维度对应一种k-mer在第i个ncrna中出现的频率,得到第i个ncrna的k-mer特征向量为kmsi=[frequency(i,1),frequency(i,2),...,frequency(i,k)],其中,frequency(i,j)表示第i个ncrna中第j种k-mer的出现频率,表示第i种ncrna的第j种k-mer的出现次数;k为k-mer总数;
23、通过公式计算不同ncrna之间的spearman相似度,其中,kmsi(k)代表第i个ncrna的k-mer特征向量的第k个元素,rssij代表第i个ncrna和第j个ncrna之间的序列相似度,nr为ncrna总数。
24、所述疾病语义相似度矩阵构造步骤包括以下内容:
25、获取每种疾病在disease ontology数据库中的id,对于第i种疾病di,定义其对应的有向无环图为其中,代表由疾病di和它的祖先节点共同组成的节点集,代表从父节点到子节点的直接链路构成的边集;
26、将中某一个疾病x对疾病di的语义贡献表示为其中,δ为语义贡献衰减权重;
27、将疾病di对自身的贡献值设置为1,将语义贡献衰减权重δ设置为0.5,得到疾病di的语义值因此,第i种疾病di和第j种疾病dj之间的语义相似度为
28、所述药物整合相似度矩阵构造步骤包括以下内容:
29、将药物分子的smiles转换为macc分子指纹,设药物macc分子指纹的维数为nmacc,采用tanimoto相似性度量方法计算macc分子图谱之间的相似度矩阵为其中,mi代表第i种药物的macc分子指纹向量,mi,k代表向量mi中的第k个元素的值,mss(mi,mj)代表第i种药物mi和第j种药物mj之间的结构相似度;
30、从deepchem数据集中收集药物分子的实验水溶性数据、水中水合自由能数据、亲脂性数据和药物靶亲和力数据,将所有的数据值归一化到[0,1],得到第i个药物分子mi的理化性质向量属性向量为ai,计算不同药物分子属性向量之间的余弦相似度,得到不同药物分子之间的理化性质相似度,以此构造药物理化性质相似度矩阵其中,mas(mi,mj)代表第i种药物mi和第j种药物mj之间的理化性质相似度,||||代表求向量的模;
31、对药物结构相似度矩阵mss和药物理化性质相似度矩阵mas进行加权融合,得到药物整合相似度矩阵其中,α为相似度矩阵融合权重。
32、所述步骤二包括以下内容:
33、构建ncrna的gip相似度矩阵:
34、从noncorna数据库中获取ncrna-疾病、ncrna-药物耐药性以及疾病-药物耐药性之间的关联信息,如果确定第i种ncrna ri和第j种药物mj之间存在耐药相关性,则ncrna-药物耐药性关联矩阵rr-m中的第i行、第j列元素置为1,否则置为0,同理得到ncrna-疾病关联矩阵rr-d和疾病-药物耐药性关联矩阵rd-m;
35、分别针对ncrna-疾病关联矩阵rr-d和ncrna-药物耐药性关联矩阵rr-m中的第i行提取二元相互作用轮廓向量ipr-d(ri)和ipr-m(ri),并通过公式和计算第i个ncrna ri和第j个ncrna rj之间的gip相似度,其中,rgkr-d(ri,rj)表示基于疾病相关度的第i个ncrna ri和第j个ncrna rj之间的gip相似度,rgkr-m(ri,rj)表示基于药物耐药性相关度的第i个ncrna ri和第j个ncrna rj之间的gip相似度,||||2代表求向量l2范数的平方,ρr-d为基于ncrna-疾病的内核带宽参数,ρr-m为基于ncrna-药物耐药性的内核带宽参数;
36、构建疾病的gip相似度矩阵:
37、分别针对疾病-ncrna关联矩阵和疾病-药物耐药性关联矩阵中rd-m中的第i行提取二元相互作用轮廓向量ipd-r(di)和ipd-m(di),并通过公式和计算第i个疾病di和第j个疾病dj之间的gip相似度,其中,dgkd-r(di,dj)表示基于ncrna相关度的第i个疾病di和第j个疾病dj之间的gip相似度,dgkd-m(di,dj)表示基于药物耐药性相关度的第i个疾病di和第j个疾病dj之间的gip相似度,ρd-r为基于疾病-ncrna的内核带宽参数,ρd-m为基于疾病-药物耐药性的内核带宽参数;
38、构建药物的gip相似度矩阵:
39、针对药物耐药性-ncrna关联矩阵和药物耐药性-疾病关联矩阵中中的第i行提取二元相互作用轮廓向量ipm-r(mi)和ipm-d(mi),并通过公式和计算第i种药物mi和第j种药物mj之间的gip相似度,其中,mgkm-r(mi,mj)表示基于ncrna相关度的第i种药物mi和第j种药物mj之间的gip相似度,mgkm-d(mi,mj)表示基于疾病相关度的第i种药物mi和第j种药物mj之间的gip相似度,ρm-r为基于药物耐药性-ncrna的内核带宽参数,ρm-d为基于药物耐药性-疾病的内核带宽参数;
40、矩阵融合:
41、分别对rss、rgkr-d、rgkr-m以及dss、dgkd-r、dgkd-m还有mis、mgkm-r、mgkm-d进行矩阵融合,得到归一化核prss、和其中,rss表示ncrna序列相似度矩阵;
42、创建rss、rgkr-d、rgkr-m对应的邻域约束核srss、和并与归一化核prss、和进行融合,分别得到对应的相似度核,对相似度核进行融合最终得到ncrna相似度融合矩阵r,同理得到疾病相似度融合矩阵d和药物相似度融合矩阵m。
43、所述对输入特征交融网络的特征向量进行嵌入操作,得到嵌入向量包括以下内容:
44、设置ri表示第i个ncrna的初始输入特征,dj表示第j个疾病的初始输入特征,将ri和dj输入嵌入层中,得到和其中,和分别表示ncrna向量和疾病向量的嵌入矩阵,t代表矩阵的转置操作,和的维度为d;
45、同理设置mj表示第j个药物的初始输入特征,将di和mj输入嵌入层中,得到疾病向量和药物向量的嵌入矩阵。
46、所述使用多层感知机从嵌入向量中提取特征,构造堆叠特征包括以下内容:
47、给定ncrna嵌入向量输入由m个mlp组成的密集层中,并拼接所有m个mlp以形成ncrna特征向量的堆叠;
48、给定一个疾病嵌入向量输入另一个由m个mlp组成的密集层中,并连接所有m个mlp以形成疾病特征向量的堆叠;
49、同理形成药物特征向量的堆叠。
50、所述基于自注意力权重矩阵分别对ncrna和疾病堆叠特征、药物与疾病的堆叠特征进行融合得到融合堆叠特征包括以下内容:
51、计算每个ncrna特征向量fri和每个疾病特征向量fdj的逐元素乘积,得到局部自注意力权重;
52、使用局部自注意力权重对特征向量进行加权,将加权后的向量馈入具有一个神经元的密集层中,输出为交互偏好矩阵第i行、第j列元素的值,构造得到交互偏好矩阵s;
53、将ncrna特征堆叠fr,1由归一化交互偏好矩阵s'加权,疾病特征堆叠fd,1由转置的归一化交互偏好矩阵s'加权;
54、通过单层网络并使用selu激活函数将级联的向量堆叠投影回与fr,1相同维度的矩阵,之后添加残差连接,生成ncrna融合堆叠,同理生成疾病融合堆叠,实现ncrna和疾病的特征交融;
55、同理对疾病和药物进行特征交融。
56、本发明具有以下优点:一种基于特征交融网络的ncrna-药物耐药性关联预测方法,
57、1、引入疾病信息和药物理化性质信息,丰富了药物特征,同时将与ncrna和药物相关的疾病纳入考虑,从ncrna、药物和疾病三个角度同时考虑ncrna和药物耐药性之间的关联关系。
58、2、用邻域约束矩阵迭代融合补全算法,在构造了ncrna、疾病和药物的gip相似度矩阵后,对原始相似度矩阵进行融合补全,兼顾信息缺失问题和信息补全问题。
59、3、采用多阶段训练策略,依次优化ncrna-疾病关联预测、疾病-药物关联预测和ncrna-药物关联预测,以提高模型对ncrna-药物耐药性关联预测性能。
1.一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述预测方法包括:
2.根据权利要求1所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述步骤一包括以下内容:
3.根据权利要求1所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述通过特征交融网络分别对ncrna和疾病的特征、药物与疾病的特征进行交融包括以下内容:
4.根据权利要求1所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述利用预测网络结合多阶段训练策略对ncrna-药物耐药性关联进行预测包括以下内容:
5.根据权利要求2所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述ncrna序列相似度矩阵构造步骤包括以下内容:
6.根据权利要求2所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述疾病语义相似度矩阵构造步骤包括以下内容:
7.根据权利要求1所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述步骤二包括以下内容:
8.根据权利要求3所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述对输入特征交融网络的特征向量进行嵌入操作,得到嵌入向量包括以下内容:
9.根据权利要求3所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述使用多层感知机从嵌入向量中提取特征,构造堆叠特征包括以下内容:
10.根据权利要求9所述的一种基于特征交融网络的ncrna-药物耐药性关联预测方法,其特征在于:所述基于自注意力权重矩阵分别对ncrna和疾病堆叠特征、药物与疾病堆叠特征进行融合得到融合堆叠特征包括以下内容:
