2026年 04期
基于药物多尺度分子结构相似性的抗癌药物组合协同性预测
郭林扬;黄毅然;张锦雄;庞毅恒;钟诚;高效预测抗癌药物组合的协同性是制定个性化联合用药方案的关键。抗癌药物的生物活性高度依赖于其分子结构中的药效团,然而现有计算模型在深度挖掘与利用分子结构中的药效团特征方面仍存在局限。针对该问题,本研究提出一种基于多尺度结构相似性的抗癌药物组合协同性预测模型(multi-scale molecular structural similarity-based synergy prediction model for anticancer drug combinations, MSSynergy)。该模型利用三层图卷积神经网络对药物分子的多尺度结构特征进行分层表征,引入注意力机制量化药物在不同尺度下的结构相似度得分,从结构相似性的角度捕捉关键的抗肿瘤药效特征,并利用多层卷积神经网络提取癌细胞系的转录组基因表达特征,通过全连接层实现协同得分或分类的端到端预测。实验结果表明,MSSynergy模型的均方误差(mean squared error, MSE)、斯皮尔曼相关系数(Spearman correlation coefficient, SCC)与决定系数(coefficient of determination, R2)、受试者工作特征曲线下面积(area under the receiver operating characteristic curve, AUC)、精确率-召回率曲线下面积(area under the precision-recall curve, AUPR)及准确率(accuracy, ACC)分别达到0.010、 0.836、0.994、 0.940、 0.939和0.870,均高于已有方法,充分验证了MSSynergy模型能够为癌症精准治疗及临床药物筛选提供有效的技术支持。
基于多尺度键感知与多模态融合的冷启动药物潜在风险识别
曾雲鞠;张锦雄;王巫亮;倪丹丹;邹军;钟诚;在新药研发过程中,由于缺乏历史相互作用数据,如何准确识别冷启动药物的潜在风险成为关键挑战之一。针对现有预测模型在冷启动场景下泛化能力不足、分子结构细粒度信息建模不充分以及多模态信息融合能力有限等问题,本文提出一种多尺度键感知与多模态融合的冷启动药物相互作用(drug-drug interaction, DDI)风险识别模型。该模型构建键感知分子图学习模块,在多尺度上刻画化学键与子结构间复杂关系,运用冷启动泛化模块增强具有功能语义的新药数据,融合分子结构信息、多源属性信息及功能语义特征,实现多模态联合建模。实验结果表明,在冷启动场景下,本文模型在准确率(accuracy, ACC)、受试者工作特征曲线下面积(area under the receiver operating characteristic curve, AUC)及f1得分等指标总体优于已有预测模型,消融实验、参数敏感性分析和案例研究也表明本文模型具有更强的泛化能力、稳定性和有效性。本研究工作成果为新药早期安全性评估及用药风险识别提供一种计算工具。
基于生物信息学和机器学习阐明双酚A诱发哮喘的机制
胥俊宇;张紫玉;张志毕;邹胜梅;张翠苹;黄巍;刘建昆;高洁;双酚A(bisphenol A, BPA)是一种广泛存在的环境内分泌干扰物,其暴露与免疫介导性哮喘发生密切相关,但其具体分子机制仍不清楚。阐明BPA诱发哮喘的机制,对于认识环境污染物相关哮喘的发病基础并指导其预防和干预具有重要意义。本文通过整合网络毒理学、生物信息学及分子对接技术,从公共数据库获取BPA作用靶点及哮喘相关基因并取交集,随后对候选靶点进行基因本体(gene ontology, GO)功能注释与京都基因与基因组百科全书(kyoto encyclopedia of genes and genomes, KEGG)通路富集分析,结合机器学习筛选核心基因,并通过免疫浸润分析评估其与免疫细胞的相关性,最终采用分子对接验证BPA与核心靶点的结合能力,确定BPA诱发哮喘的靶点。共鉴定出145个BPA诱发哮喘的潜在关键靶点, GO与KEGG分析显示这些靶点主要富集于酶活性与结合活性、补体与凝血级联等生物过程与通路,进一步筛选获得5个核心基因(RIPK2、 CDC25B、 CRBN、 RELA、 IL13RA1),分子对接结果显示BPA与5个核心基因均表现出稳定的结合构象。该研究通过多组学整合分析初步阐明了其参与哮喘发生的潜在分子机制,为深入认识BPA的呼吸道毒性及探索哮喘的防治策略提供了依据。
基于机器学习的EGFRI皮肤毒性特征基因及消疹方干预机制研究
程呈;韩紫彤;罗玲;刘玉萍;王心甜;邢海燕;本研究探究表皮生长因子受体抑制剂(epidermal growth factor receptor inhibitor, EGFRI)所致皮肤毒性的发生和治疗机制,筛选其特征基因生物标志物,并从分子水平阐明中药复方消疹方的干预机制。首先,从美国国家生物技术信息中心(national center for biotechnology information, NCBI)的基因表达整库(gene expression omnibus, GEO)中纳入9个与EGFRI皮肤毒性相关的转录组数据集,进行Meta分析以筛选差异表达基因(differentially expressed genes, DEGs)。联合最小绝对收缩与选择算子(least absolute shrinkage and selection operator, LASSO)、支持向量机-递归特征消除(support vector machine-recursive feature elimination, SVM-RFE)及随机森林(random forest, RF)三种机器学习(machine learning, ML)算法,从DEGs中鉴定出核心特征基因。随后,通过给小鼠灌胃厄洛替尼建立皮肤毒性模型,设立消疹方预防组和治疗组进行干预。最后,利用转录组测序(RNA sequencing, RNA-seq)、实时定量聚合酶链式反应(real-time quantitative polymerase chain reaction, RT-qPCR)及蛋白质免疫印迹法(western blotting, WB)等技术,验证消疹方的疗效并探索相关治疗机制。Meta分析初步筛选出127个与EGFRI皮肤毒性显著相关的DEGs。通过3种机器学习算法的交集分析,并结合转录组学结果,最终确定VCAN、 VSNL1、CDC20、 NUF2和BIRC5为潜在生物标志物。动物实验表明,消疹方能有效改善厄洛替尼诱导的皮肤损伤。转录组学及后续分子生物学验证表明,消疹方可通过调节炎症反应、细胞周期等相关通路,缓解EGFRI所致皮肤毒性,并且在这一过程中,上述5个生物标志物的表达变化趋势具有较好一致性。本研究成功鉴定出一组可作为EGFRI皮肤毒性潜在生物标志物的特征基因,并揭示了消疹方是通过调控“细胞周期-干细胞轴”和“神经微环境”来发挥预防和治疗作用。该发现为消疹方的临床应用提供了坚实的理论依据,也为利用中医药防治靶向药物副作用提供了新的研究策略。
基于SHAP引导的两阶段特征筛选与基因组预测框架研究
卢开心;刘建平;针对基因组数据高维度、高冗余及复杂非线性关系所导致的特征筛选困难和预测性能不足问题,本研究提出了一种基于沙普利加性解释(Shapley additive explanations, SHAP)引导的两阶段特征筛选与基因组预测框架。首先,对全体样本的基因型数据进行主成分分析(principal component analysis, PCA)降维,并保留95%的累计变异信息,以构建统一的低维特征表示;其次,在外层10折交叉验证框架下,于每一折训练集内部采用最小绝对收缩和选择算子(least absolute shrinkage and selection operator, LASSO)进行第一阶段全局稀疏筛选,以压缩候选特征空间;在此基础上,结合极端梯度提升(extreme gradient boosting, XGBoost)与SHAP对候选特征进行条件贡献评估,进一步筛选关键特征;最后,将筛选后的特征输入深度神经网络基因组预测(deep neural network genomic prediction, DNNGP)模型进行训练,并在对应测试集上完成独立预测评估。在wheat599和wheat2000数据集上的实验结果表明,所提出的方法在多个环境条件下优于基因组最佳线性无偏预测(genomic best linear unbiased prediction, GBLUP)、轻量级梯度提升机(light gradient boosting machine, Light GBM)、支持向量回归(support vector regression, SVR)和DNNGP等模型,在wheat599 Env2中,预测相关系数达到0.78,较DNNGP提高约23.8%。同时,在特征数量减少(最高约88%)的情况下,模型仍保持较高预测精度,展现了良好的稳定性与泛化能力。此外, SHAP分析显示,部分特征在不同环境中具有稳定的重要性,揭示了潜在的基因型与环境互作效应。综上,本文方法不仅提升了预测性能,还增强了模型可解释性,为高维基因组数据分析与作物分子育种提供了一种有效的技术路径。
人工智能在宏基因组抗菌肽挖掘中的应用
牛培源;李丝;林冠宏;周程冉;闫海芳;随着抗生素耐药性危机在全球范围内持续蔓延,研发新型抗菌药物已成为亟待解决的问题。抗菌肽(antimicrobial peptides, AMPs)具有独特的抗菌作用机制,不易诱导细菌产生耐药性,已经成为替代传统抗生素的重要候选药物。然而,传统实验筛选抗菌肽存在周期长、成本高等问题,不利于天然抗菌肽的挖掘。近年来,宏基因组学与人工智能的深度融合,为从海量环境及微生物组数据中高效挖掘抗菌肽提供了全新的思路。本文梳理了抗菌肽特征、相关资源数据库及实验验证方法,总结了人工智能判别抗菌肽的方法,包括传统机器学习、深度学习、蛋白质语言模型和迁移学习等技术方法,并且系统叙述了多模型混合策略在宏基因组数据中的应用进展。目前,该领域仍存在高质量标注数据不足、高通量验证困难等问题。但随着人工智能和多组学技术的进步,抗菌肽的智能化、精准化挖掘将实现突破性进展,有效加速更高效候选分子的发现和临床转化进程,为应对抗生素耐药性危机提供有效解决方案。
面向长短程依赖发现的全基因组lncRNA结合位点预测深度学习框架
田雨欣;张立木;杨亦轩;郭昊;长链非编码RNA(long non-coding RNA, lncRNA)能够与DNA相互作用,作为关键的调控元件,在癌症和代谢紊乱等复杂疾病的发生发展中起着核心作用。尽管基于深度学习的计算方法已开始应用于全基因组lnc RNA-DNA结合位点的表征,但现有模型难以同时捕获长程与短程染色质依赖关系,这仍是当前领域的瓶颈。本研究构建了一个深度学习框架Binder,可以通过整合卷积神经网络(convolutional neural networks, CNN)与多头注意力机制,准确预测全基因组范围内的lnc RNADNA结合位点。Binder的性能已在Ch IRP-seq数据集上得到了验证,其平均受试者工作特征曲线下面积(area under the receiver operating characteristic curve, AUC)达到0.870,优于CNN_deeper等现有最先进的模型。此外, Binder自主捕捉到了与已知转录因子结合位点(如TAL1::TCF3)一致的调控基序。本研究突破了以往方法在建模全局序列上下文方面的局限,并提供了一个用户友好的Web应用工具,以便于研究lnc RNA调控机制,为辅助疾病治疗和药物研发打下基础。
美沙拉嗪致肝损伤铁死亡标志物识别及潜在的治疗中药预测
强永虎;查瑞瑶;许圣楠;李佳诺;查安生;本研究基于机器学习与单细胞分析,探索美沙拉嗪所致药物性肝损伤(drug induced liver injury, DILI)铁死亡相关的特征基因,并预测潜在的治疗中药。整合基因表达综合数据库(gene expression omnibus, GEO)中DILI相关数据集,以GSE54254、 GSE102006和GSE169072作为训练集, GSE54257和GSE147866作为验证集。通过差异表达基因(differentially expressed genes, DEGs)分析、加权基因共表达网络分析(weighted gene co-expression network analysis, WGCNA)及铁死亡基因集筛选候选靶点,采用113种组合情形的机器学习模型结合沙普利加性解释(Shapley Additive ex Planations, SHAP)分析筛选关键基因,构建人工神经网络(artificial neural network, ANN)模型与列线图模型评估诊断效能,并对核心基因进行表达差异验证及共表达网络分析。利用基因集富集分析(gene set enrichment analysis, GSEA)、单细胞转录组及细胞通讯分析阐明机制,通过网络药理学与分子对接预测潜在治疗中药。结果显示,共获得111个DILI相关铁死亡靶基因,通过筛选并验证,确定FABP1、 TNFRSF10B、 CSRP2和TYMS可作为美沙拉嗪致DILI的生物标志物。GSEA提示核心基因富集于氧化磷酸化、补体与凝血级联反应、细胞因子-细胞因子受体相互作用等免疫代谢通路。单细胞分析显示核心基因主要表达于单核细胞、巨噬细胞及平滑肌细胞,且巨噬细胞在细胞间通讯网络中交互活性最强。筛选出陈皮、枳实等33味中药,其药性以平、温、微寒为主,药味多为苦、辛、甘,主归肺、肝、胃、脾经,核心功效为理气与清热解毒。分子对接显示活性成分与核心靶点结合稳定。结果表明, FABP1、 TNFRSF10B、 CSRP2和TYMS作为美沙拉嗪相关DILI的潜在诊断生物标志物,具有良好的区分效能,可能通过调控铁死亡通路及巨噬细胞功能参与DILI的发生,筛选出的中药为临床防治提供了新的候选策略。
多组学研究揭示瓜蒌薤白半夏汤治疗慢性阻塞性肺疾病的关键基因
罗成;叶远航;覃琬婷;基于孟德尔随机化(Mendelian randomization, MR)分析、网络药理学及多组学数据整合分析,系统筛选瓜蒌薤白半夏汤(Gualou Xiebai Banxia decoction, GLXBBX)治疗慢性阻塞性肺疾病(chronic obstructive pulmonary disease, COPD)的核心调控基因与关键细胞亚群,通过探索核心靶点所在的细胞亚群特征,揭示该方剂整体干预COPD的分子与细胞学作用机制。运用公共数据库获取COPD的转录组及单细胞RNA测序数据,通过差异表达基因(differentially expressed genes, DEGs)和加权基因共表达网络分析(weighted gene co-expression network analysis, WGCNA)鉴定COPD相关基因。构建“中药-活性成分-靶点”网络,联合模块识别算法识别筛选GLXBBX-COPD核心基因,并对其进行功能富集分析。采用MR分析验证核心基因与COPD发病之间的因果关联,通过受试者工作特征(receiver operating characteristic, ROC)曲线与外部验证集评估因果基因的诊断效能;并利用分子对接、分子动力学(molecular dynamics, MD)模拟及ADMETlab平台评估关键活性成分与靶蛋白的结合稳定性及毒理药代特征。通过DEGs、 WGCNA和拓扑算法,共筛选获得144个GLXBBX-COPD核心基因,显著富集于磷脂酰肌醇3-激酶/蛋白激酶B(phosphatidylinositol 3-kinase/protein kinase B, PI3K-AKT)信号通路。单细胞及免疫浸润分析显示,m TOR在巨噬细胞中高表达且关联显著。MR证实m TOR与COPD发病具有显著因果关系, ROC曲线验证曲线下面积(area under the curve, AUC)为0.503。分子对接和分子动力学模拟证实GLXBBX核心成分(如维生素E和卡维丁等)能与m TOR稳定结合,鉴定m TOR和巨噬细胞是GLXBBX干预COPD的关键靶标及效应细胞,揭示了该方剂可能通过调控PI3K-AKT通路、下调m TOR以影响巨噬细胞极化,进而缓解COPD。该发现为GLXBBX的临床应用提供了理论依据。
基于孟德尔随机化、生物信息学和机器学习筛选支气管哮喘关键基因
罗成;叶远航;覃琬婷;支气管哮喘是以慢性气道炎症为核心特征的呼吸系统疾病,现有治疗难以逆转气道重塑且病情易反复,亟须挖掘早期诊断标志物与新型治疗靶点。本研究整合GEO数据库哮喘转录组数据,开展差异表达基因(differentially expressed genes,DEGs)分析;运用Finn Gen数据库的全基因组关联研究(genome-wide association studies, GWAS)汇总统计数据,利用表达数量性状位点(expression quantitative trait loci, e QTL)信息筛选工具变量,进行孟德尔随机化(Mendelian randomization, MR)分析,将MR得到的遗传风险基因与DEGs取交集,筛选出关键共表达基因。进一步采用最小绝对收缩和选择算子(least absolute shrinkage and selection operator, LASSO)回归进行特征基因选择,通过CTD数据库、 ITCM数据库、古今医案云平台预测潜在调控支气管哮喘的中药,并分析其性味归经及功效。最后运用分子对接验证活性成分与靶蛋白的结合能力。本研究共鉴定933个哮喘DEGs与374个MR风险基因,交集获得10个核心基因(5个风险基因和5个保护基因),主要参与B细胞受体信号转导、糖代谢、可溶性NSF附着蛋白受体(soluble NSF attachment protein receptor, SNARE)介导囊泡运输等通路;经LASSO回归确定VAMP8、 MRPL48、 DDIT3、 TOM1和TRANK1共5个具有良好诊断价值的特征基因;预测得到276味相关中药,药性以温、寒、平为主,药味以苦、辛、甘为主,归经以肝、肺、胃、脾、肾经为主,分类以清热药、补虚药、活血化瘀药等为主;分子对接表明,茯苓活性成分与靶蛋白可稳定结合。综上,本研究通过遗传学与生物信息学整合分析,鉴定出10个与哮喘因果关联的核心基因及5个候选诊断标志物,为哮喘的机制阐释与精准诊疗提供了理论依据。