CytoLNCpred-一种用于预测15个细胞系中细胞质相关的长非编码RNA的计算方法
Shubham Choudhury1, Naman Kumar Mehta1, Gajendra P S Raghava1
1Department of Computational Biology, Indraprastha Institute of Information Technology, New Delhi, India.
Frontiers in bioinformatics
|June 10, 2025
概括
一种新方法预测了人类细胞中长非编码RNA (lncRNA) 的局部化. 具有相关性特征的机器学习在识别细胞质相关的lncRNAs方面表现优于大型语言模型.
科学领域:
- 分子生物学分子生物学
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
背景情况:
- 长非编码RNAs (lncRNAs) 的功能严重依赖于它们的亚细胞局部.
- 现有的预测方法受到噪音数据集的影响,并排除了具有微妙局部差异的lncRNA.
研究的目的:
- 开发和评估一种可靠的方法来预测15个人类细胞系的细胞质相关 lncRNA.
- 与核相比,在细胞质中丰富度更高的lncRNAs的识别.
主要方法:
- 使用传统特征 (组成,相关性) 开发机器学习 (ML) 和深度学习模型.
- 利用来自大型语言模型DNABERT-2的嵌入功能来开发ML模型.
- 使用五倍交叉验证和独立验证数据集进行性能比较,测量曲线下的面积 (AUC).
主要成果:
- 使用组合和相关性特征的ML模型实现了平均AUC分别为0.7049和0.7089.
- DNABERT-2嵌入特征的结果是平均AUC为0.665.
- 微调的DNABERT-2实现了0.6336的平均AUC,表明基于ML的相关性特征在此任务中优于基于LLM的方法.
结论:
- 使用基于关联的特征的机器学习模型在预测差异性lncRNA本地化方面表现优异,与基于LLM的模型相比.
- 开发的细胞系特异模型和一个网络服务器是公开可用的,用于预测lncRNA本地化.


