一个 lncRNA-疾病关联预测模型,基于两步PU学习和完全连接的神经网络
Hou Biyu1, Tan GuangWen1, Zeng Ming1
1College of Physics and Electronic Information, Gannan Normal University, Ganzhou, Jiangxi, 341000, China.
Heliyon
|August 4, 2023
概括
这项研究引入了一种新的循环优化模型 (COPTLDA),以准确预测长非编码RNA (lncRNA) -疾病关联. 该模型通过仔细选择负样本来提高预测准确性,有助于了解疾病机制.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 长非编码RNAs (lncRNAs) 调节人类疾病,但由于效率低下和主观性,实验验证是有限的.
- 现有的机器学习方法用于 lncRNA-疾病关联预测,通常使用随机选择的负样本,导致精度降低.
- 在 lncRNA-疾病关联预测中对数据特征的探索仍未得到充分探索.
研究的目的:
- 提出一种新的循环优化模型,用于预测lncRNA与疾病的关联 (COPTLDA).
- 通过实施有效的负样本选择的两步培训策略来提高预测准确性.
- 解决当前预测模型中随机负样本选择的局限性.
主要方法:
- 开发了一个循环优化模型 (COPTLDA),采用两步训练策略.
- 从未标记的数据中确定了高概率的负样本,以改进模型培训.
- 代地重复搜索和训练步骤以获得最佳预测模型.
主要成果:
- 根据COPTLDA模型,曲线下的面积 (AUC) 值高达0.9348.8.
- 拟议的抽样策略显著提高了模型的准确性和回忆力.
- 案例研究成功预测了lncRNA与结直肠癌,胃癌和乳腺癌等主要癌症的关联.
结论:
- COPTLDA提供了一种有效的计算方法,用于预测lncRNA与疾病的关联.
- 该模型识别可靠负样本的能力提高了预测性能.
- 预测的关联为了解lncRNA在恶性瘤和潜在治疗点中的作用提供了宝贵的见解.


