使用机器学习在感染Fusobacterium nucleatum的小鼠中预测非编码RNA.
Pradeep Kumar Yadalam1, Thilagar Sivasankari1, Muthupandian Saravanan2
1Department of Periodontics, Saveetha Dental College, Saveetha Institute of Medical and Technical Sciences (SIMATS), Chennai, India.
Dental and medical problems
|March 10, 2026
概括
机器学习准确地预测了在感染Fusobacterium nucleatum的小鼠中的新型非编码RNA (ncRNA). 随机森林和AdaBoost模型实现了100%的准确性,识别了牙周炎进展中的关键RNA.
科学领域:
- 微生物学和生物信息学
- 基因组学和转录基因组学
- 计算生物学和机器学习
背景情况:
- 菌核酸在牙周病中很普遍,但其非编码RNA (ncRNA) 调节机制仍未得到充分研究.
- 以前的基因组和转录组研究为识别ncRNA提供了有限的预测能力.
- 要了解F. nucleatum在疾病进展中的作用,需要研究其ncRNA调节.
研究的目的:
- 使用机器学习 (ML) 预测F. nucleatum感染的小鼠中以前未经表征的非编码RNA (ncRNA).
- 识别与牙周炎相关的长非编码RNA (lncRNA) 和圆形RNA (circRNA).
- 评估不同ML算法的ncRNA分类的有效性.
主要方法:
- 使用了来自GEO数据库的牙周炎基因表达数据集 (GSE225589).
- 识别和标记长非编码RNA (lncRNA) 和圆形RNA (circRNA).
- 应用并比较了三种机器学习算法:随机森林 (RF),自适应增强 (AdaBoost) 和原始贝叶斯 (NB) 进行分类.
主要成果:
- 随机森林 (RF) 和自适应增强 (AdaBoost) 模型在分类lncRNAs和circRNAs方面表现出卓越的性能.
- 无论是RF还是AdaBoost都实现了100%的ROC曲线 (AUC) 下的完美面积.
- 原始贝叶斯 (NB) 模型的AUC略低,达到92%.
结论:
- 这项研究开创了机器学习的应用,用于预测F.核菌感染小鼠的ncRNA,使用转录组数据.
- 射频和AdaBoost算法显示了准确识别感染相关的lncRNA和circRNA的高潜力.
- 建议对更大的队列和外部数据集进行进一步验证,以确认这些预测结果.


