SUMA:一个轻量级的机器学习模型为 scRNA-Seq 数据提供了基于最近邻近的共享聚类应用程序接口
Hamza Umut Karakurt1,2, Pınar Pir1,2
1Department of Bioengineering, Faculty of Engineering, Gebze Technical University, Kocaeli, Turkiye.
Turkish journal of biology = Turk biyoloji dergisi
|April 29, 2024
概括
SUMA是一个新的工具,它使用随机森林模型来优化基于图形的集群,用于单细胞RNA测序 (scRNA-Seq) 数据. 它准确地预测了最佳邻居数量,改善了细胞类型的注释,并为研究人员简化了分析.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 单细胞RNA测序 (scRNA-Seq) 揭示了细胞多样性,但面临着数据稀疏性,噪声和细胞类型识别方面的挑战.
- 基于图形的集群是一种强大的scRNA-Seq分析方法,但其性能严重依赖于用户定义的参数,如邻居数量.
- 优化这些参数对于scRNA-Seq研究中精确的细胞聚类和注释至关重要.
研究的目的:
- 开发SUMA,一种使用随机森林模型来预测基于图形的scRNA-Seq数据集群的最佳参数的轻量级工具.
- 通过优化聚类结果来提高细胞类型注释的准确性和方便性.
- 将SUMA集成到RShiny应用程序中,以便研究人员,包括非生物信息学家,可以轻松访问.
主要方法:
- 利用公开可用的scRNA-Seq数据集和三种基于图形的集群算法来开发SUMA.
- 使用Scikit-learn (Python) 和randomForest (R) 库训练了一个随机森林模型,考虑了广泛的邻居计数和变异基因.
- 使用调整后的兰德指数 (ARI) 与真实标签对比,评估集群质量,将数据分为培训和测试集.
主要成果:
- 开发的机器学习模型实现了0.96的精度和0.98.98的AUC.
- 该模型将scRNA-Seq数据中的细胞数确定为确定最佳邻居数量的最有影响力的特征.
- SUMA有效地预测了最佳集群参数,从而改善了scRNA-Seq数据分析.
结论:
- SUMA提供了一种准确和自动化的方法来优化scRNA-Seq数据的基于图形的聚类.
- SUMAShiny应用程序提供了一个集成的平台,用于集群和可视化scRNA-Seq数据,可通过桌面或Web浏览器访问.
- SUMA使研究人员,包括那些没有广泛的生物信息学专业知识的研究人员,能够进行强大的细胞类型注释和分析.


