在scRNA-seq和snRNA-seq数据中识别细胞类型,使用机器学习算法.
Adam Tisch1, Siddharth Madapoosi2, Stephen Blough1
1Undergraduate Research Opportunity Program, University of Michigan, Ann Arbor, MI, USA.
Heliyon
|October 15, 2024
概括
机器学习从单细胞RNA测序 (scRNA-seq) 和单核RNA测序 (snRNA-seq) 数据中准确地注释细胞类型. 这种自动化方法提高了可扩展性,并有助于病研究.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 腎臟病學 (nephrology) 是一種醫學專業.
背景情况:
- 单细胞RNA测序 (scRNA-seq) 和单核RNA测序 (snRNA-seq) 为细胞生物学提供了深刻的见解.
- 手动的细胞类型注释是劳动密集型的,限制了研究可扩展性.
研究的目的:
- 评估监督机器学习算法的有效性,用于自动化细胞类型注释.
- 为了比较五种不同的机器学习模型的性能.
主要方法:
- 在五个sc/snRNA-seq数据集中分析了79个脏活检样本中的62,120个细胞.
- 应用五个监督算法 (SVM,随机森林,MLP,KNN,XGBoost) 进行细胞类型注释.
- 在综合和协调数据集上使用F1分数和拒绝率进行评估.
主要成果:
- 所有五种机器学习算法都实现了高精度,F1的中位数为0.94.4.
- 算法在数据集中表现出强大的性能,并有效地拒绝未注释的细胞类型.
- 当在scRNA-seq数据上训练的模型被应用于snRNA-seq数据时,观察到精度略有降低.
结论:
- 机器学习为sc/snRNA-seq数据中注释细胞类型提供了准确和可扩展的方法.
- 这种自动化方法可以标准化注释过程,加速病研究.
- 需要使用更大的样本大小进行进一步验证.


