优化用于单细胞RNA分析的聚类参数,使用内在良性指标
Nicolina Sciaraffa1, Antonino Gagliano2, Luigi Augugliaro2
1Advanced Data Analysis Group, Ri.MED Foundation, Palermo, Italy.
Frontiers in bioinformatics
|June 26, 2025
概括
在单细胞RNA测序中精确的细胞亚群集群可以使用内在指标来预测. 优化UMAP,分辨率和最近邻居等参数可以提高集群精度,集群内部分散和Banfield-Raftery指数可以作为可靠的代理.
科学领域:
- 单细胞RNA测序分析分析
- 计算生物学是一种计算生物学.
- 生物信息学是一种生物信息学.
背景情况:
- 对单细胞RNA测序 (scRNA-seq) 数据分析而言,细胞亚群的精确聚类是必不可少的.
- 无监督集群的性能高度依赖于所选择的算法和参数.
- 预测聚类准确性是具有挑战性的,但对于可靠的生物见解至关重要.
研究的目的:
- 通过利用内在良性指标来预测scRNA-seq数据中无监督聚类方法的准确性.
- 评估不同聚类参数对细胞亚群识别准确性的影响.
- 识别可靠的内在指标,可以作为聚类准确性的代理.
主要方法:
- 使用了三个scRNA-seq数据集,其中包含来自不同解剖学来源的基本真理注释.
- 采用莱登算法和深层嵌入单细胞聚类 (DESC) 进行无监督聚类.
- 实施了线性混合回归模型来分析参数影响和ElasticNet回归,使用15个内在指标来预测准确度.
主要成果:
- 社区图表生成的UMAP方法和增加的分辨率对集群精度产生了积极的影响.
- 减少最近的邻居放大了分辨率的效果,增强了细粒度细胞关系的保存.
- 集群内部分散和班菲尔德-拉夫特里指数被确定为集群准确性的有效预测指标.
结论:
- 在scRNA-seq中的聚类精度可以有效地使用内在指标预测,从而促进参数优化.
- 参数选择,包括UMAP,分辨率和主要组件的数量,显著影响聚类结果.
- 集群内部分散等内在指标提供了一个强大的方法来比较不同的集群配置,并确保可靠的细胞子群体识别.


