一种基于机器学习的方法来减少甲基化数据的特征,用于癌症组织起源的分类
Marco A De Velasco1, Kazuko Sakai1, Seiichiro Mitani2
1Department of Genome Biology, Faculty of Medicine, Kindai University, Ohnohigashi 377-2, Osaka-Sayama, 589-9511, Japan.
International journal of clinical oncology
|September 18, 2024
概括
我们开发了一种集体学习模型,使用DNA甲基化概况来分类癌症类型. 这种方法有效地减少了所需的CpG部位的数量,保持了癌症识别的高精度.
科学领域:
- 基因组学就是基因组学.
- 癌症研究 癌症研究
- 生物信息学是一种生物信息学.
背景情况:
- 基因组DNA甲基化分析是癌症分类的宝贵工具,但受到高成本和大量数据要求的限制.
- 开发利用甲基化数据进行癌症分类的经济有效和高效方法对于临床应用至关重要.
- 现有的方法通常需要大量的基因组数据,这构成了广泛使用的障碍.
研究的目的:
- 开发一个集体学习模型,使用减少的一组CpG位点来准确识别癌症类型.
- 为了研究使用有限数量的甲基化特征用于强大的癌症分类的可行性.
- 简化基于甲基化的癌症分类过程,以提高可访问性和效率.
主要方法:
- 利用了来自癌症基因组图谱 (TCGA) 数据库的10种癌症类型的890个样本的DNA甲基化数据.
- 在首次选择重要的CpG地点时,使用ANOVA和增益比率.
- 应用梯度提升以进一步减少特征集到100个CpG站点进行分类.
主要成果:
- 开发的模型实现了高分类精度,在各种机器学习算法中从87.7%到93.5%不等.
- 包括极端梯度提升,CatBoost和随机森林在内的方法在减少的功能集下表现出强大的性能.
- 该方法成功地将所需特征的数量最小化,而不会影响分类准确性,从而使主要器官分类和子组发现成为可能.
结论:
- 渐变增强特征选择是简化基于甲基化的癌症分类的有希望的策略.
- 这种方法提供了一种具有成本效益和高效的方法,用于使用DNA甲基化数据识别癌症类型.
- 这些发现支持在瘤学中更广泛的临床实施甲基化分析的潜力.


