开发和验证可靠的基于DNA拷贝数的机器学习算法 (CopyClust) 用于乳腺癌整合集群分类
Cameron C Young1,2, Katherine Eason1, Raquel Manzano Garcia1
1Cancer Research UK Cambridge Institute and Department of Oncology, Li Ka Shing Centre, University of Cambridge, Cambridge, UK.
Scientific reports
|May 24, 2024
概括
一个新的机器学习算法CopyClust只使用副本数数据准确地分类乳腺癌亚型. 这种方法改善了缺乏基因表达数据的样本的亚型分类,有助于乳腺癌研究.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 机器学习在瘤学中
背景情况:
- 综合集群亚型 (IntClusts) 根据拷贝数和基因表达分类乳腺癌.
- 准确的IntClust分类对于了解疾病驱动因素和预后至关重要.
- 当前的方法在基因表达数据无法获得时,精度较低.
研究的目的:
- 开发一种新的算法,用于准确的乳腺癌IntClust分类,仅使用副本编号数据.
- 为了克服现有方法的局限性,这些方法需要基因表达数据.
主要方法:
- 利用了1980年METABRIC乳腺癌样本的副本数数据来训练XGBoost算法 (CopyClust).
- 在10个IntClust配置文件中确定了独特的基因组断点,以创建约500个基因组区域作为特征.
- 开发了10类单一模型和6类二进制重新分类模型.
主要成果:
- 在TCGA SNP和WES数据集上,CopyClust分别实现了81%和79%的准确性.
- 与IntClust亚型分类的现有方法相比,显示出显著的改进 (≥9个百分点).
- 在不同的副本编号数据平台 (SNP数组和WES) 上验证了性能.
结论:
- 在缺乏基因表达数据的乳腺癌样本中,CopyClust在分类IntClust亚型方面取得了重大进展.
- 该算法提供了一个易于实现的解决方案,用于使用副本编号数据进行IntClust分类.
- 这种方法提高了副本数数据在乳腺癌亚型和研究中的实用性.


