使用cBioPortal的癌症基因组图谱来开发机器学习辅助癌症治疗的基因组数据集
bioRxiv : the preprint server for biology
|March 3, 2025
概括
这项研究创建了基因组数据集,使用机器学习来预测有害的遗传突变. 基因组数据提高了PolyPhen和SIFT得分的预测准确度,有助于癌症研究和治疗.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 预测基因突变的致病性对于了解疾病,特别是癌症至关重要.
- 多态性表型 (PolyPhen) 和不耐受从耐受 (SIFT) 的排序是评估突变影响的重要工具.
- 缺乏易于获得的基因组数据集,阻碍了对有害突变的预测模型的开发.
研究的目的:
- 开发和评估基因组和非基因组数据集,用于预测PolyPhen和SIFT得分.
- 应用机器学习模型来分类潜在有害的遗传突变.
- 评估不同机器学习模型在突变预测中的性能.
主要方法:
- 利用cBioPortal的癌症基因组图谱 (TCGA) 数据来构建基因组和非基因组数据集.
- 实施并比较了三种机器学习分类模型:随机森林 (RF),极端梯度增强 (XGBoost) 和一个集体RF-XGBoost模型.
- 基于PolyPhen和SIFT得分的预测准确度评估模型性能.
主要成果:
- 与非基因组数据相比,基因组数据在预测PolyPhen和SIFT得分方面表现优异.
- 整体RF-XGBoost模型在基因组数据上实现了最高的预测准确率:PolyPhen的88.43%和SIFT的95.13%.
- 机器学习模型,特别是在基因组数据上训练时,显示出对准确突变影响预测的巨大潜力.
结论:
- 基因组数据集在构建基因突变影响的准确预测模型方面更有效.
- 整体RF-XGBoost模型提供了一种强大的方法来识别潜在的有害突变.
- 人工智能对在疾病研究和临床应用的背景下推进基因突变分析具有重大前景.


