一组基于机器学习的性能评估确定了顶级的In-Silico病原性预测方法,这些方法最能对癌症中驱动突变进行最佳分类
Subrata Das1, Vatsal Patel1, Shouvik Chakravarty1,2
1Biotechnology Research and Innovation Council-National Institute of Biomedical Genomics (BRIC-NIBMG), National Institute of Biomedical Genomics, Kalyani, West Bengal, India.
BioData mining
|January 20, 2025
概括
这项研究开发了一种集体机器学习方法来对癌症突变致病性得分算法进行排名. 性能最好的算法准确地将驾驶员突变与乘客突变区分开来,改善了癌症基因优先级.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 准确识别癌症驱动突变对于患者管理至关重要.
- 现有的突变致病算法显示出显著的性能变化,即使对于已知的驱动程序.
- 突变评估中的不一致性阻碍了可靠的临床应用.
研究的目的:
- 开发一个整体机器学习 (ML) 方法来评估病原性和保护评分算法 (PCSAs).
- 根据PCSAs在头部和部状细胞癌 (HNSC) 中区分致病性驱动突变和良性乘客突变的能力来排名PCSAs.
- 确定最有效的PCSAs来优先考虑致癌突变.
主要方法:
- 利用了502名HNSC患者的数据集,这些患者的突变分类在299个高可信度癌症驱动基因中.
- 每个突变与41个PCSAs进行了注释.
- 采用后勤回归,随机森林和支持矢量机器ML算法,以递归特征消除来排名PCSA,使用排名-平均排序和排名-总和排序进行最终排名.
主要成果:
- 随机森林算法在区分驾驶员和乘客突变方面获得了最高的性能 (AUC-ROC 0.89).
- 通过等级总和分布确定的前11个PCSA显著优于剩余的30个PCSA (p < 2.22e-16).
- 排名最高的PCSA在HNSC,乳腺癌,肺癌和结直肠癌的验证队列中表现出强的表现.
结论:
- 综合ML方法有效地评估和排名PCSAs,以区分致病性驾驶员突变与良性乘客突变.
- 数据驱动的PCSA选择是必不可少的,因为一些流行的算法表现不佳.
- 经过验证的顶级PCSA为各种癌症类型的癌症突变分析和优先考虑提供了更可靠的工具.


