通过将基因组特征与质量指标相结合,改善虚假阳性单核酸变异的过
Kazım Kıvanç Eren1, Esra Çınar2, Hamza U Karakurt2,3
1Department of Computer Engineering, Kocaeli University, Kocaeli 41000, Turkey.
Bioinformatics (Oxford, England)
|November 29, 2023
概括
本研究引入了一种机器学习模型,用于准确识别基因组数据中的假阳性 (FP) 变异,通过整合基因组特征和质量指标来提高变异调用准确度,以获得更好的生物洞察力.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 机器学习 机器学习
背景情况:
- 测序和生物信息学中的技术错误可能导致假阳性 (FP) 变异.
- 当前的质量指标过方法可能会错过复杂的特征关系,并减少真正的阳性变异检测.
研究的目的:
- 开发用于FP变体识别的机器学习模型.
- 整合基因组特征和质量指标,以改善FP检测.
- 纳入生物见解的特征解释性.
主要方法:
- 使用基因组特征开发了一个基于森林的随机模型.
- 应用了成本敏感的培训,以尽量减少对真实变体的错误分类.
- 该模型与现有的FP检测系统 (VEF,GATK-CNN,GARFIELD) 相比进行了评估.
主要成果:
- 拟议的模型显著改善了FP变体的识别.
- 新引入的基因组特征对预测准确性产生了重大影响.
- 该模型显示了对真实变异的错误分类的稳定性和适应FP分布变化的适应性.
结论:
- 机器学习模型为FP变种检测提供了强大的和可解释的方法.
- 这种方法提高了基因组研究中变异调用的准确性.
- 该软件可用于重新培训和在各种实验环境中应用.
更多相关视频
11:02Detecting Somatic Genetic Alterations in Tumor Specimens by Exon Capture and Massively Parallel Sequencing
Published on: October 18, 2013
19.5K
09:33Author Spotlight: Finding New Therapeutic Targets for Malignant Peripheral Nerve Sheath Tumor Through Genome-Scale shRNA Screens
Published on: August 25, 2023
1.2K
