深度学习用于癌症基因组中的生物标志物发现
Michaela Unger1, Chiara M L Loeffler1,2,3, Laura Žigutytė1
1Else Kroener Fresenius Center for Digital Health, University of Technology Dresden, Dresden, Germany.
bioRxiv : the preprint server for biology
|January 20, 2025
概括
深度学习从下一代测序 (NGS) 数据准确预测微卫星不稳定性 (MSI) 和同源重组缺陷 (HRD) 生物标志物. 这种方法绕过了复杂的特征工程,加速了精密瘤学的生物标志物发现.
科学领域:
- 基因组学就是基因组学.
- 生物信息学是一种生物信息学.
- 计算生物学 计算生物学
背景情况:
- 精密瘤学的基因组数据分析面临复杂的生物信息学管道和特征工程信息丢失的挑战.
- 传统方法限制了下一代测序 (NGS) 数据在生物标志物提取和发现方面的潜力.
研究的目的:
- 开发一个端到端的深度学习 (DL) 框架来分析NGS数据.
- 整合体质突变序列来预测微卫星不稳定性 (MSI) 和同源重组缺陷 (HRD) 生物标志物.
主要方法:
- 开发了一个多实例学习DL框架.
- 利用来自TCGA和CPTAC数据库的3,184名癌症患者的数据.
- 该框架整合了体质突变序列,以预测MSI和HRD状态.
主要成果:
- 在外部验证队列中,DL模型实现了MSI (0.98) 和HRD (0.80) 预测的高准确性.
- 在MSI和HRD预测方面,DL方法显著优于传统的机器学习方法.
- 可解释性技术证实,预测是基于生物学上有意义的特征.
结论:
- 深度学习可以在没有手动特征提取的情况下识别未经过的体质突变中的模式.
- 这种方法提高了精确瘤学中可操作的目标的检测.
- 它允许使用最小处理的数据开发基于NGS的生物标志物.


