在10种癌症类型中使用电子健康记录和遗传数据开发和评估泛癌症预测生存模型
Jurgita Gammall1,2, Alvina G Lai3
1Institute of Health Informatics, University College London, 222 Euston Road, London, NW1 2DA, UK. jurgita.gammall.20@ucl.ac.uk.
Discover oncology
|May 12, 2025
概括
这项研究使用患者数据和遗传信息开发了用于癌症生存预测的机器学习模型. 模型表现良好,基因数据改善了对某些癌症的预测,帮助治疗决策.
科学领域:
- 在瘤学瘤学.
- 生物信息学是一种生物信息学.
- 机器学习 机器学习
背景情况:
- 癌症发病率上升需要先进的分析方法.
- 大规模医疗数据的可用性为改善癌症分析提供了机会.
- 准确的癌症预后对于有效的患者管理和治疗至关重要.
研究的目的:
- 开发和评估十种常见癌症类型的预后癌症生存模型.
- 为了比较各种机器学习算法在癌症预后中的性能.
- 评估遗传信息的附加值,并改善模型可解释性,以便在临床采用.
主要方法:
- 利用了来自十种癌症类型的9977名癌症患者的数据.
- 综合遗传数据 (100,000个基因组项目) 与临床,人口和医院数据.
- 开发并比较了四种机器学习算法:弹性网Cox,随机生存森林,梯度增强生存和DeepSurv.
主要成果:
- 模型的C指数在60% (膀癌) 到80% (结质瘤) 之间,平均为72%.
- 机器学习算法表现类似,DeepSurv的表现略低.
- 遗传数据增强了子宫内膜,质瘤,卵巢和前列腺癌的模型性能.
结论:
- 开发了强大的机器学习模型来预测癌症生存率.
- 证明了将遗传数据整合到预后模型中的实用性.
- 确定了关键的预后特征,包括年龄,阶段,TP53突变和瘤突变负担.


