可解释的机器学习模型用于使用临床实验室数据预测结肠直肠癌
Rui Li1, Xiaoyan Hao1, Yanjun Diao1
1Department of Clinical Laboratory Medicine, Xijing Hospital, Air Force Medical University, Xi'an, China.
概括
使用常规实验室数据的机器学习模型对结直肠癌 (CRC) 风险预测具有很高的准确性,优于便隐性血液检测 (FOBT) 和癌胚抗原 (CEA) 等传统测试. 结合便miR-92a进一步提高了诊断性能.
科学领域:
- 在瘤学瘤学.
- 生物医学信息学 生物医学信息学
- 临床诊断 临床诊断 临床诊断
背景情况:
- 结直肠癌 (CRC) 的早期诊断仍然是一个重大的临床挑战.
- 目前的诊断生物标志物,如癌胚抗原 (CEA) 和便隐性血液检测 (FOBT) 有局限性.
- 机器学习 (ML) 提供了使用复杂数据集改进风险预测的潜力.
研究的目的:
- 开发和评估用于预测CRC风险的ML模型.
- 将ML模型的诊断性能与已确定的生物标志物进行比较.
- 识别有助于CRC诊断的关键实验室特征.
主要方法:
- 从2013年至2023年间,对31539名受试者 (健康对照,多患者,CRC患者) 的实验室数据进行了回顾性分析.
- 开发和比较用于分类任务的五种ML算法 (AdaBoost,XGBoost,DT,LR,RF).
- 使用沙普利添加剂解释 (SHAP) 的特征重要性分析和便 miR-92a 纳入的评估.
主要成果:
- XGBoost模型实现了高AUC (0.966为HC与CRC,0.881为多与CRC),表现优于CEA和FOBT.
- 该模型成功识别了CEA或FOBT负的CRC患者.
- 发现的关键特征包括FOBT,CEA,淋巴细胞百分比 (LYMPH%) 和血红素 (HCT).
结论:
- 使用常规实验室数据的ML模型显示,与传统生物标志物相比,CRC的诊断准确度更高.
- 开发的模型可以帮助早期检测CRC,包括在标准测试中错过的情况.
- 通过整合便miR-92a水平,可以进一步提高诊断能力.


