使用机器学习预测血友病"A"中抑制剂的发展:在CHAMP数据集上使用AI对数据预处理,平衡和生物标志物识别的综合方法
Vikalp Kumar Singh1, Maheshwari Prasad Singh1
1Department of Computer Science and Engineering, National Institute of Technology, Patna, Bihar 800005, India.
Current pharmaceutical biotechnology
|April 23, 2025
概括
这项研究开发了一种AI模型,用于预测血友病A患者的第八因子抑制剂,达到97.37%的准确性. 该模型确定了个性化治疗策略的关键生物标志物.
科学领域:
- 计算生物学和生物信息学
- 遗传学和基因组学 遗传学和基因组学
- 医疗人工智能的人工智能
背景情况:
- 血友病A (HA) 是由第八因子 (FVIII) 缺乏引起的遗传性出血疾病.
- 一些HA患者在治疗期间会产生FVIII抑制剂,使治疗复杂化.
- 由于数据不平衡和复杂性,预测抑制剂的发展具有挑战性.
研究的目的:
- 开发一种机器学习/人工智能方法,用于预测HA患者的FVIII抑制剂.
- 为了确定与抑制剂发展相关的生物标志物.
- 为了解决数据不平衡,提高预测准确度.
主要方法:
- 在CHAMP数据集上进行了数据清理和编码.
- 随机过量采样 (ROS) 解决了数据不平衡.
- 多个机器学习模型 (随机森林,XGBoost等) 被训练并使用分层k折交叉验证和GridSearchCV.CV进行评估.
- 用SHAP (SHapley添加式扩展) 来进行可解释的AI分析.
主要成果:
- 随机森林模型实现了97.37%的准确性,超过了其他分类器.
- SHAP分析确定了关键的预测变量,包括临床严重程度,变异类型,外因子和HGVScDNA.
- 确定了与FVIII抑制相关的生物标志物.
结论:
- 这项研究在早期预测HA患者的FVIII抑制剂方面取得了突破.
- 综合方法 (预处理,随机森林,SHAP) 为个性化处理提供了一个新的解决方案.
- 这有助于为HA患者开发有针对性和有效的治疗方法.


