优化特征选择和机器学习算法用于早期检测糖尿病前风险:比较研究
Mahmoud B Almadhoun1, M A Burhanuddin1
1Fakulti Kecerdasan Buatan dan Keselamatan Siber, Universiti Teknikal Malaysia, Melaka, Durian Tunggal, 75450, Malaysia, 60 194807552.
JMIR bioinformatics and biotechnology
|December 4, 2025
概括
机器学习模型,特别是随机森林和XGBoost,可以有效预测糖尿病前期风险. 关键预测因素包括BMI,年龄和胆固醇水平,使心血管和脏健康的早期干预成为可能.
科学领域:
- 计算生物学和生物信息学
- 临床信息学和决策支持.
- 预防医学和公共卫生
背景情况:
- 糖尿病前期意味着在2型糖尿病之前的中间代谢阶段.
- 它会增加严重并发症的风险,包括心血管疾病和功能衰竭.
- 早期识别糖尿病前期对于及时干预以防止糖尿病进展至关重要.
研究的目的:
- 为了比较各种机器学习 (ML) 算法用于糖尿病前期检测的预测性能.
- 使用ML技术识别与糖尿病前期相关的关键临床预测因素.
- 为了提高临床应用的ML模型的解释性和准确性.
主要方法:
- 评估了多个ML模型:随机森林,XGBoost,SVM和KNN在4743个人的数据集上.
- 采用LASSO回归和PCA来进行特征选择和缩小维度.
- 使用超参数调整 (RandomizedSearchCV,GridSearchCV) 和SMOTE进行模型优化和处理数据不平衡.
- 应用SHAP分析用于模型不可知特征重要性评估.
主要成果:
- 随机森林获得了0.9117的最高交叉验证ROC-AUC,证明了强大的概括.
- XGBoost在区分正常状态和糖尿病前状态方面也表现出强的表现.
- SHAP分析确定了BMI,年龄,HDL和LDL胆固醇作为主要预测因素.
- 超参数调整显著改善了模型性能,例如,SVM ROC-AUC从0.813增加到0.863.
结论:
- 优化的ML模型,特别是随机森林和XGBoost,对于早期糖尿病前期风险评估是有效的.
- 整合SHAP,LASSO和PCA可以提高临床决策支持系统的模型透明度.
- 未来的研究应该专注于在各种环境中验证这些模型,并纳入额外的生物标志物,以提高个性化预防护理的准确性.


