机器学习模型用于糖尿病检测的通用性:使用北欧小岛移植和PIMA数据集进行的一项研究
Dinesh Chellappan1, Harikumar Rajaguru2
1Department of Electrical and Electronics Engineering, KPR Institute of Engineering and Technology, Coimbatore, Tamil Nadu, 641 407, India. dinesh.chml@gmail.com.
Scientific reports
|February 6, 2025
概括
这项研究通过混合机器学习提高了糖尿病预测的准确性. 结合人工蜂群 (ABC) 和粒子群优化 (PSO) 进行特征提取和大象群优化 (EHO) 进行选择,显著改善了早期糖尿病检测.
科学领域:
- 计算生物学是一种计算生物学.
- 生物医学信息学是生物医学信息学.
- 机器学习在医疗保健中的应用.
背景情况:
- 糖尿病是一种重大的全球健康挑战,需要准确的早期检测以有效管理患者.
- 通过利用先进的计算技术来提高预测准确度,可以增强传统的诊断方法.
研究的目的:
- 调查混合机器学习方法用于增强糖尿病预测的有效性.
- 评估新型特征提取和选择方法对基因表达和PIMA数据集的性能.
主要方法:
- 采用混合特征提取技术,结合人工蜂群 (ABC) 和粒子集群优化 (PSO).
- 利用了元启发式特征选择算法,包括波搜索 (HS),龙算法 (DFA) 和大象群集算法 (EHA).
- 在北欧岛屿移植计划 (NITP) 和PIMA印度糖尿病数据集 (PIDD) 上评估了SVM-RBF,BLDA和GMM等分类器.
主要成果:
- 结合ABC-PSO特征提取与EHO特征选择,NITP数据集的准确率达到97.14%,PIDD数据集的准确率达到98.13%.
- 这种混合方法显著优于单独使用ABC或其他特征选择算法的方法.
- 与使用所有可用的基因相比,实现了更高的分类准确性,证明了选定的信息特征的有效性.
结论:
- 拟议的混合机器学习框架,集成先进的特征提取和选择,证明了糖尿病预测的强大和卓越性能.
- 这些发现强调了元启发算法在识别早期糖尿病检测关键生物标志物的潜力.
- 数据集中的参数值的一致性凸显了开发方法的概括性和稳定性.


