对COVID-19数据集特征选择技术的比较分析
Farideh Mohtasham1, MohamadAmin Pourhoseingholi2, Seyed Saeed Hashemi Nazari3
1Gastroenterology and Liver Diseases Research Center, Research Institute for Gastroenterology and Liver Diseases, Shahid Beheshti University of Medical Sciences, Tehran, Iran. f-mohtasham@sbmu.ac.ir.
Scientific reports
|August 11, 2024
概括
机器学习和特征选择改善了COVID-19死亡率预测. 一个混合Boruta-VI模型与随机森林准确地确定了关键的风险因素,如年龄和氧和.
科学领域:
- 医疗信息学 医疗信息学
- 计算生物学 计算生物学
- 流行病学 流行病学
背景情况:
- 机器学习 (ML) 对于早期发现疾病至关重要.
- 特性选择 (FS) 算法通过识别关键变量来提高预测模型的准确性.
研究的目的:
- 评估各种FS方法来预测COVID-19死亡率.
- 确定COVID-19患者不良结果的关键预测因素.
主要方法:
- 对4778名COVID-19患者的回顾性分析.
- 利用了115个临床,实验室和人口统计特征.
- 与过器,嵌入式和混合FS方法的13ML模型进行了比较.
主要成果:
- 混合Boruta-VI与随机森林实现了卓越的性能 (精度:0.89,F1:0.76,AUC:0.95).
- 确定了年龄,氧和度,白蛋白,中性粒细胞,血小板和功能标志物作为关键预测因素.
结论:
- 先进的FS技术和ML模型可以显著提高早期疾病检测.
- 研究结果支持改善COVID-19患者管理的临床决策.


