开发和验证基于机器学习的框架,用于评估与代谢相关的脂肪肝疾病风险
Jiale Deng1, Weidong Ji1, Hongze Liu1
1Zhongshan School of Medicine, Sun Yat-sen University, 74 Zhongshan 2nd Road, Yuexiu District, Guangzhou, 510080, Guangdong, China.
BMC public health
|September 18, 2024
概括
这项研究开发了一种最佳的机器学习模型,用于选中国的代谢相关脂肪肝病 (MAFLD). CatBoost算法实现了高精度,识别了早期检测和预防的关键风险因素.
科学领域:
- 公共卫生 公共卫生
- 机器学习在医学中的应用
- 流行病学 流行病学
背景情况:
- 现有的代谢相关脂肪肝疾病 (MAFLD) 的预测模型对于全人口查是不够的.
- 需要一个有效的查模型来识别中国的高风险个人.
- 人口健康检查数据为开发此类模型提供了宝贵的资源.
研究的目的:
- 将八种不同的机器学习 (ML) 算法进行比较,以开发MAFLD的最佳查模型.
- 利用来自中国的人口健康数据,识别MAFLD高风险个体.
- 为MAFLD预测和预防提供一个新的视角.
主要方法:
- 利用了中国西北部5,171,392名成年人的体检数据 (2021年).
- 用于特征选择的使用最小绝对收缩和选择运算符 (LASSO) 回归.
- 开发并比较基于树的 (例如,随机森林,CatBoost) 和替代的ML模型 (k-NN,ANN),包括类平衡和超参数调整.
主要成果:
- CatBoost算法表现出卓越的性能,接收器操作特征曲线 (AUC) 下的面积为0.862.
- 确定的MAFLD查的关键预测因素包括年龄,BMI,甘油三,禁食血葡萄糖和腰围.
- 最重要的13个关键因素还包括脂质特征,血压,种族和心血管疾病.
结论:
- 来自中国的大型多民族数据集被用来建立一个准确的MAFLD风险查模型.
- 开发的模型,特别是使用CatBoost算法,为MAFLD风险预测提供了更高的准确性.
- 这项研究为预测和预防人口中MAFLD提供了一种新方法.


