在德黑兰的脂质和葡萄糖研究中,应用了一般化的线性混合效应随机森林来识别糖尿病前期的风险因素
Maryam Karimi Ghahfarokhi1, Farid Zayeri1, Davood Khalili2
1Department of Biostatistics, School of Allied Medical Sciences, Shahid Beheshti University of Medical Sciences, Tehran, Iran.
Scientific reports
|November 21, 2025
概括
一个新的混合模型,通用混合效应随机森林 (GMERF),在使用纵向数据预测糖尿病前期时表现优越,与传统的统计和机器学习模型相比. 确定的关键风险因素包括腰部与部的比例和年龄.
科学领域:
- 医疗信息学 医疗信息学
- 生物统计学 生物统计学
- 医疗保健中的机器学习
背景情况:
- 糖尿病前期意味着血糖升高,是糖尿病的前体,通常无症状,但会导致器官损伤.
- 纵向数据具有固有的依赖性,需要专门的模型进行准确的分析.
- 传统的通用线性混合模型 (GLMM) 处理随机效应,但假设线性,而随机森林 (RF) 捕获非线性,但忽略重复测量.
研究的目的:
- 为了在纵向数据中比较通用线性混合模型 (GLMM),随机森林 (RF) 和通用混合效应随机森林 (GMERF) 对于糖尿病前期检测的预测性能.
- 使用这些模型识别与糖尿病前期发展相关的关键风险指标.
主要方法:
- 分析了一组5361名20岁以上的成年人,分析了32个变量.
- 应用了三个预测模型:GLMM (统计,处理随机效应),RF (基于树的机器学习) 和GMERF (混合,结合随机效应和基于树的非线性).
- 使用标准指标评估模型性能,包括ROC曲线下的面积 (AUC).
主要成果:
- GMERF表现出最高的预测准确度,达到0.74的AUC,优于GLMM (0.70) 和RF (0.63).
- 由GMERF确定的顶级预测因素是腰与部比 (WHR),年龄,腰围,甘油三水平和腰与身高比 (WHtR).
- 在GMERF和RF模型中,WHR是最重要的预测因子;大多数已识别的预测因子在GLMM模型中也是最重要的.
结论:
- 混合GMERF模型通过有效处理随机效应和非线性关系,在纵向数据集中提供超级预测糖尿病前期.
- 整合纵向数据结构可以提高预测的准确性和可靠性.
- 关键的人类测量和代谢因素,如WHR,年龄和甘油三水平是糖尿病前期风险的关键指标.
更多相关视频
07:31Implementation of a Real-Time Psychosis Risk Detection and Alerting System Based on Electronic Health Records using CogStack
Published on: May 15, 2020
7.5K
03:05Influence of Emotional Factors on the Efficacy of Acupuncture Treatment for Overweight Complicated with Hyperlipidemia: A Retrospective Cohort Study
Published on: November 21, 2025
463
