台湾痛风风险因素生物库:一种机器学习方法
Yu-Ruey Liu1,2,3, Oswald Ndi Nfor4, Ji-Han Zhong4
1College of Information and Electrical Engineering, Asia University, Taichung, 413, Taiwan.
Journal of inflammation research
|December 2, 2024
概括
机器学习模型,特别是随机森林和渐变增强,使用临床和遗传因素准确预测痛风风险. 尿酸和性别是关键预测因素,突出了改善临床痛风评估的潜力.
科学领域:
- 计算生物学是一种计算生物学.
- 医疗信息学医学信息学
- 遗传学 遗传学 是一个
背景情况:
- 痛风是一种常见的炎症性关节炎,由高尿血症引起.
- 准确预测痛风风险对于早期干预和管理至关重要.
研究的目的:
- 用机器学习算法评估台湾生物库人口中痛风风险.
- 为了确定痛风的关键风险因素.
- 评估各种机器学习模型对痛风的预测性能.
主要方法:
- 分析了台湾生物银行的88,210个人的数据.
- 五种机器学习模型的应用:贝叶斯网络,随机森林,梯度提升,物流回归和神经网络.
- 对性别和年龄进行倾向分数匹配,以创建一个由38676人组成的平衡样本 (19338例痛风病例,19338例对照).
- 评估使用80%的培训和20%的测试组分.
主要成果:
- 尿酸和性别被确定为最重要的痛风风险因素.
- 随机森林 (RF) 和梯度增强 (GB) 模型表现出高性能.
- 射频达到了0.986-0.987的曲线下面面积 (AUC),0.945-0.947的灵敏度和0.998-0.999.99的特异性.
- GB显示了可比的结果,AUC约为0.987-0.988,灵敏度为0.944-0.950,特异性为0.995-0.999.
- 无论是RF还是GB都获得了高F1分数 (0.971-0.972).
结论:
- 随机森林和梯度增强模型在预测痛风方面表现出极高的准确性.
- 将遗传数据与临床因素相结合,可以进一步提高痛风预测能力.
- 这些发现支持机器学习的临床应用,以改善痛风风险评估.


