从电子健康记录数据中推断高脂肪饮食模式,使用机器学习.
Ya-Yun Yeh1, Hsin-Yueh Lin1, Jingchuan Guo2,3
1Department of Pharmaceutical Outcomes and Policy, University of Florida, College of Pharmacy, Gainesville, FL 32610, United States.
JAMIA open
|January 14, 2026
概括
机器学习可以从电子健康记录中识别高脂肪饮食,改善饮食疾病研究. 这种方法从可用的变量推断出饮食模式,为精准医学提供了一个可扩展的工具.
科学领域:
- 计算流行病学计算流行病学
- 生物医学信息学是生物医学信息学.
- 营养科学 营养科学
背景情况:
- 电子健康记录 (EHR) 缺乏详细的饮食信息,阻碍了饮食疾病研究.
- 为饮食模式开发可计算的表型对于利用EHR数据至关重要.
研究的目的:
- 开发机器学习 (ML) 可计算的表型,以使用标准EHR变量识别高脂肪饮食 (HFD).
- 评估ML衍生的饮食表型的流行病学有效性和临床相关性.
主要方法:
- 利用了国家健康和营养检查调查 (NHANES) 数据 (1999-2020年) 与24小时的饮食回忆作为基本真相.
- 训练有素的ML模型 (极端梯度提升,后勤回归,随机森林) 使用EHR兼容的变量.
- 使用F1分数,回忆和精度评估模型性能;通过比较癌症关联来评估临床相关性.
主要成果:
- ML模型有效地对HFD进行了分类,随机森林模型的F1得分为0.79,截止值为20.
- HFD的主要预测因素包括种族/种族,甘油三,肥胖指标和代谢面板结果.
- ML衍生的表型重现了已知的饮食与疾病的关系,证明了流行病学上的有效性.
结论:
- 饮食模式可以通过使用基于ML的表型化从常规可用的EHR变量推断出来.
- 这种可扩展的方法可以将饮食信息整合到基于EHR的研究和精准医学中.
- 这些已识别的预测因素与连接饮食,肥胖,新陈代谢和癌症风险的生物学途径保持一致.


