评估人工智能为模拟糖尿病个人资料生成的餐饮计划:基于指南的三种语言模型的比较
Hatice Merve Bayram1, Sedat Arslan2, Arda Ozturkcan1
1Department of Nutrition and Dietetics, Faculty of Health Sciences, Istanbul Gelisim University, Istanbul, Turkiye.
Journal of evaluation in clinical practice
|October 7, 2025
概括
大型语言模型 (LLM) 显示出产生2型糖尿病 (T2DM) 饮食计划的潜力,但需要进一步开发和专家监督才能在临床上使用.
科学领域:
- 医疗保健中的人工智能
- 营养科学 营养科学
- 糖尿病管理 糖尿病管理
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医疗保健应用.
- 饮食管理对于2型糖尿病 (T2DM) 是至关重要的.
- 评估LLM在产生医学营养治疗 (MNT) 的表现是必不可少的.
研究的目的:
- 为了比较ChatGPT-4.1,Grok-3和DeepSeek在创建与T2DM一致的饮食计划中的性能.
- 评估LLM生成的营养准确性和准则遵守计划.
- 确定在MNT中LLM应用的局限性和潜在改进.
主要方法:
- 使用24个虚拟患者配置文件进行合成模拟.
- 在土耳其语中,LLM被要求生成为期3天的饮食计划.
- 输出被评估为能量,巨量营养素和微量营养素的准确性,准则的遵守,以及与营养护理过程 (NCP) 的一致性.
主要成果:
- 聊天GPT-4.1显示了高能耗对齐,但高估了脂肪. 格洛克-3的能量准确性优越,但错过了微量营养素的目标. DeepSeek调整了蛋白质,但提供了不足的碳水化合物.
- 没有LLM完全遵守NCP,特别是在诊断和监测方面.
- 观察到频繁的LLM"幻觉"和缺乏临床背景;提取增强生成 (RAG) 被建议改进.
结论:
- 在模拟的T2DM场景中,LLM可以生成基线饮食指导.
- 目前的LLM绩效并不等同于营养师领导的护理,需要专家监督.
- 在临床应用LLMs用于MNT之前,需要整合RAG和进一步验证.


