相关实验视频
Updated: Jan 15, 2026

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
9.9K
3个大型语言模型的性能评估,用于从食物图像中估计营养含量
Jonatan Fridolfsson1,2, Emma Sjöberg3, Meri Thiwång3
1Center for Lifestyle Intervention, Institute of Medicine, University of Gothenburg, Gothenburg, Sweden.
Current developments in nutrition
|October 13, 2025
概括
像ChatGPT和Claude这样的大型语言模型显示了自动饮食分析的前景,估计食物图像中的营养含量与传统方法的准确性相似. 然而,它们低估了大份量,并且还不够精确,无法在临床上使用.
科学领域:
- 人工智能的人工智能
- 营养科学 营养科学
- 计算机视觉 计算机视觉
背景情况:
- 传统的饮食评估方法受到回忆偏差和估计错误的限制.
- 人工智能,特别是多模式大语言模型 (LLM),为自动化从食物图像中进行营养分析提供了潜力.
研究的目的:
- 评估和比较三个领先的LLM (ChatGPT-4o,Claude 3.5 Sonnet和Gemini 1.5 Pro) 在估计食品重量,能量和宏观营养素含量的标准化食品照片中的表现.
主要方法:
- 分析了52张标准化的食品照片 (单个成分和餐) 在三个份量大小.
- 模型使用可见的餐具和盘子作为营养含量估计的尺寸参考.
- 绩效指标包括平均绝对百分比误差 (MAPE) 和Bland-Altman分析与直接称重和数据库值相比.
主要成果:
- 在重量和能量估计方面,ChatGPT和Claude的准确性相似 (MAPE ~36%),优于Gemini (MAPE 64.2%-109.9%).
- 模型估计和参考值之间的相关性在ChatGPT和Claude (0.65-0.81) 中高于Gemini (0.58-0.73).
- 所有模型都表现出系统的低估,随部分大小的增加而增加.
结论:
- 聊天GPT和Claude提供了潜在的饮食监测工具,与自我报告方法相比,但用户负担较低.
- 一般用途的LLM还不适合在临床或体育环境中进行精确的饮食评估,原因是系统的低估和宏观营养素的变化.

