相关实验视频
Updated: May 30, 2025

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
8.9K
基于可解释的CNN和视觉变压器的实时食物识别方法
Kintoh Allen Nfor1, Tagne Poupi Theodore Armand2, Kenesbaeva Periyzat Ismaylovna1
1Department of Computer Engineering, Inje University, Gimhae 50834, Republic of Korea.
Nutrients
|January 25, 2025
概括
这项研究结合了卷积神经网络 (CNN) 和视觉转换器 (ViT) 进行先进的食物图像识别. 混合模型在分类各种食品方面实现了卓越的准确性,增强了营养分析.
科学领域:
- 人工智能的人工智能
- 计算机视觉 计算机视觉
- 营养科学 营养科学
背景情况:
- 食品图像识别对于计算性美食和营养平台至关重要.
- 卷积神经网络 (CNN) 在局部特征提取方面表现出色,但在远程依赖方面却很难.
- 需要转换器架构来捕捉全球背景,这对于准确的食品分类至关重要.
研究的目的:
- 使用混合CNN-变压器方法开发一个强大的食品图像分类模型.
- 通过处理食品图像中的本地和全球特征来提高准确性.
- 为了提高食品图像识别,进行精确的营养分析.
主要方法:
- 使用混合模型,将 RestNet50 (CNN) 结合在本地功能和视觉变压器 (ViT) 进行全球功能.
- 在ViT编码器中使用多头注意力和预训练的权重进行分类.
- 整合可解释的人工智能技术 (grad-CAM,LIME),以确保模型的透明度.
主要成果:
- 在五个不同的食品图像数据集中,与最先进的方法相比,实现了优越的性能.
- 通过利用互补特征,证明了增强的通用性和稳定性.
- 将模型集成到一个移动应用程序中,用于实时识别食物和跟踪饮食.
结论:
- 混合CNN-ViT模型显著提升了食品图像识别能力.
- 这项研究可以在个性化营养和医疗保健方面实现实际应用.
- 突出了人工智能在改变营养科学和饮食平台方面的潜力.

