相关实验视频
Updated: May 28, 2025

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
8.9K
通过多层融合和注意力机制增强食物图像识别
Zengzheng Chen1, Jianxin Wang1, Yeru Wang2
1School of Information, Beijing Forestry University, Beijing 100083, China.
Foods (Basel, Switzerland)
|February 13, 2025
概括
这项研究引入了一种新的多层次注意特征融合网络 (MAF-Net),用于使用计算机视觉准确识别食品. MAF-Net模型显著提高了对基准数据集的细粒度视觉分类准确性.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 食品识别技术对于营养监测,智能服务和食品质量控制至关重要.
- 食品图像的细粒度视觉分类 (FGVC) 具有挑战性,因为它具有很高的类间相似性和类内变异性.
- 现有的深度学习模型往往忽略了食品图像识别中的浅层,详细的特征.
研究的目的:
- 开发一个先进的深度学习模型,用于准确的食物图像识别.
- 解决FGVC复杂局部特征捕捉现有方法的局限性.
- 提高食品识别系统的概括能力和准确性.
主要方法:
- 提出了一个多层次的注意力特征融合网络 (MAF-Net),利用卷积神经网络 (CNN) 来绘制不同阶段的特征图.
- 实施了一种自我注意机制,以识别和整合本地特征,增强数据增强.
- 引入了子类中心损失 (SCloss),用于标签平滑和最小化类内差异,以及KL-分歧用于多尺度特征度.
主要成果:
- 获得了高的Top-1准确率:CETH Food-101上达到90.22%,Vireo Food-172上达到89.86%,UEC Food-100上达到90.61%.
- 在Vireo Food-172数据集上,在Top-5准确度方面超越现有方法.
- 在UEC Food-100数据集上,在Top-1准确度方面表现卓越.
结论:
- 拟议的MAF-Net有效地捕捉了深层和浅层特征,以改善食品图像识别.
- 在微细的视觉分类任务中,MAF-Net和SCloss提高了模型的概括性和准确性.
- 该模型对营养,食品服务和行业质量控制等现实应用具有重大前景.

