将可变形的CNN和注意力机制集成到多尺度图形神经网络中,用于少数镜头图像分类
Yongmin Liu1,2, Fengjiao Xiao3,4, Xinying Zheng4,5
1School of Electronic Information and Physics, Central South University of Forestry Science and Technology, Changsha, 410004, China. T20040550@csuft.edu.cn.
Scientific reports
|January 8, 2025
概括
本研究介绍了CA-MFE算法,通过将多尺度的本地特征与注意力机制相结合,提高了少数拍摄图像的分类,以获得卓越的全球信息提取.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 图形神经网络 (GNN) 是有效的几个镜头的图像分类.
- 传统的使用固定卷积神经网络 (CNN) 的GNN特征提取在捕获全球图像特征方面存在局限性,原因是受限的受体场.
研究的目的:
- 提出一种新的算法,CA-MFE,用于改进少数拍摄图像的分类.
- 解决GNN中固定CNN在捕获全面和关键图像特征方面的局限性.
主要方法:
- CA-MFE算法在CNN中使用不同的卷积内核来提取多个规模的本地特征.
- 它集成了通道和空间注意力机制,用于并行处理以提取多维的全球特征,利用注意力机制的全球特征提取能力.
主要成果:
- 与基准模型相比,CA-MFE模型在迷你图像网 (1.07%) 和分层图像网 (1.33%) 数据集上显示了更好的分类准确性.
- 在5路5拍任务中,CA-MFE显著优于GNN,TPN和mini-ImageNet上的动态模型,精度分别提高了11.41%,7.42%和5.38%.
结论:
- 拟议的CA-MFE算法在少数拍摄图像分类任务中显示出卓越的性能.
- 这种方法有效地提取了本地和全球特征,克服了传统GNN特征提取器的局限性.


