增强的混合视觉变压器,具有多尺度特征集成和补丁丢弃,用于面部表情识别
Nianfeng Li1, Yongyuan Huang1, Zhenyan Wang1
1College of Computer Science and Technology, Changchun University, No. 6543, Satellite Road, Changchun 130022, China.
Sensors (Basel, Switzerland)
|July 13, 2024
概括
本研究介绍了一种轻量级的混合视觉转换器,用于面部表情识别 (FER). 这种新的方法增强了特征提取,降低了计算成本,在基准数据集上实现了高精度.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 卷积神经网络 (CNN) 在面部表情识别 (FER) 中表现有前途,但在面对隐蔽和照明变化等现实世界的挑战时扎.
- CNNs主要使用本地空间特征,缺乏全球上下文和高效的计算复杂性精度平衡,以实现强大的FER.
- 现有的基于CNN的模型不足以在各种条件下准确有效地识别面部表情.
研究的目的:
- 开发一种轻量级且准确的面部表情识别方法,克服当前基于CNN的方法的局限性.
- 通过整合多个尺度的面部信息和更好地关注突出表达区域来增强特征提取.
- 通过一种新的注意力机制来降低计算复杂性,同时保持高的识别准确性.
主要方法:
- 提出了一种轻量级的面部表情识别方法,利用混合视觉转换器架构.
- 整合了改进的注意力模块,以捕捉多个尺度的面部特征并增强特征集成.
- 引入了补丁丢失 (PD) 模块,以模拟人类的视觉注意力,专注于区分特征和减少计算负载.
主要成果:
- 在RAF-DB数据集上达到86.51%,在FER2013数据集上达到近70%.
- 拟议的模型具有显著小的模型大小只有3.64 MB,表明高效率.
- 与现有的面部表情识别方法相比,在广泛的实验中表现出卓越的性能.
结论:
- 混合视觉转换器方法为推进面部表情识别提供了一个新的视角.
- 该方法通过捕捉更丰富,多尺度的特征,有效地解决了诸如遮蔽和照明变化等挑战.
- 轻量级的设计和高精度使得拟议的方法适合于现实世界的应用.


