通过混合变压器模型高效准确地识别美国手语手势
1Department of Artificial Intelligence, Faculty of Artificial Intelligence, Egyptian Russian University, Badr City, 11829, Egypt. mohammed-alysalem@eru.edu.eg.
Scientific reports
|June 23, 2025
概括
本研究介绍了一种混合变压器-CNN模型,用于高效的手势识别. 该模型实现了高精度和速度,在计算机视觉任务 (如手语解释) 中表现优于现有方法.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人与计算机的交互
背景情况:
- 现有的手势识别方法面临着计算需求,远程关系理解,背景噪音敏感性和环境变化等挑战.
- 卷积神经网络 (CNN) 捕捉了局部细节,但错过了全球上下文,而视觉转换器 (ViTs) 模拟了全球上下文,但在计算上昂贵.
- 需要有效且准确的手势识别模型,适合实时应用.
研究的目的:
- 提出一种新的混合变压器-CNN模型用于手势识别.
- 结合CNN和Vision Transformers的优势,以提高性能和效率.
- 解决现有方法在准确性,速度和计算成本方面的局限性.
主要方法:
- 利用CNN层从手部区域提取详细的局部特征.
- 采用视觉转换器模块来捕获远程依赖和全球上下文信息.
- 实施了功能融合策略,使用元素智能的乘法来抑制噪音,并专注于关键的手势细节.
- 应用先进的数据增强,对比学习和域调整以提高稳定性.
主要成果:
- 在ASL Alphabet数据集上实现了99.97%的高精度.
- 演示了每秒110的处理速度.
- 仅需要5.0GFLOP,比传统的视觉变压器模型少得多.
- 混合模型有效地识别微妙的手动,同时保持计算效率.
结论:
- 拟议的混合变压器-CNN模型为手势识别提供了一个实用而强大的解决方案.
- 该模型在准确性,速度和计算效率之间实现了最佳平衡.
- 这项工作代表了手势识别技术在现实世界中应用的重要一步.


