使用修改的深度学习网络和混合优化进行手语识别:基于混合优化器 (HO) 的优化 CNNSa-LSTM 方法
Abdullah Baihan1, Ahmed I Alutaibi2, Mohammed Alshehri3
1Computer Science Department, Community College, King Saud University, 11437, Riyadh, Saudi Arabia.
Scientific reports
|October 31, 2024
概括
这项研究引入了一个新的深度学习模型,CNNSa-LSTM,用于准确的实时手语识别. 该模型实现了高性能,改善了聋人社区的沟通.
科学领域:
- 人工智能的人工智能
- 计算机视觉 计算机视觉
- 人与计算机的交互
背景情况:
- 语音障碍会阻碍口语和听觉交流.
- 实时手语识别 (SLR) 对于弥合沟通差距至关重要.
- 由于签名者的速度和持续时间的变化,开发准确和连续的单反相机模型仍然具有挑战性.
研究的目的:
- 开发一个先进的深度学习模型,用于准确和连续的手语识别.
- 为应对手语独立性和手语变化的挑战.
- 为了提高手语检测系统的性能.
主要方法:
- 使用视觉几何组16 (VGG16) 用于空间和几何特征的提取.
- 用于移动特征提取的光学流.
- 开发了一种新的深度学习模型,CNNSa-LSTM,它结合了卷积神经网络 (CNN),自我注意力 (SA) 和长短期记忆 (LSTM).
- 引入了一种混合优化器 (HO),集成了河马优化算法 (HOA) 和Pathfinder算法 (PFA).
主要成果:
- 提出的CNNSa-LSTM模型实现了98.7%的高精度.
- 证明了卓越的性能,灵敏度为98.2%,精度为98.5%.
- 实现了0.131的低文字错误率 (WER) 和0.114.11的信号错误率 (SER).
- 获得了98%的正常化折扣累积收益 (NDCG).
结论:
- 该CNNSa-LSTM模型有效地处理复杂的,顺序数据,用于手语识别.
- 混合优化方法提高了模型性能和准确性.
- 这项研究在实时手语检测技术方面取得了重大进展.


