实时阿拉伯手语手语识别使用混合深度学习模型
Talal H Noor1, Ayman Noor1, Ahmed F Alharbi1
1Department of Computer Science, College of Computer Science and Engineering, Taibah University, Madinah 42353, Saudi Arabia.
Sensors (Basel, Switzerland)
|June 19, 2024
概括
这项研究开发了一种深度学习模型来识别阿拉伯手语 (ArSL),解决沙特阿拉伯听力受损社区的口译员短缺问题. 混合CNN-LSTM模型实现了高精度,提高了通信可访问性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 对于聋人来说,手语至关重要,但口译员短缺,特别是沙特阿拉伯的阿拉伯手语 (ArSL),限制了获得服务的机会.
- 这种可访问性差距不成比例地影响听力受损人口,阻碍他们参与公共生活.
- 需要技术解决方案来弥合聋人社区面临的沟通障碍.
研究的目的:
- 开发和评估一个基于深度学习的系统来识别阿拉伯手语 (ArSL).
- 为解决阿塞拜疆语音局的人口口口译员的严重短缺问题,从而提高沙特阿拉伯听力障碍者沟通的可访问性.
- 利用人工智能为有听力障碍的人创造一个更具包容性的环境.
主要方法:
- 这是一个混合深度学习模型,它结合了卷积神经网络 (CNN) 来提取空间特征,以及长期短期记忆 (LSTM) 网络来进行符号语言手势的时空分析.
- 开发一个自定义的数据集,包括10个静态ARSL手势的4000个图像和10个动态ARSL手势的500个视频.
- 在创建的ArSL数据集上对混合CNN-LSTM模型的培训和评估.
主要成果:
- 在从ArSL数据中提取空间特征时,CNN分类器实现了94.40%的准确性.
- 在捕捉ArSL的顺序和时间方面,LSTM分类器显示了82.70%的准确性,包括手的运动.
- 混合模型在识别静态和动态ArSL手势方面表现出了有希望的表现.
结论:
- 拟议的混合深度学习模型提供了一个可行的技术解决方案,以缓解阿拉伯手语口译员的短缺.
- 这种方法显著提高了沙特阿拉伯听力受损社区的通信可访问性.
- 该研究代表了促进包容性和通过人工智能驱动的沟通工具改善聋人生活质量的重大进展.


