利用以注意力驱动的混合深度学习与组合特征表示来精确识别手语,以帮助聋人和语言障碍者
Abrar Almjally1,2, Shabbab Ali Algamdi3, Nasser Aljohani4
1Department of Information Technology, College of Computer and Information Sciences, Imam Mohammad Ibn Saud Islamic University (IMSIU), Riyadh, 13318, Saudi Arabia. aamjally@imamu.edu.sa.
Scientific reports
|September 1, 2025
概括
这项研究引入了一个先进的深度学习模型,用于准确的手语识别 (SLR),达到98.10%的准确性. 该模型通过提高实时手势识别来增强听力或语言障碍者的沟通能力.
科学领域:
- 计算机科学
- 人工智能
- 人与计算机的交互
背景情况:
- 标语识别 (SLR) 对于聋人社区的沟通可访问性至关重要.
- 现有的SLR深度学习模型在准确性和实时性能方面面临挑战.
- 标记语言的复杂手动和非手动特征的识别.
研究的目的:
- 提出一个以注意力驱动的混合深度学习模型,用于精确的手语识别 (AHDLMFF-ASLR).
- 增强实时手势识别以改善聋人的沟通.
- 与现有模型相比,实现更高的手语识别精度.
主要方法:
- 使用对比度有限的自适应基因图平衡 (CLAHE) 和边检测 (CED) 进行图像预处理.
- 集成Swin变压器 (ST),ConvNeXt-Large和ResNet50模型的特征提取.
- 使用混合卷积神经网络和双向长期短期记忆与注意 (C-BiL-A) 技术进行分类.
主要成果:
- 在SL数据集上,AHDLMFF-ASLR模型达到98.10%的高精度.
- 与现有的手语识别模型相比,其表现优越.
- 有效地整合先进的深度学习架构来进行特征提取和分类.
结论:
- AHDLMFF-ASLR模型显著提高了手语识别的准确性和效率.
- 这种模式为聋社区提供了一个有前途的解决方案.
- 拟议的混合深度学习方法为复杂的视觉识别任务提供了强大的框架.


