一个智能实时系统用于连续的沙特手语的句子级识别,使用基于地标的时间建模
Adel BenAbdennour1, Mohammed Mukhtar1, Osama Almolike1
1Department of Electrical Engineering, Faculty of Engineering, Islamic University of Madinah, Madinah 42351, Saudi Arabia.
Sensors (Basel, Switzerland)
|March 14, 2026
概括
本研究介绍了实时沙特手语 (SSL) 识别系统,该系统将连续的标志翻译成口语阿拉伯语. 该系统达到94.2%的准确性,弥合了聋人和听力障碍者之间的沟通差距.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 在手语使用者和听力社区之间仍然存在沟通障碍,特别是在缺乏自动翻译的地区.
- 由于依赖沙特手语 (SSL) 和实时翻译系统的稀缺,沙特阿拉伯面临着扩大通信挑战.
研究的目的:
- 开发和评估一个实时,端到端的系统,用于持续的沙特手语 (SSL) 句子识别.
- 直接将认可的SSL句子映射到自然的口语阿拉伯语输出.
- 解决沙特阿拉伯聋人和听障人士的沟通缺口.
主要方法:
- 使用MediaPipe Holistic从视频流中提取时空地标特征.
- 采用双向长期短期记忆 (BiLSTM) 网络,在ArabSign (ArSL) 数据集上进行训练,以进行句子级分类.
- 整合了一个基于置的细分机制,以实现自然,不间断的签名,并使用Leave-One-Signer-Out (LOSO) 交叉验证进行评估.
主要成果:
- 使用LOSO协议实现了94.2%的平均句子级准确度,超过了基线 (92.07%).
- 证明了强大的泛化和实时性能,适合交互式应用程序.
- 基于LLM的可选改进阶段被整合到阿拉伯语输出中,以提高语言流性.
结论:
- 直接句子级建模,结合基于地标的功能和实时细分,为持续的SSL识别提供了有效的解决方案.
- 开发的系统显著改善了SSL用户的实时通信可访问性.
- 该方法为开发先进的手语翻译技术提供了实际基础.


