SSTA-ResT:软时空注意力ResNet转换器用于阿根廷手语识别
Xianru Liu1, Zeru Zhou1, E Xia1
1School of Automation, Central South University, Changsha 410083, China.
Sensors (Basel, Switzerland)
|September 13, 2025
概括
本研究介绍了SSTA-ResT,这是一个用于标语识别的新框架,有效地捕获动态和时间信息. 这种先进的模型显著提高了聋人和听觉人士的准确性和包容性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 标语识别技术对于弥合沟通差距和促进社会包容性至关重要.
- 使用静态图像的传统方法无法捕捉手语的动态性质,限制了现实世界的应用.
- 开发强大的手语识别系统对于提高聋人社区的可访问性至关重要.
研究的目的:
- 提出一个有效的手语识别框架,解决传统方法的局限性.
- 增强对动态和时间信息的捕获,这对于准确的手语解释至关重要.
- 通过促进聋人和听力人士之间更好的沟通来改善社会包容性.
主要方法:
- SSTA-ResT框架集成ResNet用于空间特征提取.
- 一个软时空注意 (SSTA) 模块增强了双路径表示和时空关联.
- 变压器编码器用于在手语视频中捕捉远程时间依赖.
主要成果:
- 在LSA64阿根廷手语数据集上,SSTA-ResT框架实现了96.25%的准确性,97.18%的精度,F1得分为0.9671.
- 在所有评估的指标中,绩效指标超过了现有方法.
- 该模型保持较低的参数数量 (11.66 M),表示效率.
结论:
- SSTA-ResT框架证明了手语视频识别的卓越有效性和实用性.
- 集成ResNet,SSTA和变压器编码器为捕捉复杂的手语动态提供了强大的解决方案.
- 这一进步具有显著的潜力,可以改善聋人沟通的可访问性和社会包容性.
