基于深度学习的方法结合了手动和非手动功能,用于手语识别
Haifa Harrouch1, Lamia Trabelsi1, Maher Jebali2
1Computer Science Department, Applied College, University of Ha'il, PO Box 2440, Hail City, 55476, Saudi Arabia.
Scientific reports
|December 18, 2025
概括
这项研究将3D手骨架数据集成到深度学习中,用于从RGB视频中识别手语. 这种方法显著提高了基准数据集的识别准确性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 由于深度信息有限,从RGB视频中识别手语具有挑战性.
- 现有的方法往往缺乏强大的3D手姿势估计能力.
- 利用3D骨数据可以增强对复杂手势的理解.
研究的目的:
- 调查使用3D手骨信息用于手语识别的好处.
- 开发一个多流深度学习框架,用于使用RGB数据识别手语.
- 通过结合3D手部姿势数据来提高手语识别的准确性.
主要方法:
- 利用3D人类姿势估计架构从RGB视频中获得3D手关节坐标.
- 开发了一个多流深度学习框架,结合了基于CNN的手部特征和头部姿势估计.
- 采用基于注意力的编码解码器模型,将多流数据合并为标志识别.
主要成果:
- 在AUTSL数据集上获得了90.5%的准确性,在WLASL数据集上获得了88.2%的准确性.
- 在两个数据集中获得的F1分数超过0.89.
- 通过整合3D手数据,与最先进的方法相比,表现出显著的性能改进.
结论:
- 3D手骨信息显著提高了RGB视频的手语识别准确度.
- 拟议的多流深度学习框架有效地整合了各种数据流,以实现可靠的识别.
- 这项研究为推进手语识别技术提供了一个有前途的方向.


