多模式时空特征和基于传感器网络中手语识别的3D可变形卷积的融合
Qian Zhou1, Hui Li1, Weizhi Meng2
1School of Computer Science, Nanjing University of Posts and Telecommunications, 9 Wenyuan Road, Nanjing 210023, China.
Sensors (Basel, Switzerland)
|July 30, 2025
概括
本研究引入了一种新的深度学习框架,用于使用骨架和图像数据进行准确的手语识别 (SLR). 多式联网方法在公共数据集上取得了竞争性结果,推进了手势解释.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 由于视觉语言的复杂时空动态,手语识别 (SLR) 是一个挑战.
- 现有的方法往往难以准确有效地解释原始视频数据.
研究的目的:
- 开发一个新的多式联网深度学习框架,用于准确高效的手语识别.
- 有效地整合骨架数据和原始RGB图像的信息,以提高单反相机的性能.
主要方法:
- 一个多流空间时空图卷积网络 (MSGCN) 提出了骨架特征提取,结合解图卷积,自我强调时空卷积,和空间时空联合注意.
- 使用具有可变形卷积的3D ResNet模型 (D-ResNet) 来处理原始RGB图像序列.
- 采用带有关门机制的多流融合模块 (MFM) 来合并两种模式的功能.
主要成果:
- 拟议的多式联运框架在AUTSL和WLASL公共数据集上取得了竞争性表现.
- 通过MSGCN和D-ResNet模型整合骨架和RGB模式,与MFM融合,在SLR中表现出有效性.
结论:
- 新型多式联动深度学习方法为推进手语识别技术提供了一个有希望的方向.
- 与MFM相结合的MSGCN和D-ResNet模型提供了一个强大的解决方案,用于在手语手势中捕获复杂的时空信息.

