低成本计算,用于隔离的手语视频识别与多个水库计算
A R Syulistyo1,2, Y Tanaka1,3, D Pramanta4
1Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology 2-4 Hibikino, Wakamatsu, Kitakyushu, Japan.
PloS one
|July 30, 2025
概括
本研究介绍了一种成本效益高的手语识别系统,用于边缘设备的储水库计算 (RC). 这种新的方法实现了高精度,并大大缩短了培训时间,提高了听力受损社区的可访问性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 标语识别 (SLR) 系统对于通信可访问性至关重要,但在边缘设备上的便携性和计算需求方面面临挑战.
- 深度神经网络虽然强大,但对于资源有限的,独立于服务器的应用程序来说,通常是过于计算密集的.
- 储计算 (RC) 提供了一个计算效率高的替代方案,适合边缘设备实现.
研究的目的:
- 开发一个具有成本效益的手语识别 (SLR) 系统,优化适用于资源有限的边缘设备.
- 为了利用水库计算 (RC) 实现高效和便携式SLR.
- 通过多个水库和MediaPipe预处理来提高RC性能.
主要方法:
- 实施了一种新型的手语识别 (SLR) 系统,采用储水池计算 (RC),多个储水池具有不同的泄漏率.
- 使用MediaPipe预处理手语视频,提取和规范身体和手关键点坐标.
- 集成关键点提取和规范化,以提高对背景变化和签名者定位的稳定性.
主要成果:
- 拟议的多个水库计算 (MRC) 系统在WLASL100数据集上实现了竞争力的准确性 (60.35%前-1,84.65%前-5,91.51%前-10).
- 在识别准确度方面,其表现优于Pose-TGCN和Pose-GRU等深度学习模型.
- 与传统的深度学习方法相比 (52.7s) 显著减少了培训时间 (例如,在20h时进行I3D).
结论:
- 在RC中集成MediaPipe预处理和多个储,为基于边缘的SLR提供了强大而高效的解决方案.
- 拟议的系统为便携式手语识别提供了对深度神经网络的可行,具有成本效益的替代方案.
- 这种方法通过实现服务器独立的SLR操作来提高听力受损社区的可访问性和隐私.


