当地模式感知3D视频swin变压器与面具自动编码实时增强现实手势交互
Suli Wang1,2
1Faculty of Data Science, City University of Macau, Taipa, 999078, Macau, China. wangsl@gcu.edu.cn.
Scientific reports
|July 2, 2025
概括
这项研究引入了使用Swin变压器和蒙面自动编码器的实时增强现实手势识别算法,改进了时空特征提取和性能. 这种新的方法提高了交互式应用程序的准确性和效率.
科学领域:
- 计算机视觉 计算机视觉
- 人与计算机的交互
- 机器学习 机器学习
背景情况:
- 传统的变压器模型在时空特征提取和手势交互实时性能方面面临挑战.
- 有效和准确的手势识别对于推进增强现实应用程序至关重要.
研究的目的:
- 提出一个实时增强现实手势交互算法,利用Swin变压器和面具自动编码器.
- 为了增强时空特征提取,实时性能和手势识别的整体准确性.
主要方法:
- 利用合成数据生成来实现高效的3D手势注释.
- 开发了一种使用最大a posteriori概率,加权欧几里德距离和结构相似性优化的图像无色化模型.
- 集成的EfficientNet和变压器模型具有跳过连接和三重注意力,用于手势检测和细分.
- 引入了局部纹理特征 (RTHLBP) 以提高准确性.
- 采用视觉转换器 (ViT) 架构,具有掩盖的自动编码器,动态重量融合,以及用于手势分类的相对总变化图.
- 实施了多核心并行计算策略,以实时优化性能.
主要成果:
- 与CNN,变压器,移动网络和DenseNet模型相比,拟议的模型在4个GTEA子数据集上实现了更高的准确性,F1分数和平均交叉点与结合点 (MIoU).
- 表现出显著的性能改善,特别是在较小的数据集上.
- 显著减少了计算时间,并保持了高计算效率,增加了DSP核心.
结论:
- 开发的算法有效地解决了传统模型在实时增强现实手势交互中的局限性.
- 先进的深度学习技术和优化策略的结合导致了手势识别和细分方面的最先进性能.
- 优化的实时性能使得该算法适用于实际的增强现实应用.


