基于swin变压器和CNN的手势3D姿势估计方法.
1School of Architecture, Tianjin University, Tianjin, 300073, China. drong_7788@tju.edu.cn.
Scientific reports
|March 2, 2026
概括
这项研究引入了一种新的手势姿势估计方法,使用深度图像. 该方法通过捕捉联合关系和全球特征来提高准确性,优于现有模型.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 人与计算机的交互
背景情况:
- 现有的手势姿势估计方法在单一特征提取方面扎,无法捕捉长距离的关节关系,限制了准确性.
- 深度图像数据提供了丰富的空间信息,对于精确的手势识别至关重要.
研究的目的:
- 为了开发先进的手势姿势估计方法,使用深度图像.
- 克服特征提取和拓关系建模当前方法的局限性.
主要方法:
- 一种混合方法,将卷积网络用于初始特征提取和Swin变压器用于全球上下文和联合关系.
- 使用U形网络进行分层的特征处理,以保存多分辨率的本地联合信息.
- 集成2D高斯热图,以改善关键点定位和网络监控.
主要成果:
- 拟议的方法实现了平均平方误差的显著降低,比基线模型的表现优于4.776毫米.
- 在新建的数据集上进行的实验验证表明,与最先进的姿势估计网络相比,性能优越.
- 该方法有效地捕获了本地联合细节和全球手势拓.
结论:
- 新的手势姿势估计方法通过整合深度信息和先进的网络架构,显著提高了准确性和稳定性.
- 这些发现表明,通过手势识别来实现更精确,更可靠的人与计算机交互的有希望的方向.
- 这项研究解决了手势姿势估计的关键挑战,为各种应用提供了更有效的解决方案.


