ScaleFormer架构用于规模不变的人类姿势估计,具有增强的混合功能.
1School of Physical Education, Guangxi University of Science and Technology, Liuzhou, 545006, China.
Scientific reports
|July 30, 2025
概括
本研究介绍了ScaleFormer,这是人类姿势估计的新框架,可以克服与规模相关的性能问题. 在各种尺度和遮中,ScaleFormer实现了强大的和一致的人类姿势估计.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
背景情况:
- 人类姿势估计在计算机视觉中至关重要.
- 现有的方法难以应对不同的人类目标尺度,特别是在户外环境中,变化的距离和角度.
研究的目的:
- 提出ScaleFormer,一个新的规模不变的姿势估计框架.
- 为了应对多尺度人类姿势估计的挑战.
主要方法:
- 结合了Swin Transformer的层次特征提取与ConvNeXt的细粒度特征增强.
- 引入了适应性特征表示机制,以实现跨尺度一致的性能.
主要成果:
- 在MPII人类姿势数据集上,ScaleFormer显著优于现有的方法.
- 在极端缩放 (2.0x) 下,在尺度一致性得分方面取得了48.8个百分点的改善.
- 在30%的随机遮下,关键点检测准确度提高了20.5个百分点.
结论:
- 在实际的姿势估计应用中,ScaleFormer表现出了显著的优势.
- 该框架为规模不变姿势估计提供了新的研究方向.


