纳米HTNet:为高效的3D人类姿势估计提供纳米人类拓网络
概括
本研究介绍了NanoHTNet,一个高效的3D人体姿势估计 (HPE) 网络,以及PoseCLR,一种预训练方法. 它们一起在像Jetson Nano这样的资源有限的边缘设备上实现精确的3D HPE.
科学领域:
- 计算机视觉 计算机视觉
- 机器学习 机器学习
- 机器人技术 机器人技术 机器人技术
背景情况:
- 像Jetson Nano这样的资源有限的边缘设备限制了3D人类姿势估计 (HPE) 的应用.
- 现有的HPE模型很难有效地利用来自人类骨数据的结构先验.
- 开发适合边缘部署的高效模型对于HPE广泛采用至关重要.
研究的目的:
- 开发一个高效的3D HPE网络,适合边缘设备.
- 为了提高准确性,利用明确和隐含的时空人类身体先验.
- 引入一个一般的预训练方法,以提高3DHPE模型的性能.
主要方法:
- 拟议的纳米人类拓网络 (NanoHTNet):一个紧的3DHPE网络,利用堆叠的层次混合器来显式提取特征.
- 空间层次混合器:学习跨语义层面的人类物理拓.
- 时间层次混合器:通过离散的等号变换和低通,捕获本地运动和全球行动连贯性.
- 高效的时空令牌化 (ETST):提高了时空交互,同时降低了计算复杂性.
- PoseCLR:一种基于对比学习的预训练方法,通过对齐2D姿势来提取隐含的人类拓表示.
主要成果:
- 纳米HTNet表现出卓越的效率,使其成为像Jetson Nano这样的边缘设备的理想选择.
- 纳米HTNet和PoseCLR的组合显著提高了3D HPE的性能.
- 实验结果显示,与最先进的方法相比,在效率和准确性方面表现出色.
结论:
- 通过PoseCLR预训练增强的NanoHTNet,为边缘设备上的3D HPE提供了高效和有效的解决方案.
- 提出的方法成功地利用了明确和隐含的时空先验来进行可靠的人类姿势估计.
- 这项工作为在资源有限的环境中实用的3D HPE应用铺平了道路.

