在混乱的场景中增强对象对RGB图像的姿势估计
Metwalli Al-Selwi1,2,3,4, Huang Ning5, Yin Gao6,5,7
1Fujian Institute of Research on the Structure of Matter, Chinese Academy of Sciences, Fuzhou, Fujian, China. metwalli.msn@gmail.com.
Scientific reports
|March 14, 2025
概括
本研究引入了一个端到端的深度学习框架,用于从RGB图像中估计6D对象姿势,提高单个和多个对象场景的杂乱场景和重度遮蔽的准确性.
科学领域:
- 计算机视觉 计算机视觉
- 机器人技术 机器人技术 机器人技术
- 机器学习 机器学习
背景情况:
- 估计一个物体的6D姿势对于机器人交互至关重要.
- 杂乱的场景和闭塞对现有的6D对象构成估计方法构成重大挑战.
- 目前使用关键点定位的两阶段方法易受阻塞和与多对象场景的斗争.
研究的目的:
- 提出一个端到端的框架,用于使用RGB图像进行单个和多个对象的6D姿势估计.
- 解决现有方法的局限性,特别是在混乱和封闭的环境中.
- 开发一个计算效率高,可扩展的解决方案.
主要方法:
- 一个新的框架,结合了卷积神经网络 (CNN) 和自我注意机制.
- 用于局部特征提取的特征融合.
- 多头自我注意 (MHSA) 与代精细化集成,用于增强姿势估计.
- 可适应计算资源的可扩展架构.
主要成果:
- 在基准数据集 (Linemod 和 Occlusion Linemod) 上实现了高性能.
- 在Linemod上达到97.45%的准确性,在使用ADD ((-S) 度量时,在Occlusion Linemod上达到84.84%.
- 在具有阻塞和杂乱的具有挑战性的条件下证明有效.
结论:
- 拟议的CNN和自我注意框架为6D对象姿势估计提供了有效的端到端解决方案.
- 该方法表现出对阻塞和杂乱的稳定性,性能优于传统方法.
- 该框架的可扩展性和低计算成本使其适用于现实世界的机器人应用.


