多对象全3D信息估计从RGB-D图像的状态空间模型
IEEE transactions on cybernetics
|March 19, 2025
概括
本研究介绍了一种使用状态空间模型 (SSM) 的新单拍方法,用于从RGB-D图像中高效准确地理解3D对象,从而改进机器人应用.
科学领域:
- 计算机视觉 计算机视觉
- 机器人技术 机器人技术 机器人技术
- 机器学习 机器学习
背景情况:
- 准确的3D对象理解对于机器人,自主导航和增强现实至关重要.
- 当前的方法往往缺乏端到端的效率和准确性,无法预测完整的3D对象信息.
研究的目的:
- 开发一种单一的,端到端的方法,用于从单一的RGB-D图像中预测多个对象的完整3D信息 (姿势,尺寸,形状).
- 利用状态空间模型 (SSM) 来增强远程语义编码和3D推理.
主要方法:
- 一个统一的模型编码RGB和深度图像,将它们整合到一个被修改的SSM处理的隐藏表示中.
- 统一管理机制通过单独的热图/检测和3D信息头推断出3D信息.
- 一个基于SSM的形状自编码器从3D点云数据中学习正规形状代码.
主要成果:
- 提出的方法在REAL275,CAMERA25和Wild6D数据集上实现了最先进的性能.
- 在Wild6D数据集上观察到显著的改进,比竞争对手表现更好2.6% (IOU-50) 和5.1% (5°10厘米).
结论:
- 端到端框架,修改的SSM块和基于SSM的形状自动编码器代表了重要的贡献.
- 该方法在3D对象的姿势,尺寸和形状预测方面表现出卓越的效率和准确性.


