SSR-2D:从二维图像进行语义三维场景重建
概括
本研究引入了一种新的深度学习方法,用于仅使用2D标签的3D室内场景重建和语义映射,从而消除了昂贵的3D注释的需求. 该方法在基准数据集上取得了最先进的结果,从而实现了高效的语义场景完成.
科学领域:
- 计算机视觉 计算机视觉
- 3D场景理解 3D场景理解
- 机器学习 机器学习
背景情况:
- 对于3D室内场景建模的深度学习通常需要广泛的3D注释,这些注释是昂贵且耗时的.
- 由于注释的限制,现有的方法难以进行全面的语义建模.
研究的目的:
- 开发一种用于3D室内空间的语义场景重建的新方法,消除了对3D注释的需求.
- 为了使联合几何完成,颜色化和语义映射只使用2D标签和RGB-D图像.
主要方法:
- 一个可训练的模型,将来自不完整的3D重建和RGB-D图像的跨域特征融合到体积嵌入中.
- 利用可分辨染来将2D观测 (RGB图像和2D语义) 与未知的3D空间连接起来进行监控.
- 从合成的虚拟视图中使用不完美的预测2D标签来开发自我监督的学习管道.
主要成果:
- 在MatterPort3D和ScanNet数据集上的语义场景完成任务中实现了最先进的性能.
- 超越了使用昂贵的3D注释用于几何和语义预测的基线方法.
- 通过使用2D驱动的方法,展示了现实世界3D扫描的同时完成和语义细分.
结论:
- 拟议的2D驱动方法为3D语义场景重建提供了一个高效和有效的解决方案,没有3D地面真相.
- 这种方法显著降低了注释负担,使全面的3D场景建模更容易获得.
- 该方法代表了2D驱动的3D场景理解和重建的重大进步.


