一般的3D视觉语言模型具有快速染和预训练视觉语言对齐

概括

本研究介绍了WS3D++,这是一种用于3D场景理解的框架,它在有限的标签上表现出色. 它可以实现开放的词汇识别,并实现对3D点云的语义和实例细分的最先进性能.