CLIP-Mono3D: End-to-End Open-Vocabulary Monocular 3D Object Detection via Semantic-Geometric Similarity

Zichong Gu1, Shiyi Mu1, Hanqi Lyu1

  • 1School of Communication and Information Engineering, Shanghai University, Shanghai 200444, China.