Extending Large Vision-Language Model for Diverse Interactive Tasks in Autonomous Driving

Summary

Researchers developed DriveMonkey, a framework enhancing large vision-language models (LVLMs) for autonomous driving. It improves 3D spatial understanding and instruction following, outperforming existing models in 3D visual grounding.

Related Concept Videos