BEVFormer: Learning Bird's-Eye-View Representation From LiDAR-Camera Via Spatiotemporal Transformers

Summary

BEVFormer unifies multi-modality data using spatiotemporal transformers for autonomous driving perception. This novel approach achieves state-of-the-art results in 3D perception tasks and supports multiple applications.