Transformer-Based Semantic Segmentation for Extraction of Building Footprints from Very-High-Resolution Images

Jia Song1,2, A-Xing Zhu1,3, Yunqiang Zhu1

  • 1State Key Laboratory of Resources and Environmental Information System, Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing 100101, China.

PubMed
Summary

Vision Transformer networks enhance semantic segmentation for extracting building footprints from very-high-resolution (VHR) images. Optimizing hyperparameters like image patch size and embedding dimensions improves accuracy, outperforming traditional convolutional neural networks (CNNs).