MSCViT: A small-size ViT architecture with multi-scale self-attention mechanism for tiny datasets

Bowei Zhang1, Yi Zhang1

  • 1National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, China; Department of Computer Science, Sichuan University, China.

Summary

This study introduces MSCViT, a small Vision Transformer (ViT) architecture designed for limited data. MSCViT enhances performance on tiny datasets by integrating multi-scale attention and convolutional blocks, outperforming standard ViTs.

Related Concept Videos