${\text{CA}^{2}\text{ST}}$: Cross-Attention in Audio, Space, and Time for Holistic Video Recognition

Summary

Cross-Attention in Audio, Space, and Time (CA²ST) enhances video recognition by integrating spatial, temporal, and audio information. This transformer-based method achieves balanced and holistic video understanding through synergistic expert information exchange.