[Audiovisual emotion recognition based on a multi-head cross attention mechanism]

Ziqiong Wang1, Dechun Zhao1, Lu Qin1

  • 1School of Life Health Information Science and Engineering, Chongqing University of Posts and Telecommunications, Chongqing 400065, P. R. China.

Summary

This study introduces a novel cross-modal audiovisual emotion recognition model using multi-head cross-attention. The model effectively integrates audio and video data, achieving high F1 scores and addressing modality missing challenges.