Deep cross-modal affective memory networks with adaptive multi-source heterogeneous transfer learning in speech

Xiaofen Zhao1, Jingchao Liu2, Lei Lin3

  • 1School of Computer Science, Xijing University, Xi'an, 710123, China. 1418440678@qq.com.

Scientific Reports
|April 16, 2026
PubMed
Summary

This study introduces novel Deep Cross-Modal Emotional Memory Networks (DCM-EMNet) and Adaptive Multi-source Heterogeneous Transfer Learning Frameworks (AMS-HTLF) to significantly improve speech emotion recognition accuracy and model generalization.