Related Experiment Video
Updated: Sep 9, 2025

05:48
Author Spotlight: Investigating the Impact of Emotional Prosodies on Voice Recognition and Perception
Published on: August 9, 2024
1.6K
Research on optimal deep learning modeling in HaiNan dialect recognition
ZiXuan Qi1,2, FuYun Li3,4, HaiXia Long5,6
1College of Information Science and Technology, HaiNan Normal University, Haikou, 571158, China.
Scientific Reports
|August 28, 2025
Summary
This study introduces ConvMHANet, a novel deep learning model for HaiNan dialect speech recognition. The model achieves high accuracy in converting diverse dialects to Mandarin, overcoming data scarcity challenges.
Area of Science:
- Computational Linguistics
- Artificial Intelligence
- Speech Processing
Background:
- HaiNan dialect speech recognition faces challenges due to significant phonological, intonational, and grammatical variations.
- Current research is limited by insufficient corpus resources, particularly for multi-dialect recognition.
- Traditional models struggle with data scarcity and diverse dialectal characteristics.
Purpose of the Study:
- To explore deep learning models for HaiNan dialect-to-Mandarin conversion.
- To identify the optimal deep learning model for HaiNan dialect recognition.
- To propose an effective fusion model for multi-dialect recognition.
Main Methods:
- Application of multiple deep learning models.
- Extensive experimental comparative analysis.
- Development of a fusion model combining Convolutional Neural Networks (CNNs) and Multi-Head Self-Attention Mechanism (MHAN).
Main Results:
- The proposed fusion model, ConvMHANet, demonstrates excellent performance across different dialectal scenes.
- ConvMHANet effectively addresses complex dialectal phonetic and contextual dependencies.
- Achieved 97.58% accuracy and a character error rate of 0.0163 in a multi-classification mixing task.
Conclusions:
- ConvMHANet shows strong generalization capabilities for HaiNan dialect speech recognition.
- The fusion model offers a promising solution for dialect-to-Mandarin conversion tasks.
- This research contributes to advancing speech recognition for low-resource dialects.

