Video Experimental Relacionado
Updated: Sep 9, 2025

05:48
Author Spotlight: Investigating the Impact of Emotional Prosodies on Voice Recognition and Perception
Published on: August 9, 2024
1.6K
Investigación sobre el modelo óptimo de aprendizaje profundo en el reconocimiento de dialectos HaiNan
ZiXuan Qi1,2, FuYun Li3,4, HaiXia Long5,6
1College of Information Science and Technology, HaiNan Normal University, Haikou, 571158, China.
Scientific reports
|August 28, 2025
Resumen
Este estudio presenta ConvMHANet, un nuevo modelo de aprendizaje profundo para el reconocimiento del habla en dialecto HaiNan. El modelo logra una alta precisión en la conversión de diversos dialectos al mandarín, superando los desafíos de la escasez de datos.
Área de la Ciencia:
- Lingüística computacional
- Inteligencia artificial
- Procesamiento del habla
Sus antecedentes:
- El reconocimiento del habla en el dialecto HaiNan enfrenta desafíos debido a importantes variaciones fonológicas, entonacionales y gramaticales.
- La investigación actual está limitada por los recursos insuficientes del corpus, en particular para el reconocimiento de múltiples dialectos.
- Los modelos tradicionales luchan con la escasez de datos y las diversas características dialectales.
Objetivo del estudio:
- Para explorar modelos de aprendizaje profundo para la conversión del dialecto HaiNan al mandarín.
- Identificar el modelo óptimo de aprendizaje profundo para el reconocimiento del dialecto HaiNan.
- Proponer un modelo de fusión eficaz para el reconocimiento de múltiples dialectos.
Principales métodos:
- Aplicación de múltiples modelos de aprendizaje profundo.
- Un extenso análisis comparativo experimental.
- Desarrollo de un modelo de fusión que combina las Redes Neurales Convolucionales (CNN) y el Mecanismo de Autoatención de Múltiples Cabezas (MHAN).
Principales resultados:
- El modelo de fusión propuesto, ConvMHANet, demuestra un excelente rendimiento en diferentes escenarios dialectales.
- ConvMHANet aborda efectivamente las complejas dependencias fonéticas y contextuales dialectales.
- Se logró una precisión del 97,58% y una tasa de error de caracteres de 0,0163 en una tarea de mezcla de clasificación múltiple.
Conclusiones:
- ConvMHANet muestra fuertes capacidades de generalización para el reconocimiento de voz del dialecto HaiNan.
- El modelo de fusión ofrece una solución prometedora para las tareas de conversión de dialecto a mandarín.
- Esta investigación contribuye al avance del reconocimiento de voz para los dialectos de bajos recursos.

