Video Experimental Relacionado
Updated: May 6, 2026

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
9.3K
Un enfoque DCNN ligero basado en ECA para el reconocimiento de comandos de voz
Karthikeyan V1, Saranya P1, Natchiyar M1
1Dept. of ECE, Mepco Schlenk Engineering College, Sivakasi, Tamil Nadu, India.
Computers in biology and medicine
|August 24, 2025
Resumen
Una nueva red neuronal de convolución profunda ligera con atención de canal eficiente (LW-DCNN-ECA) logra una alta precisión para el reconocimiento de voz. Este modelo avanzado mejora la comunicación y la accesibilidad para los usuarios, incluidos los que tienen problemas de habla.
Área de la Ciencia:
- Ciencias de la computación
- Inteligencia artificial
- Aprendizaje automático
Sus antecedentes:
- La tecnología de reconocimiento de voz facilita la transcripción de flujos de audio en varias industrias.
- Sirve como una biometría para la autenticación del usuario y ayuda a las personas con discapacidades del habla.
- La tecnología permite una comunicación natural, similar a la humana.
Objetivo del estudio:
- Proponer una red neuronal convolucional profunda de extremo a extremo ligera con un marco de atención de canal eficiente (LW-DCNN-ECA) para mejorar el reconocimiento del habla.
- Mejorar la facilidad y la flexibilidad de la comunicación a través del reconocimiento de voz avanzado.
Principales métodos:
- Se desarrolló una CNN profunda de extremo a extremo modificada por capas que incorpora un mecanismo de atención de canal eficiente (ECA).
- La capa ECA es un módulo computacionalmente eficiente diseñado para aumentar el rendimiento de las redes neuronales convolucionales profundas ligeras.
Principales resultados:
- El modelo LW-DCNN-ECA logró una tasa de reconocimiento del 98.28% y una pérdida de 0.5691 en el conjunto de datos de comandos de mini-voz.
- En el conjunto de datos de comandos de voz, el modelo alcanzó una tasa de reconocimiento del 99,98% con una pérdida de 0,2634.
- La robustez del marco se validó en el corpus de Fisher y en el corpus de CHiME-4.
Conclusiones:
- El marco LW-DCNN-ECA propuesto demuestra una alta eficacia y precisión en las tareas de reconocimiento de voz.
- Este modelo ofrece una solución computacionalmente eficiente para mejorar el rendimiento del reconocimiento de voz.
- La tecnología tiene un potencial significativo para mejorar la accesibilidad y las herramientas de comunicación.

