Video Experimental Relacionado
Updated: Feb 26, 2026

Asthma Detection Research Based on Voice Signal Processing and Machine Learning
Published on: July 22, 2025
Evaluación automática de la calidad de la voz mediante aprendizaje automático
Yat Chun Au1, Nan Yan2, Manwa L Ng1
1Speech Science Laboratory, Faculty of Education, University of Hong Kong, Hong Kong, China.
Los modelos de aprendizaje automático predicen con precisión la gravedad de la disfonía mediante el análisis acústico de la voz. Los algoritmos de gradient boosting, especialmente LightGBM, muestran una concordancia cercana a la de los expertos, mejorando la evaluación clínica objetiva de la voz.
Área de la Ciencia:
- Patología del Habla y del Lenguaje
- Lingüística Computacional
- Ingeniería Biomédica
Sus antecedentes:
- La evaluación clínica de la voz se basa en calificaciones perceptuales subjetivas de la gravedad de la disfonía.
- Los métodos existentes carecen de objetividad, reproducibilidad y eficiencia.
- El análisis acústico automatizado ofrece potencial para la evaluación estandarizada de la voz.
Objetivo del estudio:
- Desarrollar y validar modelos de aprendizaje automático para la predicción automatizada de la gravedad de la disfonía (parámetro de Calificación de la escala GRBAS).
- Mejorar la objetividad, reproducibilidad y eficiencia en la evaluación clínica de la voz.
- Identificar las características acústicas clave predictivas de la gravedad de la disfonía perceptual.
Principales métodos:
- Se recolectaron 524 muestras de voz sostenida /a/ de tres bases de datos.
- Se extrajeron 47 características acústicas (espectrales, cepsstrales, de perturbación, basadas en ruido) utilizando Parselmouth (Praat).
- Se entrenaron y evaluaron cinco clasificadores de aprendizaje automático (DT, RF, XGBoost, LightGBM, CatBoost) utilizando validación cruzada de 5 pliegues.
Principales resultados:
- Los algoritmos de gradient boosting (LightGBM, CatBoost, XGBoost) superaron a los modelos tradicionales basados en árboles.
- LightGBM logró el mayor índice kappa ponderado cuadrático (QWK) de 0.945.
- Las medidas cepsstrales (CPPS, CSID, AVQI) y el HNR fueron los predictores más influyentes de la Calificación, mientras que el jitter y el shimmer contribuyeron mínimamente.
Conclusiones:
- Los métodos de gradient boosting, en particular LightGBM, demuestran una concordancia cercana a la de los expertos con las calificaciones perceptuales de disfonía.
- Estos modelos ofrecen herramientas objetivas e interpretables para la evaluación clínica de la voz.
- La predicción automatizada de la gravedad de la disfonía puede mejorar el flujo de trabajo clínico y la consistencia del diagnóstico.
Más Videos Relacionados
06:22Machine Learning-Based Cough Tone Classification: Diagnostic Exploration of Chronic Obstructive Pulmonary Disease and Respiratory Tract Infections
Published on: September 19, 2025
05:48Author Spotlight: Investigating the Impact of Emotional Prosodies on Voice Recognition and Perception
Published on: August 9, 2024
Videos de Conceptos Relacionados
Perceiving Loudness, Pitch, and Location
Place theory, or place coding, suggests that different pitches are heard because various sound waves activate specific locations along the cochlea's basilar membrane. The brain determines the pitch of a sound by...
Pulse amplitude and quality
A weak or absent pulse may indicate reduced cardiac output or poor left ventricular contraction, which can be signs of cardiovascular dysfunction or...
Classification of Signals
A continuous-time signal holds a value at every instant in time, representing information seamlessly. In contrast, a discrete-time signal holds values only at specific moments, often denoted as x(n), where...
Force Classification
Contact and non-contact forces are two of the most widely used categories of forces. As the name suggests, contact forces require physical contact between two objects to act upon each other. Examples of contact forces include frictional,...