Video Experimental Relacionado
Updated: Sep 9, 2025

Author Spotlight: Investigating the Impact of Emotional Prosodies on Voice Recognition and Perception
Published on: August 9, 2024
Una red neuronal profunda entrenada en el habla audiovisual congruente reporta el efecto McGurk
Haotian Ma1, Zhengjia Wang1, Xiang Zhang1
1Department of Neurosurgery, Perelman School of Medicine, University of Pennsylvania, Philadelphia, PA.
Las redes neuronales profundas (DNN) como AVHuBERT pueden replicar el efecto McGurk, percibiendo sílabas ilusorias del habla audiovisual incongruente. Esto sugiere que las DNN pueden ayudar a comprender los mecanismos de percepción del habla audiovisual humana.
Área de la Ciencia:
- Ciencias cognitivas
- La neurociencia
- Inteligencia artificial
Sus antecedentes:
- El efecto McGurk demuestra la percepción ilusoria de la sílaba de las entradas auditivas y visuales no coincidentes.
- Las teorías actuales proponen una percepción de consenso entre las representaciones audiovisuales incompatibles.
- Las redes neuronales profundas (DNN) ofrecen un enfoque novedoso para modelar la percepción del habla.
Objetivo del estudio:
- Para investigar si una red neuronal profunda, AVHuBERT, entrenada en el habla audiovisual congruente, puede exhibir el efecto McGurk.
- Comparar el rendimiento de AVHuBERT en el habla audiovisual congruente e incongruente con la percepción humana.
- Explorar el potencial de las RND en la comprensión del procesamiento del habla audiovisual.
Principales métodos:
- AVHuBERT, un DNN entrenado en el habla audiovisual congruente, fue probado con estímulos McGurk congruentes e incongruentes.
- El rendimiento se evaluó en función de la precisión de la transcripción para el habla solo auditiva, visual y audiovisual.
- Se crearon 100 variantes de AVHuBERT para evaluar la variabilidad en la percepción del efecto McGurk.
Principales resultados:
- AVHuBERT logró una alta precisión en el discurso audiovisual congruente, reflejando los patrones de rendimiento humano (audiovisual > auditivo > visual).
- Cuando se presenta con estímulos de McGurk (auditivo 'ba', visual 'ga'), AVHuBERT produjo la percepción de fusión 'da' a una velocidad del 25%.
- Las variantes de AVHuBERT mostraron una precisión consistente para estímulos congruentes, pero una alta variabilidad para estímulos de McGurk, similares a los humanos.
Conclusiones:
- La capacidad de AVHuBERT para replicar el efecto McGurk sugiere que las DNN pueden modelar fenómenos de habla audiovisual complejos.
- El estudio pone de relieve el potencial del uso de DNNs como una herramienta para investigar los fundamentos neuronales y perceptivos de la percepción del habla humana.
- Los hallazgos apoyan la utilidad de los modelos de IA para avanzar en nuestra comprensión del procesamiento sensorial humano y los efectos cognitivos.
Más Videos Relacionados
Videos de Conceptos Relacionados
Facial Feedback Hypothesis
Auditory Perception
Perception of Sound Waves
The pitch of a sound depends on the frequency and the pressure amplitude of the source. Two sounds of the same...
Perceiving Loudness, Pitch, and Location
Place theory, or place coding, suggests that different pitches are heard because various sound waves activate specific locations along the cochlea's basilar membrane. The brain determines the pitch of a sound by...
Auditory Pathway
When viewed cross-sectionally, the cochlea reveals the scala vestibuli and scala tympani flanking...
Nonconscious Mimicry

