Video Experimental Relacionado
Updated: Jan 7, 2026

Author Spotlight: Investigating the Impact of Emotional Prosodies on Voice Recognition and Perception
Published on: August 9, 2024
Detección de suplantación con atención dispersa dinámica aprendible y fusión tri-modal en sistemas de audio con
Xinwei Wang1, Zhicheng Tan2, Guo Li2
1Department of Forensic Science, Fu Jian Police College, Fuzhou, Fujian, China.
Este estudio presenta un nuevo marco de atención dispersa dinámica aprendible (DLSA) para la detección eficiente de suplantación en sistemas de verificación automática de hablantes (ASV). El método DLSA reduce significativamente los costos computacionales y mejora la precisión de la detección en dispositivos con recursos limitados.
Área de la Ciencia:
- Procesamiento del Habla
- Aprendizaje Automático
- Procesamiento de Señales
Sus antecedentes:
- Los sistemas de verificación automática de hablantes (ASV) son vulnerables a los ataques de suplantación de audio.
- Los métodos existentes de detección de suplantación, como la Atención Multi-Cabeza (MHA), son computacionalmente costosos y requieren mucha memoria, lo que limita su uso en entornos con recursos limitados.
Objetivo del estudio:
- Desarrollar un marco de detección de suplantación eficiente y robusto para sistemas ASV con recursos limitados.
- Reducir la complejidad computacional y la huella de memoria de los métodos de detección de suplantación.
Principales métodos:
- Se propuso un nuevo marco de Atención Dispersa Dinámica Aprendible (DLSA) que integra Coeficientes Cepstrales de Frecuencia Mel (MFCC), Transformada Constant-Q (CQT) y forma de onda cruda.
- Se empleó una arquitectura ResNet para la extracción de características de forma de onda cruda y una función de pérdida híbrida (entropía cruzada y pérdida de centro) para una representación de características optimizada.
- Se implementó un mecanismo de atención aprendible para la fusión dinámica inter-modal de características espectrales y temporales.
Principales resultados:
- Logró una reducción del 80% en los costos computacionales en comparación con los métodos basados en MHA.
- Se obtuvo una Tasa de Error Igual (EER) del 0,68% y una Función de Costo de Detección (t-DCF) mínima de 0,0173 en el conjunto de datos ASVspoof 2019 LA.
- Demostró una mejora del 33,6% en la reducción de EER sobre los métodos existentes.
Conclusiones:
- El marco DLSA ofrece una solución eficiente y efectiva para la detección de suplantación en sistemas ASV con recursos limitados.
- El método propuesto mejora la robustez contra técnicas sofisticadas de suplantación de audio.
- Este trabajo allana el camino para la implementación de funciones de seguridad avanzadas en dispositivos de borde.
Videos de Conceptos Relacionados
Perceiving Loudness, Pitch, and Location
Place theory, or place coding, suggests that different pitches are heard because various sound waves activate specific locations along the cochlea's basilar membrane. The brain determines the pitch of a sound by...
Auditory Perception
Auditory Pathway
When viewed cross-sectionally, the cochlea reveals the scala vestibuli and scala tympani flanking...
Nonconscious Mimicry
Perception of Sound Waves
The pitch of a sound depends on the frequency and the pressure amplitude of the source. Two sounds of the same...
Masking and Demasking Agents
There are many masking agents, such as cyanide, fluoride, triethanolamine, thiourea, and 2,3-bis(sulfanyl)propan-1-ol (formerly 2,3-dimercapto-1-propanol), with the masking agent chosen based on...
