Leveraging Self-Supervised Audio-Visual Pretrained Models to Improve Vocoded Speech Intelligibility in Cochlear

Summary

This study introduces Self-Supervised Learning-based Audio-Visual Speech Enhancement (SSL-AVSE) to improve speech understanding for individuals with hearing impairments using cochlear implant simulations. SSL-AVSE significantly enhances speech quality and intelligibility by integrating visual cues.