A Facial Feature and Lip Movement Enhanced Audio-Visual Speech Separation Model

Guizhu Li1, Min Fu1,2, Mengnan Sun1

  • 1College of Electronic Engineering, Ocean University of China, Qingdao 266100, China.

PubMed
Summary

This study enhances audio separation for the cocktail party problem by integrating visual cues like facial features and lip movement. The proposed method significantly improves audio-visual speech separation performance.