Reliability-Based Large-Vocabulary Audio-Visual Speech Recognition

Wentao Yu1, Steffen Zeiler1, Dorothea Kolossa1

  • 1Institute of Communication Acoustics, Ruhr University Bochum, 44801 Bochum, Germany.

Summary

A new Decision Fusion Net (DFN) improves audio-visual speech recognition (AVSR) by better using visual cues, especially in noisy conditions for large vocabularies.