Speech recognition using an english multimodal corpus with integrated image and depth information

Bing Wang1

  • 1School of Foreign Languages, Henan University of Science and Technology, Luoyang, Henan, 471000, China. wangbing@haust.edu.cn.

Scientific Reports
|November 6, 2024
PubMed
Summary

This study introduces depth information into English multimodal corpora, enhancing speech recognition accuracy. Integrating visual cues like lip movements with depth data significantly improves performance compared to traditional single-modality corpora.