使用英语多式联络体的语音识别,集成图像和深度信息
1School of Foreign Languages, Henan University of Science and Technology, Luoyang, Henan, 471000, China. wangbing@haust.edu.cn.
Scientific reports
|November 6, 2024
概括
这项研究将深度信息引入英语多式联络体,提高语音识别的准确性. 与传统单模体相比,将唇部运动等视觉线索与深度数据相结合显著提高了性能.
科学领域:
- 自然语言处理自然语言处理.
- 计算机视觉 计算机视觉
- 语音识别 语音识别 语言识别
背景情况:
- 传统的英语语体通常依赖于单一的模式,限制信息质量和识别准确性.
- 现有的多式联络机体可能无法充分利用语音识别的视觉和深度信息.
研究的目的:
- 开发一种方法来构建英语多式联运体,整合电子图像和深度信息.
- 研究使用这种增强的多式联络体的语音识别方法.
主要方法:
- 一种多式联络融合策略,将语音信号与视觉信息 (唇部动作,面部表情) 和深度数据相结合.
- 深度学习的应用用于提取声学和视觉特征.
- 使用Kaldi工具包的声学模型进行实验分析.
主要成果:
- 在各种唇部特征尺寸和模型中,包含深度信息的A体表现出比B体 (缺乏深度) 更高的准确性.
- 在10dB的信号噪声比 (SNR) 时,A集团的精度比B集团提高了1.4%至2.6%.
- 观察到的具体改善为2.4%和1.7%的15维唇部特征,以及1.4%和2.6%的32维唇部特征.
结论:
- 拟议的英语多式联络体集成图像和深度信息,实现了高语音识别准确性.
- 深度信息是提高多式联络语音识别系统准确性的关键因素.
更多相关视频
05:38Interaction between Phonological and Semantic Processes in Visual Word Recognition using Electrophysiology
Published on: June 29, 2021
2.3K
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
405
