字母发音的Schlieren图像和视频分类:利用语音流来进行语音识别和语音治疗
Mohamed Talaat1, Kian Barari1, Xiuhua April Si2
1Department of Biomedical Engineering, University of Massachusetts, Lowell, MA, 01854, USA.
Visual computing for industry, biomedicine, and art
|May 21, 2024
概括
这项研究表明,使用schlieren成像和AI分析空气流模式可以识别字母表发音. 虽然对个人来说是准确的,但参与者之间的变化对更广泛的语音识别应用提出了挑战.
科学领域:
- 生物物理学的生物物理.
- 计算机科学 计算机科学
- 语音科学 语言科学
背景情况:
- 语音产生涉及复杂的声道运动和空气流动力学.
- 施莱伦成像可视化微妙的空气密度变化,为研究语音流提供了一种新的方法.
- 人工智能,特别是混合卷积神经网络 (CNN) 和长短期记忆 (LSTM) 网络,在分析复杂的视觉数据方面表现有前途.
研究的目的:
- 评估使用基于CNN的视频分类来区分字母发音 (/A/, /B/, /C/, /D/) 的语音空气流模式的可行性.
- 评估混合CNN-LSTM网络在识别来自schlieren成像数据的语音流的有效性.
- 探索该技术在自动语音识别和语音障碍治疗方面的潜力.
主要方法:
- 开发了一个schlieren光学系统,用于记录字母表发音期间的语音流.
- 从两个参与者那里以每秒60的速度获得了640个视频片段 (每片1秒).
- 在不同大小的数据集上训练并测试混合CNN-LSTM网络,包括跨参与者评估.
主要成果:
- 美国有线电视新闻网 (CNN) -LSTM网络实现了超过95%的准确度,对同一个参与者的语音流进行了分类.
- 跨参与者的准确性大幅下降至约44%,突出显示了参与者之间的差异性.
- 使用两名参与者的数据进行重新训练,第二名参与者的准确性提高到93%.
- 低视频质量和解剖学变异被确定为影响分类准确性的因素.
结论:
- 施莱伦成像与CNN辅助分析相结合,显示了自动语音识别和语音治疗的潜力.
- 空气流模式在参与者之间显著的变化,需要强大的模型用于现实世界的应用.
- 需要进一步的研究来扩大字母组,参与者队列,并解决视频质量等技术挑战.


