一个移动的Deep Sparse Wavelet自动编码器用于阿拉伯语声学单元建模和识别
Sarah A Alzakari1, Salima Hassairi2, Amel Ali Alhussan1
1Department of Computer Sciences, College of Computer and Information Sciences, Princess Nourah Bint Abdulrahman University, P.O. Box 84428, Riyadh, 11671, Saudi Arabia.
Heliyon
|March 4, 2024
概括
一个新的Deep Sparse Wavelet Network (DSWN) 通过使用深度学习和稀疏编码,有效地模拟移动设备上的声学单元. 这种方法对语音单元分类有希望,减少了计算负载.
科学领域:
- 语音处理 语音处理
- 机器学习 机器学习
- 信号处理 信号处理
背景情况:
- 声学单元建模对于语音识别至关重要.
- 移动设备需要计算效率高的算法.
- 集成深度学习,稀疏编码和波纹网络为改进声学建模提供了潜力.
研究的目的:
- 为声学单元建模引入一种新的深波浪网 (DSWN).
- 设计一个适合移动架构的DSWN,以减少计算开销.
- 使用Mel频率 cepstral系数 (MFCC) 和感知线性预测 (PLP) 特性来分类和区分声学单位.
主要方法:
- 通过集成堆叠的波形自动编码器开发了一个深度稀疏波形网络 (DSWN).
- 利用Mel频率 cepstral 系数 (MFCC) 和感知线性预测 (PLP) 特性用于语音单元编码.
- 设计了以最小连接的深度网络,以减少移动部署的计算复杂性.
主要成果:
- 证明了DSWN系统在阿拉伯单词的细分语料库上的有效性.
- 拟议的DSWN实现了声学单元的有效分类和区分.
- 该方法成功地减少了移动应用程序的计算开销.
结论:
- 深度稀疏波浪网 (DSWN) 为移动设备上的声学单元建模提供了一种有效和计算效率高的方法.
- 需要进一步的研究来评估DSWN对不同语境和语音变异的概括性.
- 未来的工作将调查口音和其他语音变异对模型性能的影响.


