通过使用循环神经网络进行以塞米特语言的基于音频的识别
Amlakie Aschale Alemu1, Malefia Demilie Melese2, Ayodeji Olalekan Salau3,4
1Department of Electrical and Computer Engineering, Gafat Institute of Technology, Debre Tabor University, Debre Tabor, Ethiopia.
Scientific reports
|November 7, 2023
概括
这项研究开发了一种基于音频的系统,用于识别像阿姆哈拉语和提格里纳语这样的埃塞俄-塞米特语言. 双向长期短期记忆网络与Mel频率 cepstral 系数实现了语言识别的最高准确性.
科学领域:
- 计算语言学 计算语言学
- 语音处理 语音处理
- 人工智能的人工智能
背景情况:
- 越来越多的人对通过自然语言处理为社会利益使用技术感兴趣.
- 语言识别对于语音技术至关重要,但由于语言相似性而具有挑战性.
- 埃塞俄-塞米特语言带来了独特的识别挑战.
研究的目的:
- 开发一个基于音频的以西米语语言识别系统.
- 为此任务评估不同的反复神经网络 (RNN) 模型.
- 为准确的语言识别确定最佳模型和特征.
主要方法:
- 作为声学特征使用的Mel频率 cepstral 系数 (MFCC).
- 采用重复神经网络 (RNN) 架构,包括长短期记忆 (LSTM) 和双向长短期记忆 (BLSTM).
- 在8小时的音频数据集上测试了具有不同段长度 (5s和10s) 的埃塞俄-塞米特语言 (阿姆哈拉语,吉兹语,古拉吉纳语,提格里纳语) 的模型.
主要成果:
- 带有5秒音频段的双向长短期存储器 (BLSTM) 优于其他模型.
- 该BLSTM模型实现了高精度:98.1% (培训),92.9% (验证) 和89.9% (测试).
- 与BLSTM相结合的MFCC被证明是有效的区分类似的埃塞俄语系语言.
结论:
- 使用5秒音频窗口的MFCC的BLSTM算法是识别所选埃塞俄语语言的最有效方法.
- 这项研究为Ethio-Semitic语言识别提供了一个强大的系统.
- 这些发现凸显了深度学习模型在处理低资源语言方面的潜力.


