基于扬声器的语言识别用于使用CRNN和混合特征的埃塞俄语系语言
Malefia Demilie Melese1, Amlakie Aschale Alemu2, Ayodeji Olalekan Salau3,4
1Department of Information Technology, Gafat Institute of Technology, Debre Tabor University, Debre Tabor, Ethiopia.
概括
本研究介绍了一种新的语言识别 (LID) 模型,用于使用混合卷积循环神经网络 (CRNN) 的以西米语语言. 该模型实现了高精度,证明了其在语音识别进步方面的有效性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 计算语言学 计算语言学
背景情况:
- 自然语言处理 (NLP) 对于人机交互和语音识别至关重要.
- 语言识别 (LID) 是各种NLP应用程序的基础任务,包括翻译和信息检索.
- 埃塞俄-塞米特语言由于独特的语言特征,需要专门的LID模型.
研究的目的:
- 开发和评估一个语言识别 (LID) 模型,用于四种埃塞俄语系语言:阿姆哈拉语,Ge'ez,Guragigna和Tigrinya.
- 探索混合卷积循环神经网络 (CRNN) 方法的有效性,结合Mel频率 cepstral 系数 (MFCC) 和 mel 谱图特征.
- 评估数据增强对模型性能的影响.
主要方法:
- 混合卷积循环神经网络 (CRNN) 架构用于LID.
- 使用了Mel频率塞普斯特拉系数 (MFCC) 和mel谱图特征的组合.
- 应用了数据增强技术,将最初的8小时音频数据集扩展到24小时40分钟.
主要成果:
- 结合Mel-Spectrogram + MFCC特征集的CRNN模型在培训,验证和测试集中实现了高精度 (分别为99.9%,98.6%和98.1%).
- 与针对目标语言的现有LID模型相比,拟的模型显示出更高的性能.
- 数据增强显著提高了LID模型的稳定性和性能.
结论:
- 开发的基于CRNN的LID模型在区分埃塞俄语语言方面非常有效.
- 混合特征提取方法 (Mel-Spectrogram + MFCC) 与CRNN相结合,为低资源语言的识别提供了一个有希望的解决方案.
- 这项研究有助于推进代表性不足的语言家族的语音识别技术.


