阿拉伯语语音识别模型使用百度的深度和集群学习
Fawaz S Al-Anzi1, Bibin Shalini Sundaram Thankaleela1
1Department of Computer Engineering, College of Engineering and Petroleum, Kuwait University, Kuwait.
Frontiers in artificial intelligence
|September 22, 2025
概括
这项研究提高了阿拉伯语语音识别,使用K-means集群在Mel-frequency cepstral系数 (MFCCs) 和百度上.
科学领域:
- 计算语言学 计算语言学
- 机器学习 机器学习
- 语音处理 语音处理
背景情况:
- 阿拉伯语自动语音识别 (ASR) 由于语言复杂性而存在独特的挑战.
- 在ASR中,无监督学习方法对于处理未标记的音频数据至关重要.
- 现有的ASR模型需要重要的标记数据来进行有效的培训.
研究的目的:
- 通过使用无监督集群技术来提高阿拉伯语ASR的准确性.
- 评估各种分类算法对集群音频特征的性能.
- 为了证明百度对阿拉伯语ASR的Deep Speech框架的有效性.
主要方法:
- 从未标记的阿拉伯语音频中提取Mel频率塞普斯特拉系数 (MFCC).
- 应用K-means集群用于MFCC特征的无监督分组.
- 使用决策树,XGBoost,KNN和随机森林进行分类;使用集群数据培训和测试百度的深度语言.
主要成果:
- K-means集群成功分类了声学上相似的阿拉伯语音频段.
- 百度的Deep Speech模型实现了0.3720的低文字错误率 (WER) 和0.0568.8的字符错误率 (CER).
- 提出的方法表明,阿拉伯语ASR的准确性显著增加.
结论:
- 无监督的MFCC集群是阿拉伯ASR的有效预处理步骤.
- 百度的Deep Speech框架在集群数据上训练时,可以提供高性能阿拉伯语语音识别.
- 综合方法提高了阿拉伯语言的ASR准确性,精度和效率.
更多相关视频
05:48Memorization-Based Training and Testing Paradigm for Robust Vocal Identity Recognition in Expressive Speech Using Event-Related Potentials Analysis
Published on: August 9, 2024
10:55Enhancing an Avian Sound Recognition Model's Detection Precision via Logistic Regression of Large Acoustic Datasets: A Case Study of the European Robin (Erithacus rubecula)
Published on: April 11, 2026
