多语种端到端的ASR用于低资源的土耳其语语言,具有共同的字母表
Akbayan Bekarystankyzy1,2, Orken Mamyrbayev3, Mateus Mendes4,5
1Satbayev University, Almaty, Kazakhstan. akbayan.b@gmail.com.
Scientific reports
|June 15, 2024
概括
使用连接主义时间分类的多语言培训改善了土耳其语语言的自动语音识别 (ASR). 这种方法显著减少了像吉尔吉斯语这样的资源极低的语言的错误.
科学领域:
- 计算语言学 计算语言学
- 语音处理 语音处理
- 机器学习 机器学习
背景情况:
- 高质量的转录音频数据对于开发准确的自动语音识别 (ASR) 模型至关重要.
- 许多语言,特别是聚合性土耳其语言,面临着这种转录数据的稀缺性,阻碍了ASR的发展.
- 现有关于低资源ASR的研究通常采用多语言培训和转移学习.
研究的目的:
- 调查多语言培训对提高ASR性能在低资源的土耳其语语言的有效性.
- 将五种土耳其语言 (哈萨克语,巴什基尔语,吉尔吉斯语,萨哈语,塔塔尔语) 结合起来,形成一个多语言的ASR模型.
- 为了在土耳其语家族中利用共同的语言特征,如同类词,语法和西里尔文字.
主要方法:
- 使用连接主义时间分类 (CTC) 具有注意力机制和多语言培训的语言模型.
- 使用来自开源Common Voice数据库的数据来确保可重复性.
- 在五种聚合性土耳其语的综合数据集上训练了一个单一的ASR模型.
主要成果:
- 多语种培训提高了ASR的表现,包括大多数土耳其语,除了巴什基尔语.
- 吉尔吉斯语的文字错误率 (近五分之一) 和字符错误率 (四分之一) 显著降低.
- 该研究证明了多语言培训的可行性,以改善ASR在低资源语言场景中的ASR.
结论:
- 多语言培训是提高低资源聚合性语言的自动语音识别的有益方法.
- 这种积极影响对于关键数据稀缺的语言 (如吉尔吉斯语) 尤其明显.
- 这种方法为为代表性不足的语言家族开发更强大的ASR系统提供了实际解决方案.


