北山西方言的端到端语音识别模型:设计和评估
1College of Computer Science & Technology, Xi'an University of Science and Technology, Xi'an 710054, China.
Sensors (Basel, Switzerland)
|January 25, 2025
概括
这项研究为北西方言开发了一种新的语音识别模型,为煤矿业实现了显著的准确性改进. 调整器-变压器-CTC模型减少了文字错误率,增强了实际应用.
科学领域:
- 语音识别 语音识别 语言识别
- 计算语言学 计算语言学
- 人工智能的人工智能
背景情况:
- 北西方言被称为"沙普",在该地区的煤矿业中很普遍.
- 现有的语音识别技术往往与当地方言的独特语音特征和快速语音节奏作斗争.
- 在煤矿行业内,实际上需要针对北西方言的准确语音识别系统.
研究的目的:
- 开发和评估一个端到端的语音识别模型,专门用于煤矿行业中使用的北西方言.
- 为了应对方言独特的发音,快速的语音节奏和多声性质所带来的挑战.
- 提高区域方言语音识别技术的性能和实用性.
主要方法:
- 提出了一个基于Conformer架构的端到端语音识别模型.
- 开发了一个专门的语料库,反映了方言的语音特征和工业用途.
- 研究了方言特定的特征提取和预处理模块,用于快速发言和多音.
- 集成了解码器的变压器架构,并使用连接式时间分类 (CTC) 联合培训进行优化.
主要成果:
- 拟议的Conformer-Transformer-CTC模型在自建语音数据集上表现出卓越的性能.
- 与独立的Conformer模型相比,文字错误率降低了9.2%.
- 与独立的变压器模型相比,文字错误率降低了10.3%.
- 结果证实了对方言语音识别提出的方法的进步和有效性.
结论:
- 调整器-变压器-CTC模型在识别山西北部方言方面取得了重大进步,特别是在煤炭开采的背景下.
- 该研究强调了专门的corpora和针对方言语音识别的定制模型架构的重要性.
- 未来的研究将专注于整合外部语言模型和提取各种方言发音特征,以进一步提高识别性能.
更多相关视频
06:04Systematic Hearing Performance Evaluation Process for Adolescents with Cochlear Implantation at Early Ages
Published on: March 24, 2023
330
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
390
