一个音节字符协作模型,用于增强 Pinyin 和中文识别
Zeyuan Chen1, Cheng Zhong1,2, Danyang Chen1,2
1School of Computer, Electronics and Information, Guangxi University, Nanning, Guangxi, China.
PloS one
|July 7, 2025
概括
中国语音识别模型难以处理复杂的发音. 我们的音节 - 字符协作模型 (SCCM) 通过结合平等语音元素来提高准确性,显著减少字符错误.
科学领域:
- 自然语言处理自然语言处理.
- 语音识别技术 语音识别技术
- 计算语言学 计算语言学
背景情况:
- 端到端的中文语音识别模型往往直接输出字符,导致性能低于其他语言.
- 中国语言的复杂性,特别是文本和发音之间的复杂关系,构成了重大挑战.
- 现有的模型难以有效地捕捉中国语音的细微差别,影响整体准确性.
研究的目的:
- 通过解决字符发音关系的复杂性来提高中文语音识别的准确性.
- 引入一种由人类初学者语音学习过程所启发的新型模型.
- 为了减少汉语语音识别系统中的字符错误率.
主要方法:
- 提出了音节-字符协作模型 (SCCM),将音声元素如首字母,结尾和 pinyin 整合到培训过程中.
- 开发了一个Pinyin-Ensemble模块,利用集体学习来最大限度地减少 pinyin识别错误.
- 纳入语音信息作为辅助输入,模仿中文语言新手的学习进度.
主要成果:
- 与以前使用为辅助信息的端到端方法相比,SCCM表现出更高的性能.
- 与AISHELL-1基线相比,在字符错误率 (CER) 中实现了显著的45.7%的相对降低.
- 成功降低了 pinyin 和字符错误率,表明了语音和文本识别的改进.
结论:
- 音节-字符协作模型 (SCCM) 通过利用语音组件,有效地解决了中国语音识别的挑战.
- 整合 pinyin 和音节信息,以及对 pinyin 的合体学习,导致准确度大幅提高.
- 拟议的方法为推进中国语音识别技术提供了一个有希望的方向.


