通过多嵌入模型和自动语音识别,先进的口音/方言识别和口音评估.
Shahram Ghorbani1, John H L Hansen1
1Center for Robust Speech Systems (CRSS), The University of Texas at Dallas, Richardson, Texas 75080, USA.
The Journal of the Acoustical Society of America
|June 17, 2024
概括
先进的语言和扬声器识别模型提高了口音分类的准确性. 这些系统可靠地评估非母语发音,与人类对语言学习和语音技术进步的感知相关联.
科学领域:
- 语音处理 语音处理
- 计算语言学计算语言学
- 人工智能的人工智能是人工智能.
背景情况:
- 准确的口音分类和口音评估是具有挑战性的,因为不同的语音变异.
- 现有的方法在与非母语人士的口音和方言的复杂性作斗争.
研究的目的:
- 通过使用预训练的语言识别 (LID) 和扬声器识别 (SID) 模型,增强口音分类和非母语口音度评估.
- 开发一个多嵌入式系统,以提高口音识别 (AID) 的准确性.
- 调查使用自动语音识别 (ASR) 和AID模型进行客观的口音估计.
主要方法:
- 从先进预训练的LID和SID模型中利用嵌入.
- 将LID和SID嵌入式与端到端 (E2E) AID模型集成.
- 利用在美国英语 (en-US) 上训练的E2E ASR模型和AID模型的en-US输出进行得分.
- 将客观得分与主观的人类感知得分相关联.
主要成果:
- 经过预训练的LID和SID模型有效地编码了口音和方言信息.
- 结合LID,SID和E2E AID嵌入的多嵌入式AID系统可以实现卓越的准确性.
- ASR错误率和AID模型输出提供可靠的客观重音度得分.
- 客观评分显示了相互之间和主观人类评估之间强烈的相关性.
结论:
- 预训练的LID和SID模型显著改善了口音分类和口音评估.
- 拟议的多嵌入式AID系统为口音识别提供了更高的准确性.
- 基于ASR和AID的系统提供了一种可靠和有效的方法,用于客观地估计口音.
- 这些进步对语言学习,语音可理解性和扬声器识别技术有重大影响.


