评估普通话音调的发音准确性,用于第二语言学习者使用基于ResNet的语网络
Xiaolong Bu1, Weitong Guo2,3, Hongwu Yang4,5
1School of Educational Technology, Northwest Normal University, Lanzhou, 730070, China.
Scientific reports
|July 8, 2025
概括
本研究引入了使用语网络 (SN) 的自动普通话音调发音评估系统. 该系统通过分析音调轮,有效地识别了第二语言 (L2) 学习者的音调发音错误.
科学领域:
- 计算语言学 计算语言学
- 语音技术 语言技术
- 获得第二语言的学习.
背景情况:
- 掌握普通话的音调对于第二语言 (L2) 学习者至关重要.
- 目前用于评估音调发音的方法可能是主观的,耗时的.
- 需要客观和自动化的工具来评估普通话音调的准确性.
研究的目的:
- 开发和评估一种创新的自动方法来评估普通话语的音调发音.
- 使用语网络 (SN) 来分析音调轮和识别音调差异.
- 为L2普通话学习者提供准确的反关于他们的音色产生.
主要方法:
- 创建了一个专门的普通话语音库,包括标准和非标准的口音.
- 提取了pitch轮,使用局部加权回归平滑,并将其正常化到0-5级.
- 提取了两种类型的特征:一个1D矢量和一个2D图像对距轮的表示.
- 一个语网络被训练来比较配对的音色特征并检测发音错误.
- 使用各种深度学习模型 (ResNet-18,VGG-16,AlexNet) 和基线进行了实验.
主要成果:
- 拟议的语网络方法有效评估普通话发音中的音调差异.
- 无论是1D还是2D功能都显示出与多个模型的兼容性,而2D功能显示出与ResNet-18.8的优越一致性.
- 主观评价的平均平方误差 (MSE) 为2.295,根平均平方误差 (RMSE) 为1.515.
- 客观评估实现了0.189的MSE和0.435的RMSE.
- 具有2D功能的ResNet-18证明特别稳定和有效.
结论:
- 开发的自动评估方法准确地评估了普通话音调发音差异.
- 语网络方法,特别是2D功能和ResNet-18,为L2学习者提供了一个强大的解决方案.
- 这项研究为普通话学习者提供了先进的,自动化的音调评估系统的基础.


