语音意识层次增强和语义意识 SpecAugment 对于低资源的广东语语音识别
Lusheng Zhang1,2, Shie Wu1,2, Zhongxun Wang1,2
1School of Physics and Electronic Information, Yantai University, Yantai 264005, China.
Sensors (Basel, Switzerland)
|July 30, 2025
概括
这项研究引入了一个语音意识框架,以改善广东语自动语音识别 (ASR) 没有额外的数据. 该方法增强了发音多样性和上下文理解,大大降低了低资源音调语言的字符错误率.
科学领域:
- 人工智能的人工智能
- 语音处理 语音处理
- 计算语言学 计算语言学
背景情况:
- 广东语自动语音识别 (ASR) 面临着由于音调复杂性,声学变化和有限的标记数据的挑战.
- 现有的ASR模型与音色语言的细微差别作斗争,影响现实应用中的性能.
- 对于低资源语言的强大ASR系统的需求对于更广泛的可访问性和技术整合至关重要.
研究的目的:
- 开发一个语音意识的层次增强框架,以提高广东语ASR性能.
- 为了提高ASR的准确性,而不需要额外的手动注释或转录.
- 创建适用于其他低资源音调语言的模型独立方法.
主要方法:
- 使用蒙特利尔强制调整器和Tacotron-2来引入语音变化,实现了语音替换矩阵 (PSM).
- 采用了语义意识的 SpecAugment 策略,利用 wav2vec 2.0 的注意力和关键字界限进行适应性掩盖.
- 利用强化学习控制器在线调整掩盖时间表,以鼓励更广泛的上下文依赖.
主要成果:
- 在普通语音广东语50小时子集上,字符错误率 (CER) 从26.17%降至16.88% (wav2vec 2.0) 和38.83%降至23.55% (Zipformer).
- 在100小时内实现了进一步的CER减少,分别达到4.27%和2.32%,显示出显著的性能增长 (相对32-44%).
- 废除研究证实了音声水平增强和自适应掩盖技术的互补益处.
结论:
- 拟议的框架为改善广东语ASR准确性提供了实用和有效的解决方案.
- 语音意识的层次增强是独立于模型的,为低资源的音调语言提供了一种多功能方法.
- 智能传感导向框架显示出在边缘设备和语音交互系统中部署的潜力.


