两个阶段的数据增强,以提高ASR性能,以改善失节性言语
Chitralekha Bhat1, Helmer Strik2
1Centre for Language and Speech Technology (CLST), Radboud University Nijmegen, The Netherlands.
Computers in biology and medicine
|March 14, 2025
概括
这项研究引入了一种新的两阶段数据增强方法,以改善失节性语言的自动语音识别 (ASR). 该技术通过利用独特的语音特征,显著降低文字错误率 (WER).
科学领域:
- 语音技术 语言技术
- 人工智能的人工智能
- 生物医学工程 生物医学工程
背景情况:
- 精确的自动语音识别 (ASR) 对于缺关节性语音是具有挑战性的,因为数据有限.
- 机器学习 (ML) 和深度神经网络 (DNN) 是有前途的,但需要大量的数据.
- 发病性发言表现出独特的特征,阻碍了标准的ASR模型训练.
研究的目的:
- 开发和评估一种新的两阶段数据增强方案,以提高 ASR 对失节性言语的性能.
- 为了解决数据稀缺问题,在训练ML/DNN模型中用于失关节性语音识别.
- 为了提高音箱依赖ASR系统的准确性,用于患有脱节症的人.
主要方法:
- 实现了两阶段的数据增强:静态增强 (扰动,发声,语音转换) 和动态增强 (失联特征增强).
- 使用变压器声学模型进行端到端的ASR系统.
- 预先使用增强健康语音训练了一种声学模型,然后用失关节性语音数据对其进行微调.
主要成果:
- 在文字错误率 (WER) 中实现了10.7%的绝对改进.
- 与没有增强的基线相比,WER的相对改善率为29.2%.
- 在UA 脱关节性语音体上获得了25.9%的最终语音依赖性WER.
结论:
- 拟议的两阶段数据增强方案有效地提高了失节性言语的ASR性能.
- 在增强中利用失节性语音特征对于提高识别精度至关重要.
- 这种方法为失关节性ASR的数据稀缺问题提供了可行的解决方案.


