ChildAugment:用于零资源儿童扬声器验证的数据增强方法
Vishwanath Pratap Singh1, Md Sahidullah2,3, Tomi Kinnunen1
1School of Computing, University of Eastern Finland, Joensuu 80130, Finland.
The Journal of the Acoustical Society of America
|March 26, 2024
概括
ChildAugment通过增强成人语音数据来模仿儿童声道来改善儿童的自动扬声器验证 (ASV). 这种数据增强技术显著提高了ASV系统对儿童声音的准确性.
科学领域:
- 语音处理 语音处理
- 生物识别信息 生物识别信息
- 机器学习 机器学习
背景情况:
- 由于数据稀缺,受过成人语音训练的自动语音验证 (ASV) 系统在儿童语音上表现不佳.
- 有效地重用成人语音数据对于为儿童开发准确的ASV至关重要.
- 针对儿童的数据增强是一种有前途的方法,可以弥合绩效差距.
研究的目的:
- 介绍和评估ChildAugment,这是一个用于儿童言语的新型数据增强方法.
- 为了提高儿童基于深度学习的ASV系统的准确性.
- 将ChildAugment与现有的数据增强技术和评分方法进行比较.
主要方法:
- ChildAugment通过调整形式频率和带宽来修改成人语音频谱,以模拟儿童的声道特征.
- 增强数据用于训练时间延迟神经网络 (TDNN) 识别器,强调道注意力,传播和聚合.
- 该研究将ChildAugment与最先进的增强方法进行比较,并评估了各种各样的评分技术,包括共弦评分,PLDA和神经PLDA.
主要成果:
- ChildAugment在儿童语音的 ASV 准确度方面取得了显著的改善,男孩的相对改善率高达12.45%,女孩的相对改善率高达11.96%.
- 拟议的低复杂度加权的等号积分对极其低资源儿童的 ASV 场景显示出希望.
- 这些发现强调了儿童增强作为一种有效的,以声学为动机的方法来增强儿童的ASV.
结论:
- ChildAugment是一种简单而有效的数据增强策略,用于改进儿童的基于深度学习的ASV系统.
- 该方法成功地利用成人语音数据,通过声学调整来更好地代表儿童的语音特征.
- 该研究提供了可重复的评估协议和代码,促进了儿童说话验证的进一步研究.


