探索使用双胞胎语音和基于深度学习的人工神经网络的自动语音识别的性能
Julio Cesar Cavalcanti1,2,3, Ronaldo Rodrigues da Silva4, Anders Eriksson1
1Laboratory of Phonetics, Department of Linguistics, Stockholm University, Stockholm, Sweden.
Frontiers in artificial intelligence
|February 26, 2024
概括
自动语音识别 (ASR) 系统因高度相似而与同卵双胞胎作斗争. 较长的语音样本通过减少变性,显著提高ASR准确性.
科学领域:
- 语音处理 语音处理
- 生物识别信息 生物识别信息
- 机器学习 机器学习
背景情况:
- 自动扬声器识别 (ASR) 系统对于安全和认证至关重要.
- 区分高度相似的扬声器,如同卵双胞胎,仍然是ASR系统面临的重大挑战.
- 语音样本长度对ASR表现的影响,特别是在具有挑战性的场景中,需要进一步调查.
研究的目的:
- 评估扬声器相似性,特别是同卵双胞胎对ASR系统性能的影响.
- 评估语音样本长度对语音识别准确性的影响.
- 分析SpeechBrain工具包在区分高度相似的扬声器中的性能.
主要方法:
- 在自发对话和采访中利用了20名男性同卵双胞胎演讲者的数据集.
- 使用5到30秒的语音样本测试了SpeechBrain工具包的ASR性能.
- 使用等错率 (EER) 和日志概率比率 (Cllr) 评估系统性能.
主要成果:
- 一卵双胞胎构成了相当大的挑战,降低了整体扬声器识别准确度.
- 较长的语音样本 (长达30分钟) 比较短的样本显著提高了表现.
- 增加样本大小减少了扬声器相似性/不相似性得分的变化,改善了估计.
结论:
- 高音箱相似性,以同卵双胞胎为例,显著降低了ASR系统的准确性.
- 增加语音样本长度是一种可行的策略,可以提高ASR性能并减少变化.
- 一卵双胞胎之间的相似程度各不相同,这给ASR系统带来了不同的挑战.


