作为训练目标的口罩类型对语音可理解性和语音质量的影响 耳植入物降噪
Fergal Henry1, Martin Glavin2, Edward Jones2
1Department of Computing and Electronic Engineering, Atlantic Technological University, Ash Lane, F91YW50 Sligo, Ireland.
Sensors (Basel, Switzerland)
|October 26, 2024
概括
两种新的语音增强口罩,量子化口罩 (QM) 和相位敏感加理想比例口罩 (PSM+),提高了耳植入物的性能. 这些口罩在噪音条件下提高了语音可理解性和语音质量,优于现有的方法.
科学领域:
- 信号处理 信号处理
- 听觉神经科学 听觉神经科学
- 机器学习 机器学习
背景情况:
- 深度神经网络需要仔细选择目标,以有效增强语音.
- 不同的面具 (例如,理想的二进制面具,理想的比例面具) 在语音处理中提供不同的性能特征.
- 耳植入物在语音增强方面存在独特的挑战,原因是信号处理的局限性.
研究的目的:
- 在耳植入物模拟中全面比较五种不同的降噪口罩.
- 介绍和评估两种新型面具:量子化面具 (QM) 和相位敏感加理想比率面具 (PSM+).
- 评估这些口罩在不同噪音条件下提高语音可理解性和语音质量的有效性.
主要方法:
- 使用五种面具训练深度神经网络:理想二进制面具 (IBM),理想比率面具 (IRM),快速富里埃变换面具 (FFTM),量子化面具 (QM) 和相位敏感加理想比率面具 (PSM+).
- 使用语音编码器模拟语音处理的耳植入物行为.
- 使用短期客观可理解性 (STOI),语音质量的感知评估 (PESQ),规范化协差量 (NCM) 和相似性得分来评估表现.
主要成果:
- 拟议的量化面罩 (QM) 和相位敏感加理想比率面罩 (PSM+) 在各种信号对噪声比率 (SNR) 中表现出语音可理解性和质量的卓越性能.
- 在静止和非静止的噪音环境中,QM和PSM+的表现优于既有的面具 (IBM,IRM,FFTM).
- 通过近似维纳增益函数,QM显示了比IBM更好的分辨率;PSM+通过整合大小和相位信息表现出色.
结论:
- 量化面罩 (QM) 和相位敏感加理想比率面罩 (PSM+) 代表了耳植入物使用者语音增强方面的重大进步.
- 这些新的口罩有效地提高了语音的可理解性和质量,为杂的听力条件提供了更好的解决方案.
- 在PSM+中看到的大小和阶段信息的整合,对于最佳的语音增强性能至关重要.


