PVGAN:一种病态的语音生成模型,结合了一种渐进的化策略
Xiaoying Pan1, Tong Feng1, Nijuan Zhang1
1Shaanxi Key Laboratory of Network Data Analysis and Intelligent Processing, Xi'an University of Posts and Telecommunications, Xi'an 710121, China; School of Computer Science & Technology, Xi'an University of Posts and Telecommunications, Xi'an 710121, China.
Journal of voice : official journal of the Voice Foundation
|November 8, 2023
概括
这项研究引入了一种新的PVGAN网络,用于生成病态语音数据,解决有限的样本大小. 该方法通过学习音频频率信息和改进数据集来提高语音障碍诊断的准确性.
科学领域:
- 医学技术 医学技术 医学技术
- 人工智能的人工智能是人工智能.
- 语音处理 语音处理
背景情况:
- 有限的病理语音数据阻碍了准确的语音障碍诊断.
- 现有的模型缺乏病态声音中音调,音色和频率组件的详细特征学习.
研究的目的:
- 提出一个PVGAN网络,用于生成病态语音数据.
- 通过增加数据集大小和学习详细的音频功能来改善语音障碍诊断.
主要方法:
- 开发了一个PVGAN网络,具有多个尺度的感知残余块和周期性歧视器.
- 实施了一种渐进式嵌套策略,用于生成器-歧视器集成.
- 设计了一个潜在的映射网络,用于条件语音特征生成.
- 优化了损失函数,以提高模型性能.
主要成果:
- 生成的病态语音数据与萨尔布鲁肯语音数据库 (SVD) 上的原始数据特征密切匹配.
- PVGAN网络有效地学习了音频信号中的多尺度特征和周期性模式.
- 使用生成的数据进行数据集扩展,从而提高了分类实验的准确性.
结论:
- PVGAN网络为病态语音数据生成提供了一个可行的解决方案.
- 这种方法可以显著提高语音障碍诊断系统的准确性和适用性.
- 该方法显示了在医学诊断和相关领域广泛应用的潜力.


