一个基于WaveNet的模型,用于从声学语音信号中预测电图信号
Huanchen Cai1, Sten Ternström1
1Division of Speech, Music and Hearing, School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology, SE-100 44 Stockholm, Sweden.
The Journal of the Acoustical Society of America
|April 18, 2025
概括
这项研究开发了一个神经网络,可以从语音中预测电造影 (EGG) 信号. 该模型准确地估计了正常发音期间的声接触,但显示了呼吸或过渡语音条件的限制.
科学领域:
- 语音科学 语言科学
- 生物声学是一种生物声学.
- 信号处理 信号处理
背景情况:
- 电光学 (EGG) 信号提供了非侵入性的语音分析.
- 声接触显著影响语音质量和声学指标的解释.
- 从麦克风语音中预测EGG信号对于语音分析是有价值的.
研究的目的:
- 开发和评估一个神经网络模型来估计来自语音的EGG信号.
- 评估模型捕捉EGG波形的时间动态和形态的能力.
- 为了调查模型在不同音调类型的准确性.
主要方法:
- 使用WaveNet架构与EGG信号估计的自我注意机制.
- 在一个涵盖完整语音范围的全面数据集上训练模型.
- 使用语音映射来评估预测和地面真相EGG指标之间的相似性.
主要成果:
- 该模型准确地捕捉了标准声EGG波形的时间动态和形态.
- 预测的EGG输出与波形和提取的指标非常相似.
- 在稳定,接触式表达条件下实现了准确的估计.
结论:
- 拟议的神经网络有效地估计了来自语音的EGG信号,用于规范声条件.
- 该模型显示过渡状态和呼吸声声状态的精度降低.
- 为了提高非模态语音品质的性能,需要进一步改进.


