使用基于注意力的ResNet-BiLSTM进行非侵入性语音质量评估.
Kailai Shen1, Diqun Yan1, Zhe Ye1
1Faculty of Electrical Engineering and Computer Science, Ningbo University, Ningbo, China.
概括
本研究引入了一种用于在线会议中进行非侵入性语音质量评估 (NISQA) 的新型网络. 拟议的ResNet-BiLSTM框架可以准确地预测语音质量,而不需要清洁的参考信号.
科学领域:
- 计算机科学 计算机科学
- 信号处理 信号处理
- 语音技术 语言技术
背景情况:
- 在线会议的语音质量因噪音,反响,数据包丢失和网络动而降低.
- 在现实世界中评估语音质量是具有挑战性的,因为没有清洁的参考信号.
- 有效的非侵入性语音质量评估 (NISQA) 方法对于在线通信平台至关重要.
研究的目的:
- 为准确的非侵入性语音质量评估 (NISQA) 开发一个新的网络框架.
- 为了解决现有方法的局限性,特别是针对NISQA的特征提取中的潜在情境信息丢失.
主要方法:
- 提出了一个混合网络架构,将ResNet和双向长短期内存 (BiLSTM) 结合起来.
- ResNet被用来从语音信号中提取局部声学特征.
- 开发了一种修改后的ResNet变体,以保存时间信息,这对于语音分析至关重要.
- BiLSTM被用来建模语音特征的长期依赖性和顺序特征.
主要成果:
- 拟议的ResNet-BiLSTM框架显示了与主观平均意见得分 (MOS) 的高相关性.
- 该方法有效地评估了清洁,噪音和处理的语音信号的质量.
- 修改后的ResNet组件成功保存了重要的时间序列信息.
结论:
- 开发的NISQA方法提供了一个强大的解决方案,用于在具有挑战性的在线会议环境中评估语音质量.
- 整合ResNet和BiLSTM提供了一种有效的方法,用于捕捉语音中的本地和顺序特征.
- 这一框架提升了自动语音质量评估的能力,而不需要原始的清洁语音信号.


