轻量级实时语音增强:状态空间模型和多光谱扫描技术
Xiaodong Zhu1, Junqi Yang1, Yuhong Yang1
1National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, China; Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China.
概括
本研究介绍了一种轻量级的Mamba状态空间模型 (SSM) 框架,用于实时语音增强. 新的多光谱扫描技术显著提高了语音质量和清晰度,同时保持了高效率.
科学领域:
- 信号处理 信号处理
- 机器学习 机器学习
- 听觉感知是一种听觉感知.
背景情况:
- 实时语音增强需要平衡信号质量和计算成本.
- 现有的方法经常因长期依赖和计算开销而扎.
研究的目的:
- 开发一个轻量级的,端到端的语音增强框架,用于实时通信.
- 有效地提高语音信号质量和清晰度.
主要方法:
- 利用了Mamba状态空间模型 (SSM),使用了新的多光谱扫描技术 (全频段,子频段,交叉频段).
- 集成的ERB压缩用于听觉感知模拟和高频重建.
- 用人语音活动检测 (VAD) 损失用于时间特征改进.
- 在定制合成数据集上接受培训,并根据ICASSP SSI和VoiceBank+DEMAND基准进行评估.
主要成果:
- 与最先进的模型相比,拟议的框架在总体质量 (OVRL) 和语音清晰度 (SIG) 方面取得了更好的表现.
- 在VoiceBank+DEMAND对整体语音增强的基准指标上表现出显著的改善.
- 保持了高的计算效率,使其适合实际应用.
结论:
- 轻量级的Mamba-SSM框架为实时语音增强提供了有效的解决方案.
- 新的多谱扫描和听觉启发的技术有助于提高性能.
- 该模型为实际的语音处理应用提供了一个有希望的,高效的方法.


