通过SepFormer和分层注意力网络模型,通过多阶段转移学习来增强失节性语音识别
R Vinotha1, D Hepsiba2, L D Vijay Anand1
1Division of Robotics Engineering, Karunya Institute of Technology and Sciences, Coimbatore, Tamil Nadu, India.
Scientific reports
|November 28, 2024
概括
这项研究通过整合SepFormer-Speech Enhancement Generative Adversarial Network (S-SEGAN) 以提高清晰度来增强失节性语音识别 (DSR). 结合的方法显著提高了词识别准确性,符合层次的注意网络 (C-HAN) 实现了最高的性能.
科学领域:
- 语音技术 语言技术
- 人工智能的人工智能
- 生物医学工程 生物医学工程
背景情况:
- 脱发性关节障碍严重损害了语音清晰度,给自动语音识别 (ASR) 系统带来了挑战.
- 现有的ASR系统在与失节性言语特征的可理解性降低作斗争.
- 增强失节性语音识别 (DSR) 对于改善受影响个体的沟通可访问性至关重要.
研究的目的:
- 开发和评估一种用于增强异关节性发言识别 (DSR) 的新系统.
- 整合先进的语音增强技术作为DSR系统的前端.
- 评估不同模型架构和数据增强对DSR准确性的影响.
主要方法:
- 集成SepFormer-语音增强生成对抗网络 (S-SEGAN) 用于失节性语音增强 (DSE).
- 使用多阶段的转移学习方法,对LibriSpeech进行培训,并对失节性发言数据进行微调.
- 评估变压器和调整器模型,有或没有等级注意网络 (HAN),结合DSE和数据增强.
主要成果:
- 基线变压器和变压器模型实现了分别为68.60%和69.87%的文字识别精度 (WRA).
- 具有层次注意网络 (HAN) 的模型将WRA提高到71.07% (T-HAN) 和73% (C-HAN).
- 整合DSE和数据增强带来了显著的收益,Conformer-HAN模型实现了最高WRA的84.07%.
结论:
- 当与DSR模型集成时,拟议的S-SEGAN前端显著提高了DSR准确性.
- 多阶段转移学习和像Conformer-HAN这样的模型架构对于提高DSR性能是有效的.
- 这些发现表明,在为患有脱节症的人创造更强大,更准确的语音识别系统方面取得了重大进展.


