使用深度学习技术进行图像分类驱动的语音障碍检测
Nasser Ali Aljarallah1, Ashit Kumar Dutta1, Abdul Rahaman Wahab Sait2
1Department of Computer Science and Information Systems, College of Applied Sciences, AlMaarefa University, Ad Diriyah, Riyadh, 13713, Saudi Arabia.
SLAS technology
|March 8, 2025
概括
本研究引入了一种使用Mel谱图分类的自动语音障碍检测 (SDD) 模型. 这种新的方法实现了99.1%的准确性,为语言障碍提供了高效和可访问的诊断工具.
科学领域:
- 医疗成像医学成像
- 人工智能的人工智能
- 语言病理学 语音病理学
背景情况:
- 语音障碍显著影响沟通,社会互动,教育和生活质量.
- 早期和精确的诊断对于成功的干预至关重要,但目前的临床检查是耗时和主观的.
- 需要自动语音障碍检测 (SDD) 模型来克服手动临床评估的局限性.
研究的目的:
- 提出基于Mel光谱图像分类的自动语音障碍检测 (SDD) 模型.
- 使用先进的机器学习技术,准确有效地识别多种语言障碍.
- 提高语音障碍诊断工具的可访问性和效率.
主要方法:
- 从语音样本中生成Mel谱图,使用波形变形 (WT) 杂交技术.
- 为了从Mel光谱图中提取增强的特征,使用了一个LEVIT变压器.
- 组合学习 (EL) 方法,结合CatBoost,XGBoost和极端随机树,用于分类. 使用量化意识培训 (QAT) 来减少计算资源.
主要成果:
- 拟议的模型在VOICED和LANNA数据集上实现了99.1%的特殊准确性.
- 该模型以有限数量的参数 (80万) 证明了效率.
- 使用沙普利增量解释 (SHAP) 值来确保模型的可解释性.
结论:
- 开发的自动化SDD模型显著提高了语音障碍分类的准确性和效率.
- 这种方法为开发可访问和可靠的诊断工具提供了有希望的前景.
- 未来的研究可以整合多式联络数据,以便在各种语言和方言中更广泛地应用,从而实现实时临床和远程医疗部署.


