评估声学表示和规范化,以对患有语音障碍的儿童进行罗特性分类
Nina R Benway1,2, Jonathan L Preston1, Asif Salekin3
1Communication Sciences & Disorders, Syracuse University, Syracuse, New York 13244, USA.
JASA express letters
|February 1, 2024
概括
年龄和性别的正常化显著改善了预测儿童罗特 /ɹ/ 感知的分类器. 在这个语音分析中,临床可解释的形式表现与Mel频率 cepstral 系数 (MFCC) 相比.
科学领域:
- 语音语言病理学 语言病理学
- 声学语音学的声音学.
- 在语音科学中的机器学习.
背景情况:
- 准确地分类儿童的语音发音对于早期识别语音障碍至关重要.
- 声学分析为语音声音特征提供了客观的测量方法.
- 了解声学特征和规范化技术的影响是开发强大的语音分析工具的关键.
研究的目的:
- 为了比较不同声学表示和规范化方法的有效性,用于分类儿童生产的rhotic声音 /ɹ/.
- 评价形成剂和Mel频率切布斯特尔系数 (MFCC) 在预测罗特与皮质 /ɹ/.的性能.
- 评估发言水平与基于年龄和性别的规范化对分类器准确性的影响.
主要方法:
- 从350个儿童扬声器中利用了声学特征,包括格式和MFCC.
- 应用了z-标准化规范化,比较发言内和年龄和性别匹配的典型 /ɹ/ 数据.
- 采用统计建模和深度神经网络进行分类,用于特征重要性分析采用沙普利增量解释.
主要成果:
- 与发言水平正常化相比,年龄和性别正常化显著提高了分类器的性能.
- 临床上可解释的形式剂实现了与MFCCs可比的性能.
- 个性化的深度神经网络模型在参与者特定预测方面达到0.81 (SD=0.10) 的平均F1得分.
- 沙普利的附加解释确定了第三个形式为预测完全罗特产物的最有影响力的特征.
结论:
- 年龄和性别的正常化是提高儿童自动语音分析准确性的关键因素.
- 基于Formant的声学特征是MFCC在语音感知研究中的深度学习应用的可行替代品.
- 这些发现支持使用个性化,数据驱动的模型来准确评估语音发育,形式提供临床可解释性.
更多相关视频
06:04Systematic Hearing Performance Evaluation Process for Adolescents with Cochlear Implantation at Early Ages
Published on: March 24, 2023
394
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
457
