分段和超分段语音基础模型用于分类认知风险因素:评估突出的表现
Si-Ioi Ng1, Lingfeng Xu1, Kimberly D Mueller2
1Arizona State University, USA.
概括
语音分析的基础模型在检测认知衰退方面表现有前途. Wav2Vec2.0在将参与者分类为粉样β阳性,轻度认知障碍或痴呆症方面表现优于Trillsson.
科学领域:
- 计算语言学计算语言学
- 神经科学是一个神经科学.
- 人工智能的人工智能是人工智能.
背景情况:
- 语音基础模型在消费技术方面表现出色,但由于数据集小,在临床环境中面临挑战.
- 将这些模型适应临床使用需要强大的方法来分析与认知健康相关的语音模式.
研究的目的:
- 评估两种语音基础模型Wav2Vec2.0 (分段) 和Trillsson (超分段) 在分类认知衰退中的有效性.
- 为了比较他们在区分健康对照组 (HC) 和具有粉样β阳性 (Aβ+),轻度认知障碍 (MCI) 和痴呆症的个体中的表现.
主要方法:
- 利用Wav2Vec2.0和Trillsson模型分析来自不同认知状态的参与者的语音数据.
- 将说话者分为HC,Aβ+,MCI或痴呆症组.
- 进行交叉验证以评估模型性能和计算效果大小和可重复性.
主要成果:
- Wav2Vec2.0和Trillsson都发现了与认知衰退相关的语言差异,HC和风险组之间的效果大小.
- 在从HC分类时,Wav2Vec2.0的表现始终优于Trillsson,平均宏观F1得分为54.1% (Aβ+),63.5% (MCI) 和72.0% (痴呆症).
- 重复性 (类内相关性) 为Trillsson的0.30和Wav2Vec2.0.0.的0.41.
结论:
- 语音基础模型,特别是Wav2Vec2.0,表明了分类认知衰退阶段的潜力.
- 为了有效的临床语音分析和对认知健康的纵向跟踪,需要进一步提高模型可靠性.


