使用自动语音识别来测量从大脑信号中合成的语音的可理解性
Suvi Varshney1,2,3, Dana Farias4, David M Brandman1
1Department of Neurological Surgery, University of California, Davis.
概括
研究人员开发了一个AI Listener,以客观地评估大脑-计算机接口 (BCI) 语音恢复. 这种深度学习工具快速评估语音可理解性,克服了先前对无关节障碍用户的方法的局限性.
科学领域:
- 神经科学是一个神经科学.
- 人工智能的人工智能
- 语音技术 语言技术
背景情况:
- 大脑-计算机接口 (BCI) 具有恢复神经损伤患者功能的潜力.
- 通过BCI进行语音恢复,通过非说话个体的神经信号合成语音.
- 目前用于量化BCI语音质量的方法缺乏客观性,可扩展性和适用于无关节障碍的用户.
研究的目的:
- 引入基于深度学习的"AI Listener",用于客观,快速和自动评估BCI合成语音可理解性.
- 为了解决BCI语音质量评估缺少黄金标准指标的问题.
主要方法:
- 适应了领先的自动语音识别 (ASR) 深度学习模型 (Deepspeech, Wav2vec 2.0, Kaldi) 用于BCI语音评估.
- 在各种语音数据集上评估ASR模型的性能:健康,关节障碍和BCI合成的语音.
- 使用XLSR-Wav2vec 2.0,训练在语音上,以获得卓越的语音转录精度.
主要成果:
- 人工智能听众展示了客观和快速评估BCI语音可理解性.
- 在语音转录精度方面,XLSR-Wav2vec 2.0实现了卓越的性能.
- 人工智能听众识别了几个之前发表的BCI语音数据集是不可理解的,与人类听众的评估保持一致.
结论:
- 人工智能听众提供了一种强大,可扩展和客观的方法来评估BCI语音.
- 这个工具可以作为成本函数来改进BCI语音解码算法.
- 这些发现突出了人工智能的潜力,用于推进语言恢复技术,以帮助语言障碍患者.


