基准测试自动语音识别技术用于自然语言样本的儿童与或没有发育迟缓
概括
自动语音识别 (ASR) 对自然语言采样 (NLS) 研究有前途,但与幼儿,特别是唐氏综合征 (DS) 儿童相斗争. 人类监督对于各种语言模式的准确临床转录至关重要.
科学领域:
- 临床语言学 临床语言学
- 语音技术 语言技术
- 发展心理学 发展心理学
背景情况:
- 自然语言采样 (NLS) 提供了有价值的现实世界语音数据,但依赖于昂贵的人类转录.
- 自动语音识别 (ASR) 为简化NLS数据处理提供了一个潜在的解决方案.
- 在临床环境中ASR的有效性,特别是对于幼儿和发育迟缓的儿童,在很大程度上还没有得到研究.
研究的目的:
- 评估OpenAI Whisper ASR模型的性能,用于转录来自幼儿的语音数据.
- 为了比较患有唐氏综合征 (DS) 的儿童的ASR准确度与典型发育 (TD) 的儿童.
- 评估ASR的能力,以捕捉与发展相关的语言特征超越单词.
主要方法:
- 分析了34个自然语言采样 (NLS) 会议.
- 参与者包括患有唐氏综合征的幼儿 (DS; n=19; 2-5岁) 和典型发育 (TD) 的幼儿 (n=15; 2-3岁).
- OpenAI Whisper ASR输出被手动与人类转录进行了比较.
主要成果:
- 对于TD儿童来说,ASR准确地转录了50%的单词,但对于DS儿童来说,只有14%.
- 文字错误率包括大约20%的遗漏词和21%的替换词 (TD) 与6% (DS).
- 在DS组中,ASR未能捕捉到近50%的非语音发音,并误解了大多数其他发音.
结论:
- 虽然ASR可以减少转录时间,但其当前的局限性需要临床研究的人在循环系统.
- 唐氏综合征儿童的ASR表现明显低于唐氏综合征儿童,这突显了代表性不足的群体之间的差异.
- 需要进一步开发ASR以准确地处理临床人群中多样化和发育信息化的语音模式.


