流动性银行时间:用于失流感检测和自动预期语音识别的更新数据集
Amrit Romana1, Minxue Niu1, Matthew Perez1
1University of Michigan.
Journal of speech, language, and hearing research : JSLHR
|October 8, 2024
概括
这项研究更新了FluencyBank数据集的时间和失流性标签,揭示了的人 (PWS) 语音识别和失流性检测的性能差距. 新的FluencyBank时间标记数据集旨在改善PWS的语音处理模型.
科学领域:
- 计算语言学 计算语言学
- 语音处理 语音处理
- 人与计算机的交互
背景情况:
- 语音处理模型通常对的人 (PWS) 的语音表现不太准确.
- 现有的数据集可能无法充分反映不流利言语的细微差别.
- 需要专门的数据集来对不同语音模式进行基准测试和改进模型.
研究的目的:
- 推出FluencyBank Timestamped,这是一个更新的数据集,具有精确的单词时间和失流性注释.
- 为了使语言处理模型对典型语音与口吃语音进行比较分析.
- 在PWS语音上对语音识别和失语检测模型的性能进行基准测试.
主要方法:
- 更新了FluencyBank数据集,包括半自动,手动检查的成绩单,时间和失流性标签.
- 评估语音语用于预期的语音识别和BERT/Whisper用于失语检测.
- 在Switchboard (典型语音) 和FluencyBank Timestamped (PWS语音) 上比较模型性能.
主要成果:
- 预期语音单词错误率 (isWER) 在数据集之间是可比的,但Whisper在FluencyBank Timestamped中更频繁地转录了填写的暂停和部分单词.
- isWER在FluencyBank时间标记内增加了口吃的严重程度.
- 模型在PWS语音中遇到了重复检测的困难,这表明了泛化问题.
结论:
- 在典型语音和PWS语音的语音处理模型之间存在显著的性能差距.
- 流动银行时间是研究人员的宝贵资源,旨在缩小这些绩效差距.
- 需要进一步的进步,以开发强大的语音处理模型,在所有扬声器中均等地执行.


