语音到文本的开源和付费服务的比较:质量和输入多样性的分析
Antonino Ferraro1, Antonio Galli1, Valerio La Gatta1
1Department of Electrical Engineering and Information Technology, University of Naples "Federico II", Naples, Italy.
Frontiers in big data
|October 6, 2023
概括
这项研究对语音到文本 (STT) 服务进行了基准测试,发现虽然付费选项往往优于开源选项,但性能因输入文本类型而异. 基于音频特征的仔细选择对于最佳的转录至关重要.
科学领域:
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
- 语音识别技术 语音识别技术
背景情况:
- 语音到文本 (STT) 技术的采用正在增加,用于自动转录.
- 评估开源和付费STT服务对于选择特定任务的最佳工具至关重要.
研究的目的:
- 为了比较开源和付费STT服务的性能.
- 评估STT工具在各种输入文本类型中的性能.
主要方法:
- 利用来自采访,讲座和演讲的九个数据集作为STT工具的输入.
- 采用文字错误率 (WER) 作为评估STT性能的标准指标.
主要成果:
- 在基于输入文本的STT工具中观察到显著的性能差异.
- 某些工具在特定的音频样本类型中表现出色.
- 通过大数据集和多媒体挑战获得对STT绩效的洞察力.
结论:
- 付费的STT服务通常比开源替代品提供更好的准确性和速度.
- STT工具的性能取决于输入的音频特性.
- 选择合适的STT工具需要考虑音频样本的要求.


