人类和机器在不利条件下进行语音识别
Chloe Patman1, Eleanor Chodroff2
1Theoretical and Applied Linguistics Section, Faculty of Modern and Medieval Languages and Linguistics, University of Cambridge, Sidgwick Avenue, Cambridge CB3 9DA, United Kingdom.
JASA express letters
|November 12, 2024
概括
人类听众通常会在自动语音识别系统中表现出色,即使在具有挑战性的条件下. 然而,在大多数测试的不良听取场景中,Whisper大型模型在对人类的表现上表现出了卓越的表现.
科学领域:
- 语音处理 语音处理
- 人与计算机的互动.
- 人工智能的人工智能是人工智能.
背景情况:
- 在自动语音识别 (ASR) 中追求与人类类似的性能一直是长期以来的目标.
- 大型口语语言模型 (SLMs) 的近期进展表明,人类水平的ASR能力有可能存在.
- 评估SLM与人类表现的直接比较研究,特别是在不利条件下,仍然有限.
研究的目的:
- 直接比较人类听者的表现与最先进的ASR系统.
- 在各种不利的听力条件下评估ASR性能,包括噪音和口罩语音.
- 为了确定SLM是否可以在语音识别任务中超越人类的表现.
主要方法:
- L1英国英语听众与两个ASR系统进行了测试:wav2vec 2.0和Whisper (基本和大型模型).
- 测试涉及不利条件:语音形状的噪音和模拟的酒吧噪音在不同的信号与噪声比率 (SNRs).
- 录音带有和没有面罩呈现,以模拟现实世界的声学挑战.
主要成果:
- 在所有测试条件下,人类听众的表现都超过了 wav2vec 2.0 模型和基本的 Whisper 模型.
- 在大多数条件下,与人类听众相比,Whisper大型模型实现了卓越的性能.
- 在模拟的酒吧噪音条件下,没有观察到大型低语模型对人类的优势.
结论:
- 虽然ASR系统正在得到改进,但在许多不利条件下,人类听众仍然具有优势.
- 大型的Whisper模型代表了显著的进步,在具有挑战性的听力环境中展示了人类水平或更高的性能.
- 需要进一步的研究,以了解ASR性能在复杂的真实世界声学场景中的细微差别.
更多相关视频
06:24Author Spotlight: Advancements in the Fabrication of Synthetic Vocal Fold Models for Phonetic and Robotic Applications
Published on: January 5, 2024
767
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
403
