通过机器学习的镜头评估Pepper机器人的语音识别系统
Akshara Pande1, Deepti Mishra1
1Educational Technology Laboratory, Intelligent System and Analytics Group, Department of Computer Science (IDI), Norwegian University of Science and Technology, 2815 Gjøvik, Norway.
Biomimetics (Basel, Switzerland)
|July 26, 2024
概括
这项研究发现,人形机器人Pepper能够准确地捕捉到距离一米远的语音. 年龄和性别不会影响语音识别的准确性,增强其用于生成字幕的使用.
科学领域:
- 人与机器人的交互
- 语音识别技术 语音识别技术
- 声学信号处理 声学信号处理
背景情况:
- 语音理解方面的挑战会影响沟通的有效性.
- 像Pepper这样的人形机器人可以通过显示文本来帮助理解.
- 准确的音频录制对于机器人辅助通信至关重要.
研究的目的:
- 为了评估人形机器人Pepper的语音识别准确度.
- 用Pepper识别捕获清晰音频录制的最佳条件.
- 评估音频特征和参与者人口统计学对语音识别的影响.
主要方法:
- 从八名与Pepper互动的参与者那里捕获了音频录音.
- 音频特征包括Mel-Frequency Cepstral 系数,光谱心状,平度,零度交叉率,音调和能量都被提取出来.
- 使用K-means集群和Whisper语音到文本工具来识别最准确的语音录音,文字错误率 (WER) 值为0.3.
主要成果:
- 最佳的语音记录准确度是在距离Pepper一米之内实现的.
- 参与者的年龄和性别并没有显著影响录制语音的准确性.
- 该研究确定了特定的音频特征和集群方法,以优化语音识别.
结论:
- 胡的语音识别系统在需要文字显示的应用程序中有效在一米范围内.
- 这些发现支持在需要通过字幕增强理解的环境中使用Pepper.
- 该方法为评估基于机器人的语音识别系统提供了一个框架.


