强大的双模态语音关键字发现XR耳机
IEEE transactions on visualization and computer graphics
|March 4, 2024
概括
这项研究引入了一种新的双模态关键词发现系统,用于扩展现实 (XR),该系统融合了语音和唇部运动. 该系统在噪音条件下显著提高了准确性,并使无声语音识别成为可能.
科学领域:
- 人与计算机的交互
- 语音处理 语音处理
- 虚拟现实 虚拟现实 虚拟现实
背景情况:
- 在扩展现实 (XR) 中,传统的基于语音的关键词发现面临诸如噪音干扰,沉默要求和错误激活等挑战.
- 整合语音和唇部运动数据为更强大的关键字发现提供了潜在的解决方案.
研究的目的:
- 为XR耳机提出和评估一种新的声响双模式关键字发现系统.
- 评估融合语音和唇部运动信息的有效性,以提高关键字发现性能.
主要方法:
- 为XR开发一个声响双模式关键字发现系统.
- 实施和比较两个不同的模式融合方法.
- 在各种声学场景中进行实验测试,包括杂的环境和静音语音检测.
主要成果:
- 双模系统在典型和噪音环境中始终优于单模系统.
- 该系统表现出高精度,并成功识别了沉默的发言.
- 实时演示产生了有希望的性能结果.
结论:
- 语音和唇部运动信息的融合提供了一种具有成本效益和优越的方法,用于XR中发现关键字.
- 拟议的声响双模系统为XR应用提供了增强的稳定性和准确性.
- 该系统显示了在XR环境中实际部署的巨大潜力.
更多相关视频
08:32Examining Online Syntactic Processing of Spoken Complex Sentences in Chinese Using Dual-Modal Interference Tasks
Published on: September 5, 2019
5.6K
09:09Foreign Accent and Forensic Speaker Identification in Voice Lineups: The Influence of Acoustic Features Based on Prosody
Published on: September 27, 2024
447
