通过面部动作编码系统或深度神经网络生成的合成面部可以提高语音在噪音中的感知,但不如真实面部那么多
Yingjia Yu1, Anastasia Lado1, Yue Zhang2
1Department of Neurosurgery, Perelman School of Medicine, University of Pennsylvania, Philadelphia, PA, United States.
Frontiers in neuroscience
|May 24, 2024
概括
合成的说话面孔可以提高语音感知,但深度神经网络 (DNN) 和面部行动编码系统 (FACS) 无法与真实面孔相匹配. 提高关键语音的现实性可以增强合成面部的好处.
科学领域:
- 语音感知 语音感知
- 计算机图形 计算机图形
- 人与计算机的互动.
背景情况:
- 合成说话面孔技术正在迅速发展.
- 看到说话者的脸增强了语音在噪音中的感知.
- 之前的合成面孔 (DNN) 与真实面孔相比提供了有限的好处.
研究的目的:
- 通过深度神经网络 (DNN) 和面部动作编码系统 (FACS) 生成的合成面孔对真实面孔的语音噪音感知效益进行比较.
- 调查FACS生成的合成面孔是否比DNN生成的面孔提供更大的感知效益.
- 识别特定的面部特征或语音,限制合成面部的有效性.
主要方法:
- 人类观察者在三个视觉条件下识别了语音噪音:空白屏幕,真实脸,DNN合成脸和FACS合成脸.
- 在语音层面分析了表现,特别注意涉及牙和嘴唇相互作用的语音.
- 视频的视觉检查评估了合成面部中关键面部特征的表现.
主要成果:
- 现实面孔为语音噪音感知提供了最大的好处,这与之前的研究一致.
- 无论是DNN还是FACS合成面孔都改善了感知,但比真实面孔的程度要小,DNN和FACS之间没有显著差异.
- 合成面孔在染 /f/, /v/ 和 /th/ 等音符方面表现出特殊的缺陷,这些音符需要精确的唇牙互动.
结论:
- 目前的合成说话面孔技术,包括基于FACS的技术,不能完全复制真实面孔的感知效益.
- 在特定的语音可视化中缺乏现实主义,特别是那些涉及唇牙关节的声音,限制了合成面部的有效性.
- 在合成面部中提高关键语音的视觉真实性,有可能显著改善它们对语音感知的贡献.
相关概念视频
Facial Feedback Hypothesis
142
Charles Darwin proposed that facial expressions are an evolutionary adaptation for communication. He argued that these expressions are not influenced by culture but are universal across species. For example, a snarling expression with exposed teeth signals a threat in many animals, including humans. Darwin also suggested that displaying an emotion can intensify the feeling. Smiling, for example, could enhance one's sense of happiness. This idea laid the foundation for understanding the role...
142
Nonconscious Mimicry
4.5K
Nonconscious mimicry occurs when individuals alter their mannerisms to match the behaviors and expressions of those nearby, without intention.
4.5K


