一个面部特征和唇部运动增强了视听语音分离模型
Guizhu Li1, Min Fu1,2, Mengnan Sun1
1College of Electronic Engineering, Ocean University of China, Qingdao 266100, China.
Sensors (Basel, Switzerland)
|November 14, 2023
概括
这项研究通过整合面部特征和唇部运动等视觉线索来增强尾酒派对问题的音频分离. 拟议的方法显著提高了视听语音分离性能.
科学领域:
- 人工智能的人工智能
- 信号处理 信号处理
- 计算机视觉 计算机视觉
背景情况:
- 尾酒派对的问题,分离混合音频信号,是具有挑战性的.
- 利用多模式信息,特别是视听线索,为改进提供了一个有希望的途径.
研究的目的:
- 提出一种新的音频分离方法,有效地利用面部特征和唇部运动的视觉信息.
- 在复杂的声学环境中提高音频分离的性能.
主要方法:
- 在音频分离模块中内置了剩余连接,用于详细的特征提取.
- 在面部模块中使用注意力机制,专注于相关的视觉信息.
- 设计了一个损失函数,最大限度地提高了视听相似性.
主要成果:
- 拟议的模型显示了音频分离指标的显著改进,包括SDR,PSEQ和STOI.
- 在VoxCeleb2数据集上实现了显著的性能提升,SDR提升高达4dB.
结论:
- 整合视觉线索,特别是面部特征和唇部运动,大大提高了音频分离能力.
- 开发的视听方法为尾酒派对问题提供了强有力的解决方案.


