基于人身份验证的互动注意力的视听融合
Xuebin Jing1,2, Liang He1,2,3, Zhida Song1,2
1School of Computer Science and Technology, Xinjiang University, Urumqi 830017, China.
Sensors (Basel, Switzerland)
|December 23, 2023
概括
这项研究通过使用注意力机制融合视听特征来增强多式联络人验证. 拟议的模型显著提高了身份验证系统的准确性和稳定性.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 生物识别信息 生物识别信息
背景情况:
- 单模个人验证系统在复杂的环境中面临性能限制.
- 多模式特征融合对于提高身份验证的准确性和稳定性至关重要.
- 整合视听信息在有效的功能融合中提出了挑战.
研究的目的:
- 通过有效地融合音频和视觉功能来改进多式联运人员验证系统.
- 探索基于增强身份验证的注意力机制的新型融合模型.
- 在各种基准数据集上评估拟议的融合方法的性能.
主要方法:
- 使用预训练模型来提取音频和视觉嵌入.
- 开发了使用完全连接层的基线融合模型.
- 提出并实验了三种基于注意力的融合模型:注意力,封闭式和互注意力.
主要成果:
- 在VoxCeleb1.1.上实现了0.23%的等错率 (EER) 和0.011的minDCF.
- 在NIST SRE19.19上获得了2.60%的EER和0.283的minDCF.
- 在CNC-AV数据集上记录了11.30%的EER和0.443的minDCF.
结论:
- 基于注意力的融合模型显著提高了多式联运人员验证性能.
- 与基线方法相比,提出的方法显示出更高的准确性和稳定性.
- 有效的视听功能融合是推进安全身份验证系统的关键.


