使用分区时间掩盖和旋转变压器3D卷积模型进行视觉语音识别的新方法
Xiangliang Zhang1, Yu Hu2, Xiangzhi Liu1
1The State Key Laboratory of Fluid Power and Mechatronic Systems, School of Mechanical Engineering, Zhejiang University, Hangzhou 310027, China.
Sensors (Basel, Switzerland)
|April 26, 2025
概括
这项研究介绍了分区时间掩盖 (PTM),这是一种新的数据增强技术,用于增强视觉语音识别. PTM提高了唇读模型的性能和概括性,特别是在具有挑战性的条件下.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 视觉语音识别 (嘴唇阅读) 在杂的环境中以及对有语言障碍的人来说都具有优势.
- 当前的唇读模式在一般化,可混的语音,照明变化和面部遮方面扎.
研究的目的:
- 引入分区时间掩盖 (PTM),这是一个数据增强方法,用于改进唇读模型.
- 提出一种新的唇读识别架构,Swin变压器和3D卷积 (ST3D).
主要方法:
- 实现分区时间掩盖 (PTM) 用于使用非线性转换增强数据.
- 开发了Swin变压器和3D卷积 (ST3D) 模型架构,将Swin变压器与3D卷积相结合.
- 在LRW数据集上使用DC-TCN模型和在LRW和LRW1000数据集上使用ST3D验证的PTM.
主要成果:
- 在使用DC-TCN模型的LRW数据集上,PTM方法实现了92.15%的峰值精度.
- ST3D模型在LRW数据集上达到91.8%的准确性,在具有挑战性的LRW1000数据集上达到56.1%.
- 与当前主流的唇读模型相比,提出的方法表现优越,特别是在容易混的样本上.
结论:
- 分区时间掩盖 (PTM) 有效地提高了唇读模型的概括能力和性能.
- ST3D架构显示了视觉语音识别的显著改进,超过了现有的模型.
- 这项研究解决了唇读的关键挑战,为更强大,更准确的系统铺平了道路.


