一个新的基于深度变压器的CvT模型用于视觉通信中的手语识别
Scientific reports
|December 21, 2025
概括
一种新的卷积视觉转换器 (CvT) 模型显著提高了手语识别 (SLR) 的准确性,达到99%. 这种人工智能的进步通过克服传统方法的局限性,提高了聋人和听力障碍社区的通信可访问性.
科学领域:
- 计算机视觉 计算机视觉
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 标语识别 (SLR) 对聋和听障社区至关重要.
- 传统的AI和深度学习模型面临着复杂的手势,照明和闭塞的挑战.
- 视觉转换器 (ViT) 通过自我注意提供先进的特征提取,有效地建模远程依赖.
研究的目的:
- 开发一个先进的AI模型,用于准确和强大的手语识别.
- 整合卷积和变压器机制,以优化特征提取.
- 根据现有的最先进的方法评估拟议模型的性能.
主要方法:
- 提出了一个卷积视觉变压器 (CvT) 模型,将层次卷积符号化与变压器注意力结合起来.
- 该CvT模型在手语数字和字母/符号数据集上进行了训练和评估.
- 性能与传统的卷积神经网络 (CNN) 和基于变压器的模型 (如BeIT) 相比进行了基准测试.
主要成果:
- 拟议的CvT模型在两个评估数据集上都实现了99%的准确性.
- 与基线CNN和BEIT模型相比,CvT表现优越.
- 该模型有效地减少了错误分类,并提高了预测信心和概括性.
结论:
- CvT模型代表了自动化手语识别的重大进步.
- 这种AI方法提高了SLR系统的准确性和可靠性.
- 这些发现支持CvT在更具包容性的通信技术方面的潜力.
