SignVLM:一个预训练的大型视频模型,用于手语识别
1Information and Computer Science Department, King Fahd University of Petroleum and Minerals, SDAIA-KFUPM Joint Research Center for Artificial Intelligence, Saudi Arabia.
PeerJ. Computer science
|September 24, 2025
概括
符号语言识别 (SLR) 被SignVLM改进,这是一个预训练的视觉模型. SignVLM有效地处理低资源的手语,在多个数据集中表现出强的性能.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 人与计算机的交互
背景情况:
- 标语识别 (SLR) 对于有听力障碍的个人在社区中融入至关重要.
- 开发有效的SLR系统受到注释数据集的稀缺性所阻碍,特别是对于资源较低的手语.
研究的目的:
- 推出SignVLM,这是一种新的预训练的大视力模型,旨在增强手语识别.
- 调查SLR任务对比性语言图像预训练 (CLIP) 模型的有效性.
主要方法:
- 使用预训练的CLIP模型从标志视频中提取空间特征.
- 在SLR系统内使用变压器解码器进行时间学习.
- 在四个不同的手语数据集上评估了SignVLM模型:KArSL,WLASL,LSA64和AUTSL.
主要成果:
- 提出的SignVLM模型超越了KArSL,WLASL和LSA64数据集的现有方法.
- 在AUTSL数据集上取得了竞争性表现,表明了稳定性.
- 证明了对具有有限样本的新数据集有效的概括能力.
结论:
- 在SLR的发展方面,SignVLM显示出显著的前景,特别是在低资源的场景中.
- 该模型的性能突显了大视觉模型在手语处理中的潜力.
- 这些发现支持SignVLM在各种手语识别应用中的适应性和有效性.


