扩大手语理解多模式预培训的规模
IEEE transactions on pattern analysis and machine intelligence
|August 14, 2025
概括
本研究介绍了一种多模式的手语预培训 (SLP) 框架,使用大型数据集 (SL-1.5M) 来改善手语理解 (SLU) 模型. 新方法通过整合视觉和文本线索来增强模型的概括性,以便更好地表示手语视频.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 手语预训练 (SLP) 提高了手语理解 (SLU),但在模型概括方面面临局限性,并忽视了文字线索.
- 现有的方法通常使用针对特定任务的小数据集的预训练,或者只关注视觉信息,从而降低了模型的表示能力.
研究的目的:
- 开发一个多式联络SLP框架,利用视觉上下文和视觉语言的一致性,以改善手语视频表示.
- 为了解决数据稀缺问题,通过策划一个大规模的文字标签标志图形数据集 (SL-1.5M) 来解决数据稀缺问题.
主要方法:
- 策划了来自不同来源的大型标记文本的标志姿势数据集 (SL-1.5M).
- 提出了一个预培训框架,整合了标志文本对比学习和面具姿势建模.
- 同时建模手动和非手动的手语信息,用于整体的视觉内容表示.
主要成果:
- 该框架有效地捕获符号姿势序列中的上下文线索,并对准语义文本特征.
- 在各种SLU任务上实现了新的最先进的性能,证明了卓越的概括性和有效性.
- 验证了框架提高手语视频的代表性能力的能力.
结论:
- 拟议的多式联络SLP框架通过整合视觉和文本信息,显著改善了手语理解.
- 该方法克服了现有方法的局限性,为手语模型提供了更好的概括性和表示能力.
- 这项工作通过先进的预培训技术为手语理解设定了新的基准.


