概括

本研究介绍了一种多模式的手语预培训 (SLP) 框架,使用大型数据集 (SL-1.5M) 来改善手语理解 (SLU) 模型. 新方法通过整合视觉和文本线索来增强模型的概括性,以便更好地表示手语视频.