マレーシアのサイン言語のダイナミックなデータセットで,サイン言語の認識と翻訳を行う
Yuan Ting Chong1, Yessane Shrrie Nagendhra Rao1, Rehman Ullah Khan1
1Faculty of Cognitive Sciences and Human Development, Universiti Malaysia Sarawak, Sarawak, Malaysia.
Data in brief
|February 20, 2026
まとめ
この研究は,手話認識と翻訳研究におけるデータ制限を克服するために,新しいダイナミックなマレーシア手話 (BIM) データセットを導入します. データセットには,連続した,現実世界の署名シナリオのためのビデオ,光沢,翻訳データが含まれています.
科学分野:
- コンピュータサイエンス コンピュータサイエンス
- 人工知能 (AI) とは,人工知能 (AI) のことです.
- 言語学 言語学とは
背景:
- 手話はユニークで,文化的にも微妙なニュアンスがあり,自動認識と翻訳に課題を課しています.
- 現存するマレーシア手話 (BIM) データセットは,サイズと範囲が限られており,効果的な機械学習モデルの開発を妨げています.
- 現在のデータセットは,主に孤立した文字,単語,短いフレーズに焦点を当てており,手話コミュニケーションの継続的な性質を捉えることができない.
研究 の 目的:
- マレーシア手話 (BIM) の包括的でダイナミックなデータセットを導入し,研究におけるデータ制限に対処する.
- 先進的な手話認識と翻訳システムの開発を促進する.
- Sign-to-Gloss-to-Textフレームワークやその他の関連する方法論を用いた研究を支援する.
主な方法:
- BIMデータセットの2つのバージョンを開発しました:BIM-SSD-V1 (ビデオ,光沢,翻訳) とBIM-SSD-V2 (ビデオ,キーポイント,認識のための光沢;光沢,翻訳のための翻訳).
- 日常のコミュニケーションシナリオを反映したデータを収集し,さまざまな文の構成とさまざまな記録条件を含む.
- 聴覚障害者コミュニティとBIMの専門家と協力し,データの収集とアノテーションを行い,信頼性と関連性を確保しました.
主要な成果:
- BIM-SSD-V1は,4,858の並列ビデオ,光沢,および翻訳データエントリで構成されています.
- BIM-SSD-V2には,3,143の並列ビデオ,キーポイント,および光沢データと,4,900の並列光沢および翻訳データエントリが含まれています.
- データセットには,未処理のビデオと,エントリごとに4つのサンプルを備えたサイン言語モジュールが組み込まれています.
結論:
- 新しく導入されたダイナミックなBIMデータセットは,マレーシア手話研究のためのリソースを大幅に拡張します.
- このデータセットは,継続的な手話認識と翻訳のための機械学習モデルのより堅牢なトレーニングを可能にします.
- これは,特にSign-to-Gloss-to-Textフレームワーク内で,手話技術の改善を目指す研究者のための貴重なリソースを提供します.
関連する概念動画
Genetic Lingo
115.8K
Overview
115.8K
Introduction to the Sign Test
1.4K
The sign test is an important tool in nonparametric statistics, offering a straightforward yet effective method for analyzing matched pairs, nominal data, or hypotheses concerning the median of a population. It transforms data points into positive or negative signs, avoiding the need for assumptions about data distribution and instead focusing on the direction of change. It is particularly valuable when data does not conform to the normal distribution requirements of many parametric tests. For...
1.4K


