視覚コミュニケーションにおける手話認識のための新しい深層トランスフォーマーベースのCvTモデル
Scientific reports
|December 21, 2025
まとめ
新しい畳み込みビジョン・トランスフォーマー(CvT)モデルは、手話認識(SLR)の精度を99%に大幅に向上させます。このAIの進歩は、従来の पद्धती の限界を克服することで、聴覚障害者および難聴者コミュニティのコミュニケーションアクセシビリティを向上させます。
科学分野:
- コンピュータビジョン
- 人工知能
- 機械学習
背景:
- 手話認識(SLR)は、聴覚障害者および難聴者コミュニティにとって不可欠です。
- 従来のAIおよびディープラーニングモデルは、複雑なジェスチャー、照明、および隠蔽の問題に直面しています。
- ビジョン・トランスフォーマー(ViT)は、自己注意を通じて高度な特徴抽出を提供し、長距離の依存関係を効果的にモデル化します。
研究 の 目的:
- 正確で堅牢な手話認識のための高度なAIモデルを開発すること。
- 最適化された特徴抽出のために、畳み込みメカニズムとトランスフォーマーメカニズムを統合すること。
- 提案されたモデルのパフォーマンスを既存の最先端の方法と比較して評価すること。
主な方法:
- 階層的な畳み込みトークン化とトランスフォーマーアテンションを組み合わせた畳み込みビジョン・トランスフォーマー(CvT)モデルを提案しました。
- CvTモデルを、手話の数字およびアルファベット/記号データセットでトレーニングおよび評価しました。
- パフォーマンスを、従来の畳み込みニューラルネットワーク(CNN)およびBeITなどのトランスフォーマーベースのモデルと比較しました。
主要な成果:
- 提案されたCvTモデルは、評価された両方のデータセットで99%の精度を達成しました。
- CvTは、ベースラインのCNNおよびBeITモデルと比較して優れたパフォーマンスを示しました。
- モデルは、誤分類を効果的に減らし、予測信頼性と一般化を向上させました。
結論:
- CvTモデルは、自動手話認識における重要な進歩を表しています。
- このAIアプローチは、SLRシステムの精度と信頼性を向上させます。
- この発見は、よりインクルーシブなコミュニケーション技術のためのCvTの可能性を支持しています。
