低チャンネルsEMGハンドジェスチャー認識のためのハイブリッド畳み込みビジョントランスフォーマー:CNNとの比較研究
Ruthber Rodriguez Serrezuela1, Roberto Sagaro Zamora2, Daily Milanes Hermosilla3
1Department of Mechatronics Engineering, University Corporation of Huila, Neiva 410001, Colombia.
Biomimetics (Basel, Switzerland)
|December 24, 2025
まとめ
畳み込みビジョントランスフォーマー(CViT)は、低チャンネル表面筋電図(sEMG)信号を使用したハンドジェスチャー分類において、古典的な畳み込みニューラルネットワーク(CNN)よりも優れた性能を示します。この進歩は、コンパクトな義肢制御システムの開発に不可欠です。
科学分野:
- 生物医学工学
- 機械学習
- リハビリテーション技術
背景:
- 表面筋電図(sEMG)は、義肢制御および人間と機械の相互作用において重要です。
- 既存のsEMG研究では、高密度記録または広範なジェスチャーセットが使用されることが多く、低チャンネル、削減されたジェスチャーシステムに関するデータが制限されています。
- コンパクトなsEMGシステムには、実用的な義肢アプリケーションのための効率的な分類モデルが必要です。
研究 の 目的:
- 低チャンネルsEMGシステムにおけるハンドジェスチャー分類のために、古典的な畳み込みニューラルネットワーク(CNN)と畳み込みビジョントランスフォーマー(CViT)をベンチマークすること。
- 非切断者および前腕切断者の両方のデータセットでモデルのパフォーマンスを評価すること。
- 困難なsEMG条件下でのCNNおよびCViTアーキテクチャの堅牢性と汎化能力を決定すること。
主な方法:
- 2つのデータセットが使用されました:独自の8チャンネルMyoデータセットと、前腕切断者からの12チャンネルNinaPro DB3サブセット。
- CNNとCViTモデルの両方が、同一の標準化された前処理、セグメンテーション、およびバランスの取れたウィンドウ処理を使用してトレーニングされました。
- モデルの精度は、低チャンネル、異種sEMG信号シナリオでのパフォーマンスに焦点を当てて、データセット全体で比較されました。
主要な成果:
- CNNはMyoデータセットで94.2%の精度を達成しましたが、切断者NinaProデータセットではばらつき(92.0%の精度)を示しました。CViTモデルはCNNのパフォーマンスに一貫して匹敵またはそれを上回り、Myoで96.6%、NinaProで94.2%の精度を達成しました。統計分析により、Myoデータセットで有意なパフォーマンスの違いが示され、CViTは優れた結果を示しました。
結論:
- 畳み込みビジョントランスフォーマー(CViT)は、低チャンネルsEMGハンドジェスチャー分類において、古典的なCNNと比較して、強化された堅牢性と汎化を提供します。
- CViTのパフォーマンスは、切断者の記録で遭遇するような異種信号条件下で特に有利です。
- これらの発見は、高度でコンパクトな義肢制御システムを開発するためのCViTの適合性を強調しています。
