説明可能なビデオ暴力検出のための深層学習フレームワーク:教師なしキーフレーム選択と注意ベースCNNの使用
Rashid Azim1, Naveed Abbas1, Hend Khalid Alkahtani2
1Department of Computer Science, Islamia College Peshawar, Peshawar, 25100, Pakistan.
Scientific reports
|February 26, 2026
まとめ
この研究は、リアルタイムビデオ暴力検出のための説明可能な注意機構強化畳み込みニューラルネットワーク(CNN)を紹介します。この新しいフレームワークは、高い精度と効率を達成し、監視システムに透明なソリューションを提供します。
科学分野:
- コンピュータビジョン
- 人工知能
- 機械学習
背景:
- ビデオデータの増加は、リアルタイム暴力検出のためのインテリジェントで説明可能なシステムを必要としています。
- 既存の方法は、冗長性、透明性、一般化において課題に直面しています。
研究 の 目的:
- ビデオ暴力検出のための新しい説明可能な注意機構強化畳み込みニューラルネットワーク(CNN)フレームワークを提案すること。
- 自動暴力検出における冗長性、透明性、一般化の問題に対処すること。
主な方法:
- 計算負荷を軽減するための類似性ベースクラスタリングを使用した教師なしキーフレーム選択。
- 時空間特徴学習を強化するためのCNNへの注意モジュールの統合。
- モデルの決定に関する解釈可能な視覚的洞察のためのGrad-CAM++。
主要な成果:
- 5つのベンチマークデータセットで平均精度94.6%、F1スコア93.9%を達成し、優れたパフォーマンスを示しました。
- C3D、I3D、ResNet-LSTM、ViViTを含む最先端モデルを上回りました。
- ほぼリアルタイムの効率(約62 FPS)とメモリ使用量の削減(6.8 GB)を実証しました。
結論:
- 提案されたフレームワークは、自動ビデオ暴力検出のための堅牢で効率的で透明なソリューションを提供します。
- キーフレーム選択と注意メカニズムは、モデルのパフォーマンスを大幅に向上させます。
- 解釈可能性は、監視や公共の安全に適した、暴力関連領域を強調することによって信頼性を高めます。
