手術シーンにおける視覚的質問局在化回答のための並列マルチアテンションとゲート付きフュージョン
IEEE journal of biomedical and health informatics
|December 25, 2025
まとめ
EndoVisLocは、空間推論と意味的統合を改善することにより、外科的視覚的質問局在化回答(Surgical-VQLA)を強化します。このフレームワークは、外科教育における回答精度と解剖学的局在化の両方で優れたパフォーマンスを達成します。
科学分野:
- コンピュータビジョン
- 医用画像処理
- 外科教育
背景:
- 手術の視覚的質問局在化回答(Surgical-VQLA)は、視覚とテキストの理解を必要とする手術教育にとって非常に重要です。
- 現在のモデルは、Surgical-VQLAにおける空間推論とクロスモーダル意味アラインメントに苦労しています。
- 限られた空間感度と意味統合は、既存のアプローチのパフォーマンスを妨げます。
研究 の 目的:
- 外科的VQLAのための視覚的テキスト相互作用を強化するように設計された新しいフレームワークであるEndoVisLocを導入すること。
- 解剖学的構造の知覚を改善し、堅牢なクロスモーダル融合を促進すること。
- 手術の視覚的質問応答における回答予測と正確な解剖学的局在化を共同で最適化すること。
主な方法:
- 多様な視覚的特徴を捉えるための並列マルチアテンションモジュール(PMAM)を開発しました。
- 適応的意味的先行注入のための動的ゲート付きフュージョンモジュール(DGFM)を実装しました。
- 融合表現の洗練と共同最適化のための階層的分類ヘッド(HCH)を導入しました。
主要な成果:
- EndoVisLocは、EndoVis-18-VQLAおよびEndoVis-17-VQLAデータセットで最先端のOTASモデルを大幅に上回りました。
- EndoVis-18-VQLAで+5.72%のACC、+5.73%のFスコア、+1.82%のmIoUの改善を達成しました。
- 回答精度と解剖学的局在化の両方で一貫した利点を示しました。
結論:
- EndoVisLocは、Surgical-VQLAの空間推論と意味統合の限界を効果的に解決します。
- 提案されたフレームワークは、手術の視覚的質問応答タスクにおいて優れたパフォーマンスと一貫した利点を示しています。
- EndoVisLocは、視覚的テキスト理解の向上を通じて外科教育を進歩させるための有望なソリューションを提供します。

