VT-MFLV: 医療画像セグメンテーションのためのビジョン・テキスト・マルチモーダル特徴学習Vネットワーク
Wenju Wang1, Jiaqi Li1, Zinuo Ye1
1College of Publishing, University of Shanghai for Science and Technology, Shanghai 200093, China.
Journal of imaging
|December 24, 2025
まとめ
新しいビジョン・テキスト・マルチモーダル特徴学習Vネットワーク(VT-MFLV)は、テキストデータを統合することで医療画像セグメンテーションを改善します。このアプローチは、病変認識の精度を高め、肺感染症データセットで世界をリードする結果を達成します。
科学分野:
- 医療画像解析
- 人工知能
- コンピュータビジョン
背景:
- 既存のマルチモーダルセグメンテーション手法は、視覚特徴学習のための医療テキストの統合に苦労しています。
- 課題には、マルチモーダル融合の不足や、詳細な病変セグメンテーションの精度の低さが含まれます。
研究 の 目的:
- 強化された医療画像セグメンテーションのためのビジョン・テキスト・マルチモーダル特徴学習Vネットワーク(VT-MFLV)を提案すること。
- 医療画像とテキストの相補性を利用して、重要な病変認識の精度を向上させること。
主な方法:
- VT-MFLVモデルは、診断画像・テキスト・レジデュアル・マルチヘッド・セマンティック・エンコーディング(DIT-RMHSE)、ファイングレイン・マルチモーダル・フュージョン・ローカル・アテンション・エンコーディング(FG-MFLA)、適応的グローバル特徴圧縮・フォーカシング(AGCF)の3つのモジュールを組み込んでいます。
- これらのモジュールは、セマンティックキューの保持、前処理の複雑さの軽減、ローカルなクロスモーダル相互作用の強化、および臨床的に関連性の高い病変領域の強調を促進します。
主要な成果:
- 肺感染症データセット(MosMedDataおよびQaTa-COV1)での実験により、VT-MFLVの有効性が実証されました。
- それぞれのデータセットでDiceスコア75.61%および83.34%、mIoUスコア63.98%および72.09%を達成しました。
- パフォーマンスは世界をリードするレベルに達し、病変セグメンテーションの著しい改善を示しました。
結論:
- VT-MFLVモデルは、医療画像におけるマルチモーダル融合と病変セグメンテーションの精度を効果的に向上させます。
- 提案されたアーキテクチャは、医療AIアプリケーションにおける視覚特徴学習の改善のためにテキストデータを活用するための有望な方向性を提供します。


