DINO-US-SAMの接地: LoRA調節された視覚言語モデルで超音波でテキスト誘導の多臓器セグメンテーション
IEEE transactions on ultrasonics, ferroelectrics, and frequency control
|September 2, 2025
まとめ
この研究は,様々な臓器の正確な超音波オブジェクトセグメンテーションのためのプロンプト駆動視言語モデル (VLM) を導入します. この新しいアプローチは一般化を促進し,広範な臓器特有の注釈データセットの必要性を軽減します.
科学分野:
- 医療用画像検査
- コンピュータビジョン
- 人工知能
背景:
- 超音波によるオブジェクトセグメンテーションは,解剖学的変動性と限られた注釈データにより課題に直面しています.
- 既存の方法はしばしば臓器特有の訓練を必要とし,広範な適用を妨げています.
研究 の 目的:
- 超音波で一般化可能なオブジェクトセグメンテーションのためのプロンプト駆動視言語モデル (VLM) を開発する.
- 多臓器超音波セグメンテーションのためのセグメントAnythingモデル2 (SAM2) と接地DINOを統合する.
主な方法:
- 乳腺,甲状腺,肝臓,前立腺,腎臓,脊髄筋を対象とした 18の公共の超音波データセットを使用しました.
- 15のデータセットでローランクアダプテーション (LoRA) を用いて精密調整された接地DINO,その3つはテストのために保持されます.
- UniverSeg,MedSAM,MedCLIP-SAMのような最先端の方法と比較して評価された性能.
主要な成果:
- 提案されたVLMアプローチは,ほとんどのテストされた超音波データセットで優れたパフォーマンスを示しました.
- 詳細な調整なしに,未確認のデータセットで強力な汎用性を達成しました.
- UniverSeg,MedSAM,MedCLIP-SAM,BiomedParse,SAMUSなどの確立したセグメンテーション方法を上回った.
結論:
- 視覚言語モデルは,スケーラブルで堅牢な超音波画像分析に大きな希望を示しています.
- 開発された方法は,大きな,臓器特有の注釈されたデータセットへの依存を軽減します.
- コードは,公に公開されます code.sonography.ai 受け入れ次第.


