まとめ

EndoVisLocは、空間推論と意味的統合を改善することにより、外科的視覚的質問局在化回答(Surgical-VQLA)を強化します。このフレームワークは、外科教育における回答精度と解剖学的局在化の両方で優れたパフォーマンスを達成します。