在手术场景中,并行多重注意力和门式融合用于视觉问题本地化回答.
IEEE journal of biomedical and health informatics
|December 25, 2025
概括
EndoVisLoc通过改善空间推理和语义集成来增强外科视觉问题局部回答 (外科-VQLA). 这个框架在回答准确性和外科教育的解剖本地化方面都取得了卓越的表现.
科学领域:
- 计算机视觉 计算机视觉
- 医疗成像医学成像
- 外科教育的外科教育
背景情况:
- 手术视觉问题本地化答案 (外科-VQLA) 对于外科教育至关重要,需要视觉和文本理解.
- 目前的模型在外科-VQLA中的空间推理和交叉模式语义对齐方面扎.
- 局限的空间敏感性和语义整合阻碍了现有方法的性能.
研究的目的:
- 引入EndoVisLoc,一个旨在增强外科-VQLA视觉文本交互的新型框架.
- 为了改善解剖结构的感知,并促进强大的交叉模式融合.
- 在手术视觉问题答案中,共同优化答案预测和精确的解剖定位.
主要方法:
- 开发了一种并行多重注意模块 (PMAM),用于捕捉各种视觉特征.
- 实现了一个动态门融合模块 (DGFM) 适应性语义预注.
- 引入了一个层次分类器头 (HCH) 来改进融合表示和联合优化.
主要成果:
- 在EndoVis-18-VQLA和EndoVis-17-VQLA数据集上,EndoVisLoc显著超过了最先进的OTAS模型.
- 在EndoVis-18-VQLA上取得了+5.72%的ACC,+5.73%的F-score和+1.82%的mIoU的改善.
- 在答案准确性和解剖本地化方面均表现出一致的优势.
结论:
- EndoVisLoc有效地解决了外科-VQLA的空间推理和语义集成方面的局限性.
- 拟议的框架显示了在外科视觉问题答案任务中卓越的性能和一致的优势.
- 通过改进视觉文本理解,EndoVisLoc为推进外科教育提供了一个有前途的解决方案.

