用LLM驱动的知识图来增强视觉推理,用于机器人手术中的视觉问题本地化答案
IEEE journal of biomedical and health informatics
|March 3, 2025
概括
这项研究引入了一个新的框架,通过使用大语言模型驱动的知识图来改善外科视觉问题答案,以更好地识别仪器. 这增强了医疗培训,为手术程序提供了更清晰的视觉推理.
科学领域:
- 医疗成像医学成像
- 在外科手术中使用人工智能
- 计算机视觉 计算机视觉
背景情况:
- 专家外科医生面临着繁重的工作负载,限制了实习生及时响应.
- 手术视觉问题本地化答案 (手术-VQLA) 对于医学教育至关重要.
- 目前的外科-VQLA模型由于视觉推理有限,难以准确识别外科仪器.
研究的目的:
- 为了增强外科-VQLA的视觉推理能力.
- 改善手术场景中的手术仪器的准确识别和理解.
- 开发一个利用外部知识的框架,以增强外科外科的视觉理解.
主要方法:
- 通过LLM支持的知识图表 (EnVR-LPKG) 提议加强视觉推理框架.
- 开发了一种细粒度知识提取器 (FKE),用于有针对性的知识图表信息提取.
- 引入了一个基于多重注意力的外科仪器增强器 (MSIE) 模块,用于融合视觉和知识图的功能.
主要成果:
- EnVR-LPKG框架显著提高了手术仪器识别的准确性.
- 该MSIE模块有效地融合了视觉和文本知识图的功能,增强了模型的理解.
- 在EndoVis-17-VQLA和EndoVis-18-VQLA数据集上的实验结果显示,与最先进的方法相比,性能优越.
结论:
- 拟议的EnVR-LPKG框架有效地解决了当前外科-VQLA模型中的局限性.
- 基于LLM的知识图增强了用于手术仪器识别的视觉推理.
- 这种方法为通过人工智能改善外科培训和教育提供了一个有希望的方向.


