视觉语言模型用于腹腔镜手术中的自动视频分析和文档:一项概念验证研究
Esther Helene Stueker1, Fiona R Kolbinger2,3,4, Oliver Lester Saldanha1
1Else Kröner Fresenius Center for Digital Health, Dresden University of Technology, Dresden, Germany.
International journal of surgery (London, England)
|July 18, 2025
概括
视觉语言模型 (VLMs) 显示了外科手术文档的前景. GPT-4o和Gemini-1.5-pro可靠地检测到手术工具和分类程序,尽管分类病理需要进一步开发.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 计算机视觉 计算机视觉
背景情况:
- 医疗保健行业面临医疗人员的严重短缺,需要在临床文档中实现自动化.
- 大视觉语言模型 (VLMs) 为简化外科手术文档和增强手术内分析提供了重要机会.
研究的目的:
- 在手术视频分析中比较评估两个通用VLM的性能,GPT-4o和Gemini-1.5-pro.
- 评估情境学习 (ICL) 在改善外科手术任务的VLM性能方面的有效性.
主要方法:
- 一项观察性研究比较了GPT-4o和Gemini-1.5-pro使用30个手术视频 (15个胆囊切除,15个尾切除).
- 任务包括对象检测,手术分类,尾炎分类和手术报告生成.
- 使用描述性准确度指标评估绩效,有或没有上下文学习.
主要成果:
- 这两种VLM在识别船只片方面都实现了100%的准确性. GPT-4o在提取袋和布检测方面表现出色,而Gemini-1.5-pro在血液检测方面表现出卓越.
- 双子-1.5-pro在分类胆囊切除术方面更准确,而这两种模型在尾切除术分类方面表现中等.
- 尾炎分级对这两种模型都产生了有限的准确性. 语境学习改善了工具识别,但对其他任务产生了不一致的影响.
结论:
- 不依据领域的VLM在手术对象检测和手术程序分类方面表现出可靠的性能.
- 在病理学分级和详细的程序步骤描述方面存在局限性,在这些领域,上下文学习显示了增强的潜力.
- 未来针对特定领域的VLM的发展可能会进一步彻底改变手术室的效率和支持.
更多相关视频
07:46Author Spotlight: Revolutionizing Remote Surgery with Augmented Reality and Robotics for Enhanced Precision and Accessibility
Published on: August 9, 2024
853
07:22Minimally Invasive Murine Laryngoscopy for Close-Up Imaging of Laryngeal Motion During Breathing and Swallowing
Published on: December 1, 2023
660
