在外科检查中的大型语言模型的比较视觉能力问题
Jean-Paul Bereuter1, Mark Enrik Geissler2, Anna Klimova3
1Department of Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology, Dresden, Germany.
Journal of surgical education
|February 9, 2025
概括
视觉语言模型 (VLMs) 在医学教育中表现有前途. 在手术图像和文字考试问题上,GPT-4显著优于其他模型和学生,证明了其在临床决策和培训方面的潜力.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 计算机视觉在医疗保健中的应用
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床决策支持和医学检查.
- 最近的进展已经将视觉功能集成到LLM中,创建视觉语言模型 (VLM).
- 在基于图像的医学检查问题上,VLMs的表现仍未得到充分研究.
研究的目的:
- 评估公开可用的视觉语言模型 (VLMs) 在外科检查问题上的表现.
- 为了比较基于文本和基于图像的手术问题上的VLM性能.
- 为了比较VLM的表现与医学学生的历史表现.
主要方法:
- 使用来自德国医学执照考试 (GMLE) 和美国医学执照考试 (USMLE) 的外科文字和图像问题.
- 公开的LLMs (GPT-4,克劳德-3小说,双子-1.5) 回答了问题集.
- 法学士准确度与学生表现 (历史平均表现) 相比进行了基准测试,并根据问题难度和图像类型进行分析.
主要成果:
- 所有评估的LLM都在手术文本问题上取得了合格分数 (≥60%).
- GPT-4是唯一通过基于图像问题的模型 (78%),显著超过了Claude-3 (58%) 和Gemini-1.5 (57.3%).
- 在文本问题 (83.7%对67.8%) 和图像问题 (78%对67.4%) 中,GPT-4超过了学生的平均历史表现.
结论:
- GPT-4在回答复杂的外科检查问题方面表现出强大的能力,包括那些具有视觉组件的问题.
- VLMs,特别是GPT-4,显示出增强外科教育和决策工具的巨大潜力.
- 进一步研究VLM在医疗培训和临床实践中的应用是有必要的.


