评估Bard Gemini Pro和GPT-4视觉与学生在医学视觉问题答案中的表现:比较案例研究
Jonas Roos1, Ron Martin2, Robert Kaczmarczyk3
1Department of Orthopedics and Trauma Surgery, University Hospital of Bonn, Venusberg-Campus 1, 53127, Bonn, Germany, 49 228-287-14170.
JMIR formative research
|December 23, 2024
概括
大型语言模型 (LLM) 在医学图像诊断方面表现有前途,GPT-4视觉优于Bard Gemini. 然而,这两种人工智能模型都与学生的表现不匹配,突出了医疗人工智能开发的改进领域.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 诊断成像分析 诊断成像分析
背景情况:
- 大型语言模型 (LLM) 越来越多地影响医学研究和教育.
- 具有图像识别能力的LLM在放射学解释和考试辅助等领域显示出潜力.
- 最近的进步使LLM增强了关键的图像分析功能.
研究的目的:
- 批判性地评估LLMs在医学诊断和培训中的有效性.
- 评估图像识别增强的LLM在回答医疗执照考试问题的准确性和实用性.
- 为了比较不同LLMs与学生基准的表现.
主要方法:
- 分析了来自AMBOSS学习平台的1070个基于图像的多选择题 (605个英语,465个德语).
- 使用英语和德语的定制提示来引导LLM (GPT-4 1106视觉预览,Bard Gemini Pro) 解释医疗图像并提供诊断.
- 用Python进行统计分析,将LLM绩效与学生绩效数据 (学生通过平均值,多数票) 进行比较.
主要成果:
- GPT-4 1106视觉预览实现了56.9%的准确性,超过了Bard Gemini Pro的44.6% (P<.001).
- GPT-4 1106 视觉预览的未回答率 (16.1%) 比Bard Gemini Pro (4.1%) 高.
- 两种模型的德语表现都比英语好;然而,学生的多数投票 (94.5%) 显著超过了两种AI模型.
结论:
- 像GPT-4视觉和Bard Gemini这样的LLM证明了医学视觉问答和学生支持的潜力.
- 性能因语言而异,对德语有明显的优势,对非英语内容存在限制.
- 目前的LLM准确率,特别是与学生的答案相比,强调需要进一步优化和了解他们在医学教育中的局限性.
关键词:
在这里,我们可以看到AIAIAI.在医疗保健中的AI.美国大使馆聊天GPT 聊天GPT 聊天英语英语英语英语英语英语英语英语德国 德国人 德国人 德国人 德国人在法学士 (LLM) 课程中.在这里,Python是Python.准确度 准确度 准确度 准确度人工智能的人工智能是人工智能.一个案例研究研究.这是一个比较的比较.诊断 诊断 诊断 的 诊断 诊断 诊断 诊断 的 诊断有效性 有效性.医疗保健 医疗保健 医疗保健图片 图片 图片 图片 图片图像分析图像分析基于图像的基于图像的图像.大型语言模型医学教育 医学教育业绩表现表现的表现表现是什么问题问题问题问题问题问题问题问题和答案问题和答案学生 学生 学生 学生培训培训培训培训培训培训培训实用公用事业公司视觉问题回答 回答问题更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
500
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
299
