视觉能力模型的比较,GPT-4和双子座,与台湾肺科医生检查中的GPT-3.5进行比较
Chih-Hsiung Chen1, Kuang-Yu Hsieh1, Kuo-En Huang1
1Department of Critical Care Medicine, Mennonite Christian Hospital, Hualien City, TWN.
Cureus
|August 26, 2024
概括
像GPT-4和Gemini这样的新型多式大型语言模型 (LLM) 在医疗考试中表现得更好,与仅以文本模型相比. 这些先进的人工智能系统在解释复杂的医疗信息方面显示出巨大潜力.
科学领域:
- 人工智能在医学中的应用
- 多模式大型语言模型 (LLM)
- 医学教育和评估.
背景情况:
- 在医疗应用中,将多模式功能 (解释图像,图形,视频) 集成到大型语言模型 (LLM) 中至关重要.
- 下一代LLM,如生成预训练变压器4 (GPT-4) 和谷歌的Gemini,拥有这些先进的视觉功能.
研究的目的:
- 调查和比较GPT-4和双子座的视觉能力与只有文本的基线 (GPT-3.5).
- 为了评估LLM在专业医学委员会考试问题上的表现.
主要方法:
- 利用了从肺部和重症监护医学 (2012-2023) 台湾专家委员会考试中的1100个问题.
- 数据集包括1,059个纯文本问题和41个带图像的文本问题,主要非英语.
- 在这个数据集上比较GPT-4,Gemini和GPT-3.5的性能.
主要成果:
- 在年度考试中,GPT-4的得分从51到72不等,始终超过双子座 (41-59) 和GPT-3.5 (28-43).
- 在大多数年份,GPT-4的合格率超过了60%,这表明了接近人类的表现水平.
- 具有视觉功能的LLM显著优于仅文本的GPT-3.5模型.
结论:
- 像GPT-4这样的多模式LLM在医疗问答方面表现优异,与仅以文本模式相比.
- 这些先进的人工智能模型对医学教育,评估和潜在的临床决策支持具有重大前景.
- 需要进一步的研究来探索视觉启用LLM在医疗保健中的全部潜力和局限性.


