执行GPT-4视觉病理学考试问题
Jing Miao1, Charat Thongprayoon1, Wisit Cheungpasitporn1
1Division of Nephrology and Hypertension, Department of Medicine, Mayo Clinic, Rochester, MN, US.
American journal of clinical pathology
|April 3, 2024
概括
GPT-4视觉 (GPT-4V) 在病理学中显示出有限的准确性,特别是图像分析,表现低于病学学员. 在这个领域,它的图像解释能力需要改进.
科学领域:
- 腎臟病學 (nephrology) 是一種醫學專業.
- 人工智能在医学中的应用
- 医学教育 医学教育
背景情况:
- 像ChatGPT这样的大型语言模型表明了医学知识评估的潜力.
- 先进的人工智能,特别是GPT-4视觉 (GPT-4V) 在病理学等专业领域的功能在很大程度上尚未确立.
- 在医学诊断中评估人工智能性能对于理解人工智能与人类专业知识并肩发挥的作用至关重要.
研究的目的:
- 评估GPT-4视觉 (GPT-4V) 在回答病理问题的能力.
- 为了比较GPT-4V的表现与病学学员的表现.
- 为了具体评估 GPT-4V 解释脏活检图像的能力.
主要方法:
- 使用了一套39个问题,包括19个基于文本的和20个基于图像的脏活检场景.
- 这些问题旨在反映神经病学奖学金培训所面临的挑战.
- 记录了GPT-4V的反应,并与人类学员的反应进行了比较.
主要成果:
- 在两次运行中,GPT-4V的总准确率分别为67%和72%,低于脏病学学员 (79%).
- 基于图像的问题的准确性在GPT-4V (55%) 和学员 (79%) 之间是可比的,但GPT-4V的一致性明显较低 (29% vs 88%仅为文本).
- 当图像解释正确时,GPT-4V的准确性很高 (100%),但在图像解释方面,其整体一致准确性仅为39%.
结论:
- GPT-4V在解决病理问题的能力有限,特别是那些涉及图像分析的问题.
- 人工智能的一致解释活检图像的能力需要显著改进.
- 在GPT-4V可靠地用于病理诊断或培训之前,需要进一步开发.


