在风湿病学检查中评估ChatGPT模型的性能
Fadi Hassan1, Basem Hijazi2, Mohammad E Naffaa1
1Department of Rheumatology, Galilee Medical Center, Nahariya, Israel, Azrieli Faculty of Medicine, Bar-Ilan University, Safed, Israel.
The Israel Medical Association journal : IMAJ
|March 9, 2026
概括
大型语言模型在风湿病学考试中表现有前途,知识增强模型达到81%的准确性. 然而,在基于图像的问题上,性能显著下降,突出了当前的局限性.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 风湿病学 诊断 诊断 风湿病学
背景情况:
- 大型语言模型 (LLM) 正在发展,具有潜在的医疗保健应用.
- 在一般医学考试中研究了LLM的表现,但需要进行类风湿病学特定的评估.
研究的目的:
- 评估聊天生成预训练变压器 (ChatGPT) 在以色列风湿病学委员会考试问题上的表现.
- 评估不同的ChatGPT模型变体和提示策略.
主要方法:
- 从2023-2024年以色列风湿病学委员会考试中使用了200个多选题.
- 测试了三种 GPT-4 Turbo 变种:基本型,几次射击的思维链和知识增强型.
- 在英语和希伯来语版本上评估模型,并单独分析包含图像的问题.
主要成果:
- 知识增强模型在基于文本的问题上获得了最高的准确率 (81%).
- 在所有模型中,基于图像的问题的表现明显较低,从34.8%到65.2%不等.
- 总体而言,模型性能之间没有发现统计学上显著的差异.
结论:
- LLM证明了对类风湿病学委员会考试评估的潜力,但存在关键局限性.
- 未来的研究必须解决图像解释和复杂的案例管理在LLM应用中的挑战.
- 改善视觉诊断的LLM能力对于风湿病学至关重要.


