人工智能模型的比较评估,如ChatGPT 3.5,ChatGPT 4.0和谷歌双子在神经放射学诊断中的应用
Rishi Gupta1, Abdullgabbar M Hamid1, Miral Jhaveri1
1Department of Diagnostic Radiology and Nuclear Medicine, Rush University Medical Center, Chicago, USA.
Cureus
|September 26, 2024
概括
在神经放射学测试中,ChatGPT 4.0在AI模型中显示出最高的诊断准确性 (64.89%). 虽然对医疗教育来说有希望,但人工智能性能有所不同,因此需要进一步研究最佳的患者护理应用.
科学领域:
- 医学成像和诊断 医学成像和诊断
- 医疗保健中的人工智能
- 神经辐射学教育 神经辐射学教育
背景情况:
- 人工智能 (AI),特别是像ChatGPT和Google Gemini这样的大型语言模型 (LLM),正在越来越多地影响医疗保健.
- 评估这些人工智能工具的诊断能力对于将其整合到临床实践中至关重要.
研究的目的:
- 评估ChatGPT (3.5和4.0版本) 和谷歌双子座在神经放射学中的诊断准确性.
- 为了比较这些人工智能模型在诊断测试中的表现,从核心审查教科书.
主要方法:
- 利用了262个多选题,涵盖了"神经放射学:核心评论"中的大脑,头,脊柱和非解释性技能.
- 通过将人工智能生成的答案和解释与已建立的教科书答案进行比较来评估准确性.
- 按照STARD指南报告诊断准确性研究.
主要成果:
- 聊天GPT 4.0实现了最高的整体准确性 (64.89%),其次是聊天GPT 3.5 (62.60%) 和谷歌双子座 (55.73%).
- 聊天GPT 4.0在大脑和头部/部诊断方面表现出色;Google Gemini在头部/部方面表现出色,但在其他领域的准确性较低.
- 在所有诊断子组中,ChatGPT 3.5表现一致.
结论:
- 先进的AI模型在神经放射学中表现出可变的诊断准确性,ChatGPT 4.0显示出最高的性能.
- 这些人工智能工具显示出提高诊断准确性和医疗教育的潜力,但性能因专业而异.
- 需要进一步的研究和更广泛的评估,以优化患者护理中的AI,并解决伦理方面的考虑.


