对ChatGPT-4.0和Gemini在基于图像的神经外科的实践问题上的性能评估:比较分析
Alana M McNulty1, Harshitha Valluri1, Avi A Gajjar1
1Department of Neurosurgery, Albany Medical Center, Albany, NY, USA.
概括
聊天GPT-4.0在以图像为基础的神经外科问题上取得了适度的成功,而双子座表现不佳. 人工智能 (AI) 和大语言模型 (LLM) 都需要在神经外科手术中对视觉数据的解释进行显著改进.
科学领域:
- 神经外科 神经外科
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 人工智能 (AI) 在医学上越来越重要,但其在基于图像的神经外科手术中的应用仍然未得到充分探索.
- 像ChatGPT-4.0和Gemini这样的大型语言模型 (LLM) 在文本中显示出潜力,但需要对神经外科手术至关重要的视觉任务进行评估.
研究的目的:
- 评估ChatGPT-4.0和双子座在回答基于图像的神经外科委员会实践问题的表现.
- 评估这些人工智能模型在解释与神经外科决策相关的视觉数据方面的能力.
主要方法:
- 使用了来自神经外科委员会审查书籍的250个基于图像的问题.
- 聊天GPT-4.0和双子座的任务是回答这些问题,包括MRI扫描和外科视觉.
- 准确性取决于每个模型的正确答案数量.
主要成果:
- 聊天GPT-4.0实现了54.0%的准确率,明显超过双子座的8.6%准确率 (p < 0.0001).
- 在"综合神经外科委员会准备书" (65.9%) 与"神经外科委员会审查" (41.3%) 相比,ChatGPT-4.0的准确性更高.
- 双子座的拒绝率为40.8%,而ChatGPT尝试了所有问题.
结论:
- 聊天GPT-4.0在解释基于图像的神经外科问题的部分能力.
- 这两种AI模型在处理神经外科手术所必需的复杂视觉数据方面都有显著的局限性.
- 需要进一步开发人工智能,以提高神经外科教育和实践的视觉解释.


