相关实验视频
Updated: May 20, 2025

07:37
Translational Orthotopic Models of Glioblastoma Multiforme
Published on: February 17, 2023
2.5K
聊天GPT-4o和谷歌双子表现的准确性和质量在基于图像的神经外科董事会问题上
Suyash Sau1, Derek D George2, Rohin Singh2
1University of Rochester School of Medicine and Dentistry, Rochester, NY, USA. suyash_sau@urmc.rochester.edu.
Neurosurgical review
|March 25, 2025
概括
大语言模型 (LLM) 在医学检查中显示出潜力,但基于图像的问题仍然是一个挑战. 在神经外科问题上,GPT-4o的表现优于Google Gemini,尽管整体准确性低于基于文本的任务.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 神经外科培训课程 神经外科培训
背景情况:
- 大型语言模型 (LLM) 已经证明了在回答基于文本的医学委员会考试问题方面的熟练程度.
- 在基于图像的医学问题上,LLM的表现对于诊断推理至关重要,尚未得到广泛的评估.
研究的目的:
- 评估两位领先的LLM,GPT-4o和Google Gemini在基于图像的问卷库上的表现,用于神经外科委员会考试的准备.
- 为了比较这些LLM在解释与神经外科相关的医学图像中的准确性和响应质量.
主要方法:
- 利用了379个基于图像的神经外科委员会准备问题的问题库.
- 评估了LLM准确性和响应质量,由高级神经外科住院医生进行评估.
- 采用统计测试,包括奇平方和独立样本t测试,以分析性能差异.
主要成果:
- GPT-4o实现了51.45%的准确性,显著超过双子座的39.58% (P = 0.0013).
- 在病理学/组织学 (P=0.036) 和放射学 (P=0.014) 部分,GPT-4o表现优越.
- 此外,GPT-4o在第二级问题上也表现出色 (56.52%对41.85%,P=0.0067) 并获得更高的质量评分 (2.77对2.31,P<0.00001).
结论:
- GPT-4o在基于图像的神经外科董事会问题上表现优于双子座,表明AI诊断推理能力的进步.
- 尽管GPT-4o领先,但总体上LLM在基于图像的问题上的表现低于基于文本的问题,这表明当前机器视觉和医学图像解释的局限性.
- 需要进一步发展,以提高LLM在诊断目的解释复杂的医学图像的能力.
更多相关视频
09:41A Pipeline for 3D Multimodality Image Integration and Computer-assisted Planning in Epilepsy Surgery
Published on: May 20, 2016
12.0K
13:12Translational Brain Mapping at the University of Rochester Medical Center: Preserving the Mind Through Personalized Brain Mapping
Published on: August 12, 2019
44.8K