在土耳其神经外科教育中对大型语言模型进行比较研究,使用模拟神经外科委员会考试
Kivanc Yangi1, Egemen Gok, Jiuxu Chen
1Barrow Neurological Institute.
Turkish neurosurgery
|March 5, 2026
概括
大型语言模型 (LLM) 在模拟神经外科检查中显示出高精度,表现优于居民. Deepseek-R1和Gemini-2.0 Pro为神经外科培训提供了宝贵的教育潜力.
科学领域:
- 神经外科 神经外科
- 人工智能的人工智能
- 医疗教育 医学教育
背景情况:
- 大型语言模型 (LLM) 在医学中越来越多地被使用.
- 法学士对神经外科教育的影响仍未得到充分研究.
- 这项研究评估了特定LLM在神经外科委员会考试中的表现.
研究的目的:
- 为了评估Deepseek-R1,Gemini-2.0 Pro,ChatGPT-o3-mini-high和GPT-4.5.5的准确性和教育价值.
- 为了比较LLM的表现与高级神经外科住院医生.
- 评估居民对LLM生成答案的偏好.
主要方法:
- 开发了一个50个问题的模拟神经外科委员会考试.
- 考试对三个主要的LLM和10名高级居民进行了考试.
- 对答案的准确性,推理时间,词数和可读性进行了评估.
- 居民对LLM答案的教育价值进行了排名.
主要成果:
- 所有评估的LLM (Deepseek-R1,ChatGPT-o3-mini-high,Gemini-2.0 Pro) 在总体准确度方面都比居民得分更高 (分别为84%,82%,78%和58%).
- 深度搜索-R1展示了最高的准确性和有组织的响应,而双子座-2.0 Pro提供了详细的,可读的答案.
- 居民们更喜欢Deepseek-R1和Gemini-2.0 Pro的响应,而不是ChatGPT-o3-mini-high.
- GPT-4.5实现了74%的准确性,比ChatGPT-o3-mini-high更快的响应时间和更复杂的输出.
结论:
- 由于其高准确度,LLM在神经外科培训中显示出作为补充教育工具的巨大潜力.
- 深度搜索-R1和双子-2.0 Pro作为精致的教育指南或神经外科手术评估工具具有前景.
- 进一步开发可以增强LLM用于构建董事会问题和培训评估.


