为血管外科委员会认证做准备:使用大型语言模型进行比较研究
Sonal Kumar1, George Y Tadros2, Taylor E Collignon3
1Vascular Surgery, Ross University School of Medicine, Miramar, USA.
Cureus
|June 10, 2025
概括
与其他大型语言模型 (LLM) 相比,Claude 3.5 在回答血管外科委员会考试问题方面表现出卓越的表现. 虽然有希望,但目前的LLM需要进一步发展,以充分支持血管外科教育.
科学领域:
- 医疗教育 技术 技术 医学教育
- 在外科手术中使用人工智能
- 血管外科培训 血管外科培训
背景情况:
- 大型语言模型 (LLM) 正在成为医学教育中的变革性工具.
- 有限的研究存在于LLM应用,特别是在血管外科培训.
- 评估LLM在血管外科委员会认证准备中的有效性至关重要.
研究的目的:
- 评估和比较各种LLM在准备血管外科委员会认证考试时的有效性.
- 探索LLM作为血管外科的补充教育资源的潜力.
主要方法:
- 使用了来自血管教育和自我评估计划 (VESAP) 版本6的269个基于文本的多选题.
- 四个人工智能工具 (ChatGPT 3.5,Google Gemini,Microsoft Bing,Claude 3.5) 被一个独立的审查员评估.
- 问题被输入无上下文的隐形AI窗口;千平方测试分析了性能变化.
主要成果:
- 克劳德3.5实现了最高的准确性 (65.7%),超过了谷歌双子座 (55.3%),聊天GPT (55.0%) 和微软Bing (53.9%).
- 克劳德3.5在各个学科中显示出显著的绩效差异 (p=0.001),在下肢 (86%) 和透析接入 (80%) 中表现出色.
- 聊天GPT,谷歌Gemini和微软Bing没有表现出学科的显著准确度变化.
结论:
- 克劳德3.5在回答血管外科委员会考试问题 (VSQE6) 中表现优异.
- LLM显示出作为补充工具的潜力,特别是在诸如下肢血管问题和透析接入等主题上.
- 目前的LLM能力并不完全满足血管外科教育不断发展的需求;预计将进一步发展.


