在粗解剖学课程中使用大型语言模型 (ChatGPT,Copilot,PaLM,Bard和Gemini):比较分析课程
Volodymyr Mavrych1, Paul Ganguly1, Olena Bolgova1
1College of Medicine, Alfaisal University, Riyadh, Kingdom of Saudi Arabia.
概括
生成型人工智能大语言模型 (LLM) 在医学教育中显示出不同的准确性. 与其他测试的LLMs相比,ChatGPT-4在回答医学多选择题和生成临床场景方面表现优异.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 人体解剖学 解剖学 解剖学
背景情况:
- 生成型人工智能大语言模型 (LLM) 越来越多地用于各种领域,包括医学教育.
- 人们对LLM在教育环境中的准确性和可靠性存在担忧.
- 评估LLM在专业科目中的表现,如粗体解剖学,对于理解它们的潜在作用至关重要.
研究的目的:
- 为了比较医疗教育中六种不同的大型语言模型 (LLM) 的准确性和熟练性.
- 评估法学士回答医学多选题 (MCQ) 和生成粗体解剖学临床场景的能力.
- 确定与医学学生在粗体解剖学教育相关的任务中表现最好的LLM.
主要方法:
- 六个LLM (ChatGPT-4,ChatGPT-3.5-turbo,ChatGPT-3.5,Copilot,PaLM,Bard和Gemini) 进行了测试. 这些LLM的测试结果是:
- 法学士回答了50个USMLE风格的总体解剖学MCQ,结果在5次尝试中对准确性,相关性和全面性进行了评估.
- 在LLM中,针对特定的上肢主题生成了临床场景和MCQ,专家分级为0-5级.
主要成果:
- 在回答MCQ时,ChatGPT-4获得了最高的准确性 (60.5%±1.9%),明显超过其他LLM (p <0.05).
- 在生成临床场景和MCQ方面,ChatGPT-4也产生了最好的结果,其次是双子座和ChatGPT-3.5变体.
- 在Copilot,Google PaLM 2和Bard中,在MCQ回答和场景生成任务中表现较差.
结论:
- 虽然LLM作为补充工具显示出希望,但它们还没有成熟到足以取代粗体解剖学中的人类教育工作者.
- 在医学教育任务中,ChatGPT-4在评估的LLM中表现最强.
- 需要进一步开发LLMs,以充分支持医疗教学和学习,以有效和可靠的方式.


