将人工智能学习模型的表现与医学学生在解决组织学和胚胎学多选题中的表现进行比较
Miloš Bajčetić1, Aleksandar Mirčić1, Jelena Rakočević1
1Institute of Histology and Embryology "Aleksandar Đ. Kostić", Faculty of Medicine, University of Belgrade, Belgrade, Serbia.
概括
人工智能语言模型 (AI LMs) 与第一年医学学生相比,在组织学和胚胎学多选择题上表现优异. 然而,随着时间的推移,AI LM 在答案和分类中显示出不一致,警告其在医学教育中的使用.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 历史学和胚胎学
背景情况:
- 人工智能语言模型 (AI LM) 越来越受欢迎,可能会影响医学教育.
- 这项研究评估了AI LM在第一年医学生的组织学和胚胎学知识的准确性和一致性.
研究的目的:
- 评估AI LM在组织学和胚胎学知识中的准确性和一致性.
- 为了比较AI LM性能与一年级医学学生.
- 评估AI LM使用Bloom的分类学分类问题的能力.
主要方法:
- 五个人工智能聊天机器人 (ChatGPT,Bing AI,Bard AI,Perplexity AI,ChatSonic) 通过多项选择问题进行了测试.
- 人工智能LM结果与一年级医学学生的分数进行了比较.
- 聊天机器人使用布卢姆分类学对问题的分类与专家教师的评分进行了比较.
- 通过在两个月后重新进行测试来评估一致性.
主要成果:
- 人工智能LMM正确地回答了组织学和胚胎学多选题,表现优于一年级医学学生.
- 根据布卢姆的分类学,AI LM在分类问题方面遇到了困难,表现比教师更差.
- 在重新测试时,在AI LM答案和分类中观察到缺乏一致性.
结论:
- 人工智能LM可以准确地回答医学知识问题,但表现出不一致性.
- 人工智能LM性能的变化表明,当将它们用作医学教育工具时,应谨慎使用.


