在医学教育中使用预训练的大型语言模型进行人工智能驱动的评估
Jacob Cole1, Joshua Duncan2, Rebekah Cole3
1J. Cole is associate professor, Department of Anesthesiology and Department of Military and Emergency Medicine, Uniformed Services University of the Health Sciences, Bethesda, Maryland.
概括
大型语言模型 (LLM) 在评估医学学生对道德伤害的理解方面表现有前途,提供更客观和更有效的评估. 这种基于人工智能的方法可以改善医疗伦理培训的反和教育成果.
科学领域:
- 医学教育
- 医疗保健中的人工智能
- 医学上的道德
背景情况:
- 由于时间限制和客观反的需要,在基于能力的课程中对医学学生进行评估是具有挑战性的.
- 传统的评估方法可能缺乏一致性和有针对性的反,
研究的目的:
- 试点使用大型语言模型 (LLM) 进行检索增强生成,以评估学生对道德伤害的理解.
- 在医学伦理课程中评估基于LLM的效率,客观性和有效性.
主要方法:
- 我们使用LLM (Google Gemini 1.5 Pro,Google Gemini 2.0 Flash,OpenAI ChatGPT-4o) 来生成有关道德伤害的重要文章的评级标题.
- 三个LLM使用生成的标题对165个学生的回答进行了评估.
- 对两位经验丰富的教育工作者进行了比较,以确定有效性证据.
主要成果:
- 谷歌双子1.5 Pro成功生成了道德伤害的细微分级标题.
- 与人类评审者相比,OpenAI ChatGPT-4o获得了最高的评审者间可靠性 (0.77和0.68),超过了评审者间的一致性 (0.57).
结论:
- 提供一个有前途的工具来提高医学学生评估的效率和客观性,特别是在专业的伦理主题.
- 教师监督对于确保道德责任和减轻人工智能驱动评估中的潜在偏见至关重要.


