从设置到审查:使用人工智能对单一最佳答案问题进行审查
Olivia Ng1, Siew Ping Han1, Magdalene Hui Min Lee2
1Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore.
Korean journal of medical education
|March 9, 2026
概括
人工智能 (AI) 可以通过作为首次通过审查员来协助审查单一最佳答案 (SBA) 问题,提高医疗教育的一致性和减少工作量. 人类监督对于确保教育相关性至关重要.
科学领域:
- 医疗教育 技术 技术 医学教育
- 人工智能在评估中的作用
- 教育测量教育的测量
背景情况:
- 保持单一最佳答案 (SBA) 问题的质量是医学教育中持续存在的挑战.
- 人工智能产生的评估项目的兴起需要强有力的审查过程.
- 目前的人工智能问题生成已经得到了很好的研究,但人工智能辅助的审查仍然未得到充分探索,并且难以扩展.
研究的目的:
- 调查使用大型语言模型 (LLM) 支持SBA问题的审查的可行性和可靠性.
- 开发和评估一个基于人工智能的审查员 (QA-bot) 用于SBA问题质量评估.
- 为了比较人工智能审查员的表现与经验丰富的人类教育工作者.
主要方法:
- 使用自定义GPT开发了一个AI审核器 (QA-bot),结合了25个基于Bloom分类法 (1-3级) 的标准.
- 利用共享的评估标签对32个人工智能生成的SBA问题进行独立评估.
- 使用类内相关系数 (ICC) 评估QA-bot和人类审稿人之间的评审者之间的可靠性.
主要成果:
- 评价标签显示了高的内部一致性 (克朗巴赫α=0.878) 和人类评审者之间强大的评审者间可靠性 (ICC=0.893).
- 质量保证机器人与人类评分器 (ICC=0.861和0.840) 显示出良好的对齐.
- 人工智能在客观标准上表现良好,但在识别无关紧要的复杂性和判断问题的难度方面不那么一致.
结论:
- 人工智能可以作为SBA问题的有效初始审查员,提高一致性和减少工作量.
- 人类监督对于确保评估项目的教育和临床相关性至关重要.
- 人工智能辅助审查提供了一个可扩展的解决方案,以提高医学教育评估的质量保证.
