在客观结构化临床检查中评估医学学生时,生成人工智能的有效性:实验研究实验研究
Masashi Yokose1, Takanobu Hirosawa1, Tetsu Sakamoto1
1Department of Diagnostic and Generalist Medicine, Dokkyo Medical University, Tochigi, Japan.
JMIR formative research
|December 4, 2025
概括
像ChatGPT-4这样的生成人工智能显示出在客观结构化临床检查 (OSCE) 中提供帮助的潜力,但在大多数领域,与医生评估的一致性很差. 需要进一步的研究来确认其作为欧安组织补充评估员的有效性.
科学领域:
- 医疗教育 技术 技术 医学教育
- 医疗保健中的人工智能
- 临床技能评估 临床技能评估
背景情况:
- 客观结构化临床检查 (OSCE) 是一种标准的医学教育评估工具.
- 欧安组织的实施是资源密集的,对医疗机构构成挑战.
- 像ChatGPT-4这样的生成人工智能被探索为减少医生评估负担的潜在解决方案.
研究的目的:
- 评估生成AI (ChatGPT-4) 作为欧安组织补充评估者的有效性.
- 为了比较生成AI和人类医生分配的评估分数.
- 在欧安组织中评估AI和医生评估之间的协议.
主要方法:
- 一项实验研究涉及11名五年级医学学生进行模拟患者访谈.
- 医生和ChatGPT-4评估了学生的表现,使用6个领域的标题和利克尔特等级.
- 统计分析包括威尔科克森签名等级测试和类内相关系数 (ICCs).
主要成果:
- 在身体检查,患者笔记,临床推理和管理领域,ChatGPT-4比医生获得更高的分数.
- 在患者护理/沟通和病史记录方面没有观察到显著的得分差异.
- 类内相关系数 (ICC) 表明大多数领域的ChatGPT-4和医生评估之间的一致性较差.
结论:
- 生成型人工智能 (ChatGPT-4) 显示出在特定领域支持欧安组织评估的潜力.
- 糟糕的协议需要进一步的研究,以确定AI在欧安组织中的可重复性和有效性.
- 聊天GPT-4可以作为一个补充工具,但不能取代欧安组织的医生评估.

