人工智能与人类对医疗面试成绩单的基于人工智能的评估在一个生成的人工智能模拟的患者系统中:跨部分验证研究
Hiromizu Takahashi1, Kiyoshi Shikino2, Takeshi Kondo3,4
1Department of General Medicine, Faculty of Medicine, Juntendo University, 3-1-3 Hongo, Bunkyo Tokyo, 1130033 Japan, Tokyo, Japan, 81 3-3813-3111.
JMIR medical education
|February 17, 2026
概括
基于人工智能的评估 (ABA) 与基于人体的评估 (HBA) 密切相匹配,用于虚拟患者访谈,提供可靠和更快的替代方案. 这项技术可以提高效率,减少医学教育中的教师工作量.
科学领域:
- 医疗教育 技术 技术 医学教育
- 医疗保健中的人工智能
- 临床技能评估 临床技能评估
背景情况:
- 生成型人工智能 (AI) 在医学教育中越来越多地用于虚拟患者模拟.
- 在临床面试中,基于人工智能的评估 (ABA) 与传统的基于人类的评估 (HBA) 的可比性仍未得到充分研究.
研究的目的:
- 为了比较AI (GPT-o1 Pro,GPT-5 Pro) 与人类评估者的临床面试评估质量.
- 评估AI对不同临床经验水平的评估时间和协议的影响.
主要方法:
- 通过人工智能虚拟患者向七名参与者展示标准化的腿部软弱病例.
- 采访成绩单通过人工智能工具和盲目临床讲师使用主访谈评分表得分.
- 使用相关系数,布兰德-阿尔特曼分析和克伦巴赫的α来评估可靠性和一致性;测量时间效率.
主要成果:
- 基于人工智能的评估 (ABA) 评分与基于人类的评估 (HBA) 评分非常相似 (r=0.90,一致性相关系数=0.88).
- 与HBA相比,ABA表现出更好的一致性 (较低的变化系数:6.6%与13.9%) 和可靠性 (ICC(3,1):0.77-0.82) 与HBA (ICC(2,1):0.38).
- 人工智能显著减少了评估时间,与人类评估器相比,GPT-5 Pro提供了67.6%的减少.
结论:
- 基于人工智能的评估为虚拟患者访谈提供了一个有效,一致和快速的替代方案,而不是基于人类的评估.
- ABA可以提高效率,实现及时反,并减少医学培训机构的教师工作负担.
- 建议进行进一步的研究,以确认ABA在各种教育环境中的通用性.

