使用人工智能评估一般外科住院申请的可行性
Pooja M Varman1, Shadae Nicholas2, Andrew Conner1
1Digestive Diseases Institute, Cleveland Clinic, Cleveland, Ohio.
Journal of surgical education
|August 30, 2025
概括
人工智能 (AI) 始终在一般外科实习生个人陈述中得分,但与人类评审者不同. 人类判断对于细致的申请审查至关重要.
科学领域:
- 医疗教育
- 医学的人工智能
背景情况:
- 研究生医学教育越来越多地使用人工智能 (AI).
- 个人陈述 (PSs) 是主观的,但对于居住申请至关重要.
- 居住计划正在评估人工智能进行应用选.
研究的目的:
- 评估使用大型语言模型 (LLM) 来评估一般外科住院PS的可行性.
- 将人工智能生成的分数与人类分配的PS分数进行比较.
主要方法:
- 追溯分析668个未确定的整体外科住院PS.
- 通过人类评估者 (HA) 和GPT-3.5 (AI) 在领导力和途径领域使用1-5级的PS得分.
- 使用描述性统计和加权的卡帕系数比较AI和HA分数;对异常病例进行定性审查.
主要成果:
- AI和HA分数之间的低一致性 (κ=0.184领导力, κ=0.120路径).
- 人工智能获得的领导力较低 (中位数为3),途径高 (中位数为4),而非HA (中位数为4领导力,中位数为3途径).
- 人工智能需要明确的标签来获得高分数; 人工智能认可了像性和激情这样的推断性质.
结论:
- 人工智能表现出一致的标题应用,但对PS的解释不同于人类.
- 人工智能可以提高初始查的一致性和可扩展性.
- 人类判断对于评估应用中的隐含意义和细微内容至关重要.


