评估ChatGPT在骨科培训内检查中的表现
Justin E Kung1, Christopher Marshall2, Chase Gauthier1
1Department of Orthopedic Surgery, Prisma Health-Midlands University of South Carolina, Columbia, South Carolina.
JB & JS open access
|September 11, 2023
概括
人工智能 (AI) 在医学教育中显示出前景. 在骨科实习检查 (OITE) 中,GPT-4获得了73.6%的得分,超过了PGY-5居民平均成绩.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 整形外科手术培训班 整形外科手术培训班
背景情况:
- 人工智能 (AI) 显示出提高医学教育和医疗保健的潜力.
- 领先的自然语言处理人工智能ChatGPT在标准化测试中表现出色.
- 这项研究评估了ChatGPT在骨科培训内检查 (OITE) 的表现.
研究的目的:
- 评估ChatGPT (3.5和4版本) 在骨科培训内检查 (OITE) 的性能.
- 将人工智能性能与骨科外科住院医生的全国平均水平进行比较.
- 评估ChatGPT引用的来源的可验证性和影响.
主要方法:
- 在ChatGPT 3.5和GPT-4中输入OITE 2020-2022问题 (无图像).
- 评估正确答案百分比与研究生年 (PGY) 居民平均值相比.
- 分析引用的来源类型,可验证性和期刊影响因素.
主要成果:
- 聊天GPT (3.5) 获得了54.3%的正确答案 (PGY-1水平),引用可验证来源的时间为47.2% (中位影响因子5.4).
- GPT-4获得了73.6%的正确答案 (PGY-5级),超过了ABOS Part I的67%通过分数.
- 在87.9%的案例中,GPT-4引用了可验证的来源 (中位影响因子5.2).
结论:
- 聊天GPT表现高于PGY-1,GPT-4超过了PGY-5的水平.
- 在ChatGPT版本之间观察到显著的改进.
- 需要进一步的研究来探索未来的AI版本及其在医学教育中的作用.


