在骨科板式书面考试上ChatGPT的性能不足
Chandler A Sparks1, Matthew J Kraeutler2, Grace A Chester1
1Department of Orthopedic Surgery, Hackensack Meridian School of Medicine, Nutley, USA.
Cureus
|July 22, 2024
概括
聊天GPT表现出有限的骨科知识,错误地回答了55.9%的板式问题. 它的性能表明它还不适合医疗教育或实践,主要是由于信息检索错误.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 骨科知识评估 骨科知识评估
背景情况:
- 聊天生成预训练变压器 (ChatGPT) 是一个AI聊天机器人.
- 对医疗保健的AI进行评估需要评估其知识和推理.
- 在这个领域的AI应用中,骨科知识至关重要.
研究的目的:
- 评估ChatGPT的骨科知识和推理能力.
- 评估其作为骨科培训的学习辅助工具的适用性.
- 为了比较它的表现与董事会风格的问题.
主要方法:
- 聊天GPT (GPT-3.5) 被查询了472个骨科板式问题.
- 这些问题来自Orhobullets,2022年OITE和2021年OITE.
- 分析了答案的正确性,解释的准确性和推理性.
主要成果:
- 聊天GPT正确回答了55.9%的问题.
- 在92.8%的正确答案中,解释与数据集答案相匹配.
- 大多数错误的答案源于信息错误 (81.7%).
结论:
- 聊天GPT的表现低于通过ABOS Part I考试的门.
- 它在OITE上的表现与实习生到第二年居民的表现相当.
- 一个关键的局限性是人工智能无法识别正确答案所需的信息.


