聊天GPT的实用性作为一个准备工具,用于骨科在培训中的考试
Dhruv Mendiratta1, Isabel Herzog1, Rohan Singh1
1Department of Orthopaedic Surgery Rutgers New Jersey Medical School Newark New Jersey USA.
Journal of experimental orthopaedics
|January 3, 2025
概括
这项研究评估了ChatGPT在骨科培训考试 (OITE) 的表现,发现成功率为48.3%. 虽然能够进行逻辑推理,但ChatGPT表现出信息谬误,可能妨碍居民教育.
科学领域:
- 医疗教育中的人工智能
- 在医疗保健中的自然语言处理.
背景情况:
- 整形外科在训练考试 (OITE) 是一个关键的评估,为居民.
- 确定有效和可靠的教育资源对于考试准备至关重要.
- 医疗信息的不断变化的性质需要不断评估研究材料.
研究的目的:
- 在2022年OITE上评估聊天生成预训练变压器 (ChatGPT) 的性能.
- 确定ChatGPT作为骨科住院医生的新型教育资源的潜力.
- 分析ChatGPT在其响应中产生的错误类型.
主要方法:
- 利用了美国骨科外科医生学会 (AAOS) 网站的所有2022年OITE问题,包括基于图像的问题.
- 问题格式与AAOS介绍相同.
- 在单独的聊天会话中对每个问题进行评估,以确保客观的答案.
- 根据逻辑,内部和外部信息对ChatGPT的答案进行分类,并将错误的答案分为特定的谬误类型.
主要成果:
- 聊天GPT在2022年的OITE.PT上实现了48.3%的整体成功率.
- 在应用逻辑 (67.6%),利用内部信息 (68.1%) 和整合外部信息 (68.1%) 中表现出熟练.
- 正确的答案显示逻辑,内部和外部信息的利用率显著更高 (分别p < 0.001,p = 0.004,p = 0.009).
- 信息谬误是最常见的错误类型;在含图像的问题上没有观察到准确度的显著差异 (p = 0.320).
结论:
- 聊天GPT目前在OITE上的表现表明有很大的局限性.
- 逻辑,信息和明确谬误的存在带来了错误信息的风险.
- 在ChatGPT可靠地用于支持OITE居民教育之前,需要进一步开发.


