人工智能在骨科:在一个完整的AAOS骨科培训内检查 (OITE) 上,对文字和图像问题进行ChatGPT的表现
Daniel S Hayes1, Brian K Foster1, Gabriel Makar1
1Department of Orthopaedic Surgery, Geisinger Commonwealth School of Medicine, Geisinger Musculoskeletal Institute, Danville, PA.
Journal of surgical education
|September 16, 2024
概括
像ChatGPT这样的人工智能 (AI) 聊天机器人在2019年整形外科培训考试 (OITE) 中表现不佳. 在专家描述图像时,仅以文本和基于图像的问题表现相似,但在人工智能生成的描述时下降.
科学领域:
- 医疗教育 技术 技术 医学教育
- 医疗保健中的人工智能
- 整形外科手术培训班 整形外科手术培训班
背景情况:
- 人工智能 (AI) 通过回答复杂的问题来展示医学教育的潜力.
- 在专门的医学检查中评估AI的性能对于理解它的能力至关重要.
- 整形外科医生培训考试 (OITE) 作为整形外科医生住院知识的基准.
研究的目的:
- 评估ChatGPT (GPT-4) 在2019年整体骨科培训内考试 (OITE) 的表现.
- 为了比较ChatGPT在纯文本和图像组件问题上的表现.
- 调查人工智能生成与人类专家图像描述对ChatGPT准确性的影响.
主要方法:
- 2019年的OITE问题被输入到ChatGPT版本4.0 (GPT-4).
- 基于图像的问题补充了由微软Azure AI Vision Studio或骨科专家生成的描述.
- 对ChatGPT的答案进行了分析,以确定不同的问题格式和图像描述方法的准确性.
主要成果:
- 聊天GPT的平均正确答案率为49%的纯文本问题和48%的图像组件问题.
- 与专家描述相比,使用人工智能生成的图像描述时,性能下降了6%.
- 聊天GPT的整体得分 (49%) 在2019年OITE.com上低于所有居民类,包括PGY-1居民.
结论:
- 在2019年OITE上,ChatGPT的表现低于所有居民类的水平.
- 人工智能对基于图像的问题的准确性取决于图像描述的质量,专家描述会产生更好的结果.
- 了解AI性能限制对于其负责任地融入医学教育和医疗保健至关重要.


