探索ChatGPT在骨科环境中的性能及其作为教育工具的潜在用途
Arthur Drouaud1, Carolina Stocchi2, Justin Tang2
1George Washington University School of Medicine, Washington, District of Columbia.
JB & JS open access
|November 27, 2024
概括
聊天GPT-4视觉 (GPT-4V) 在医学推理中显示出公平的协议,但低于外科医生对骨科创伤教育的标准,特别是在图像解释方面. 它在管理和治疗方面的表现强于成像分析.
科学领域:
- 医疗教育中的人工智能
- 医疗保健中的大型语言模型
- 骨科创伤培训 骨科创伤培训
背景情况:
- 像ChatGPT-4视觉 (GPT-4V) 这样的人工智能 (AI) 工具的整合到医学教育中正在迅速发展.
- 评估AI在解释医疗数据和制定患者管理策略方面的能力,对于其有效实施至关重要.
- 整形外伤教育提出了复杂的诊断和管理挑战,人工智能可能有助于解决这些问题.
研究的目的:
- 评估GPT-4V在解释骨科创伤医学图像和患者信息方面的性能.
- 评估GPT-4V在诊断制定和指导患者管理和治疗决策方面的能力.
- 确定GPT-4V作为医学学生在现实生活中的骨科创伤病例中的教育工具的潜力.
主要方法:
- 从OrthoBullets的十个流行的骨科创伤病例被选中进行分析.
- GPT-4V解释提供医疗成像和患者数据,生成诊断并回答案例特定的问题.
- 经过奖学金培训的四名骨科创伤外科医生使用5分利克特级别对GPT-4V的准确性,合理性,相关性和可信度进行了评分.
主要成果:
- 在图像解释方面,GPT-4V的整体平均评分为3.46/5.00,具体分数为准确性 (3.28),合理性 (3.68),相关性 (3.75) 和可信度 (3.15).
- 管理问题 (总体3.76) 和治疗问题 (总体4.04) 的表现有所改善,这表明这些领域的AI能力更好.
- 外科医生评级表明与GPT-4V的推理相当一致,但与管理和治疗相比,在成像解释方面表现较差.
结论:
- 这项研究是第一个评估GPT-4V用于骨科创伤医学教育的研究,涵盖成像,管理和治疗.
- GPT-4V在推理上表现出公平的协议,但没有达到作为独立教育工具的奖学金培训外科医生的标准.
- 在解释医疗图像方面,人工智能工具的表现明显较弱,而在提供管理和治疗指导方面,其效率明显较低.


