聊天GPT-4的回复显示与前肩不稳定性专家共识声明的有限相关性
Alexander Artamonov1, Ira Bachar-Avnieli1,2, Eyal Klang3,4
1Orthopedic Department, Barzilai Medical Center, Ashkelon, Israel.
Arthroscopy, sports medicine, and rehabilitation
|July 15, 2024
概括
生成预训练型变压器-4 (GPT-4) 答案与专家在前肩部不稳定性 (ASI) 诊断和治疗方面的共识之间存在有限的相关性. 这凸显了需要根据既定的临床指南验证人工智能生成的医疗信息的必要性.
科学领域:
- 整形外科 整形外科 整形外科
- 人工智能在医学中的应用
- 医疗信息学 医疗信息学
背景情况:
- 前肩部不稳定 (ASI) 是一种常见的骨科疾病,需要准确的诊断和管理.
- 专家共识声明为临床实践提供基于证据的指导方针.
- 人工智能 (AI) 在医疗保健中的使用越来越多,需要评估其与既定医学知识的一致性.
研究的目的:
- 为了比较由生成式预训练变压器-4 (GPT-4) 产生的答案的准确性和相似性,与前肩不稳定 (ASI) 的专家共识声明进行比较.
- 评估AI在提供信息方面的可靠性,以符合ASI目前的临床指南.
主要方法:
- 对ASI诊断,非手术管理和Bankart修复的专家共识声明进行了审查.
- GPT-4采用了与专家小组提出的相同问题进行查询.
- 经验丰富的肩部外科医生对GPT-4和共识陈述的答案进行了比较并对相似性进行了评分.
- 观察者之间的可靠性是使用加权的kappa得分来计算的.
主要成果:
- 肩部外科医生评价GPT-4的答案与25.8%的问题的共识陈述非常相似,为45.2%的中等,为29%的低.
- 在GPT-4的自我评估中,高相似度为48.3%,中等相似度为41.9%,低相似度为9.7%.
- 外科医生和GPT-4在58.1%的问题上同意相似性分类,在41.9%的问题上不同意.
结论:
- 人工智能产生的反应与有关ASI诊断和治疗的专家共识陈述的相关性有限.
- 这些发现强调了对人工智能产生的医疗信息进行批判性评估和验证的重要性.
- 需要进一步的研究来完善人工智能模型用于骨科的临床应用.


