评估检索增强生成和ChatGPT在骨科检查评估问题上的准确性
Jordan Eskenazi1, Varun Krishnan1, Maximilian Konarzewski1
1University of Miami, Miller School of Medicine, Miami FL, USA.
Annals of joint
|May 19, 2025
概括
使用ChatGPT-4的提取增强生成 (RAG) 在考试问题上实现了与骨科外科医生可比的准确性. 这种使用医学教科书的人工智能方法,显示了增强骨科手术教育和考试准备的前景.
科学领域:
- 人工智能在医学中的应用
- 整形外科教育 整形外科教育
- 大型语言模型 (LLM)
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 正在评估医疗问题解决能力.
- 检索增强生成 (RAG) 通过结合特定学科的知识,提高准确性和引用来源来增强LLM.
- 在骨科问题解决评估中LLM + RAG的应用是新的.
研究的目的:
- 在骨科检查评估中评估ChatGPT与RAG (ChatGPT + RAG) 的性能.
- 为了比较ChatGPT + RAG的性能与没有RAG的ChatGPT和人类骨科外科医生.
主要方法:
- 美国骨科外科医生学会 (AAOS) 的OrthoWizard问题库被利用.
- 为RAG提供了13本教科书和28个临床指南.
- 只有文本的多选题是以零射击学习方式对ChatGPT-4 + RAG,ChatGPT-4和ChatGPT-3.5.5进行的.
主要成果:
- 在1023个问题中,得分分为:ChatGPT-3.5 (52.98%),ChatGPT-4 (64.91%),ChatGPT-4 + RAG (73.8%) 和人类 (73.97%).
- 在整体准确度 (P>0.99) 中,在骨科外科医生和ChatGPT-4 + RAG之间没有发现统计学上显著的差异.
- 整形外科医生和ChatGPT-4 + RAG的表现明显优于ChatGPT-4和ChatGPT-3.5 (P<0.001).
结论:
- 在骨科检查问题上,ChatGPT-4 + RAG的准确性与骨科外科医生的准确性相当.
- 人工智能通过RAG指导骨科教科书,在回答专业测试问题时显示越来越高的准确性.
- 由于RAG能够引用来源,LLMs成为骨科外科教育和考试准备的宝贵工具.


