基于人工智能的大型语言模型在骨科培训内考试中的比较性能
Andrew Y Xu1, Manjot Singh1, Mariah Balmaceno-Criss1
1Warren Alpert Medical School, Brown University, Providence, RI, USA.
Journal of orthopaedic surgery (Hong Kong)
|March 3, 2025
概括
GPT-4在骨科板式问题上表现出卓越的表现,超过了2022年骨科培训内考试 (OITE) 的合格门. 这种先进的大型语言模型 (LLM) 的性能优于GPT-3.5和Google Bard,突出了其在临床应用中的潜力.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 整形外科手术培训 整形外科手术培训
背景情况:
- 大型语言模型 (LLM) 具有潜在的临床应用,但它们在专业医学检查上的比较有效性尚未得到充分证实.
- 不同LLM在骨科板式问题上的表现需要彻底调查,以了解他们的能力和局限性.
研究的目的:
- 为了比较评估三个领先的大型语言模型 (LLMs) 在骨科板式问题上的表现.
- 评估GPT-4,GPT-3.5和Google Bard的熟练程度,并将其与骨科住院医生的绩效基准和特定问题类型进行比较.
主要方法:
- 三个LLM (GPT-4,GPT-3.5和谷歌巴德) 使用189个官方的2022年骨科培训考试 (OITE) 问题进行了评估.
- 对骨科住院医生的分数进行了表现分析,特别注意更高阶的,与图像相关的和特定主题的问题.
主要成果:
- GPT-4超过了2022年OITE通过门,在PGY-3到PGY-5居民水平上表现出色,并且显著超过了GPT-3.5和Bard (p < .001).
- GPT-3.5和Bard没有达到通过门,分别表现在PGY-1/PGY-2和PGY-1/PGY-3水平.
- 与GPT-3.5和Bard (p <.001) 相比,GPT-4在图像相关和更高阶问题上表现优越 (p <.001).
结论:
- 基于AI的LLM GPT-4在回答各种OITE问题方面表现出强大的能力,超过了2022年考试的最低分数.
- 在骨科板式问题上,GPT-4显著优于其前身GPT-3.5和Google Bard.
- 这些发现强调了像GPT-4这样的高级LLM作为医学教育和评估中的有价值工具的潜力.


