生成型的人工智能能通过骨科委员会考试吗?
Ula N Isleem1, Bashar Zaidat1, Renee Ren1
1Department of Orthopaedic Surgery, Icahn School of Medicine at Mount Sinai, New York, NY, USA.
Journal of orthopaedics
|March 7, 2024
概括
像ChatGPT这样的大型语言模型可以回答60.8%的骨科培训考试问题. 虽然对居民教育有用,但要仔细审查ChatGPT.
科学领域:
- 医疗教育中的人工智能
- 整形外科手术培训班 整形外科手术培训班
- 大型语言模型 (LLM)
背景情况:
- 整形外科培训考试 (OITE) 评估住院知识,并确定那些有失败的风险的美国整形外科委员会 (ABOS) 考试.
- 对OITE的最佳准备策略正在不断探索,大型语言模型 (LLM) 可能发挥作用.
- 聊天GPT,一个法学士,证明了提供准确,详细的答案的能力,表明其在医学教育中的实用性.
研究的目的:
- 评估ChatGPT在骨科培训内检查方面的表现.
- 使用来自美国骨科外科医生学院 (AAOS) 数据库的自我评估考试 (SAE) 和批准的文献作为骨科委员会考试的代理.
主要方法:
- 来自AAOS数据库和文献的301个SAE问题被输入到ChatGPT.
- 每个问题都是在一个新的聊天会话中提出的.
- 答案被分析,分类,并与OITE和SAE考试中的正确答案进行比较.
主要成果:
- 在301个问题中,ChatGPT正确回答了183个问题 (60.8%).
- 最高的正确答案率是基础科学 (81%),瘤学 (72.7%),肩膀和肘部 (71.9%),以及体育 (71.4%).
- 根据问题类型的表现有所不同:管理 (54.7%),诊断 (71.7%) 和知识回忆 (60.7%).
结论:
- 聊天GPT显示在提供准确的答案板式的骨科问题的潜力.
- 它目前在临床教育中的实用性有限,但在不断发展,需要对其推理进行仔细分析,以确定其准确性和临床有效性.


