评估ChatGPT通过FRCS骨科A部分考试的能力:批判性分析
Ahmed Saad1, Karthikeyan P Iyengar2, Vineet Kurisunkal3
1Department of Orthopedics, Royal Orthopedic Hospital, Birmingham, UK.
概括
像ChatGPT这样的人工智能 (AI) 聊天机器人还不能通过皇家外科医生学院 (FRCS Orth) 的骨科研究员考试. 人工智能模型得分为67.5%,低于所需的合格分数.
科学领域:
- 医疗教育中的人工智能
- 外科检查评估的评估
- 在医疗保健中的自然语言处理.
背景情况:
- 最近的AI进步,包括ChatGPT,显示在推理方面的能力.
- 皇家外科医生学院 (FRCS Orth) 的骨科研究员考试评估了外科专业知识.
- 在高风险的医学检查中评估AI的潜力至关重要.
研究的目的:
- 评估ChatGPT4在FRCS Orth Part A考试中的表现.
- 为了确定当前的AI模型是否能通过严格的外科资格测试.
- 确定AI在医学知识和批判性思维方面的局限性.
主要方法:
- 使用了240个模拟FRCS Orth A部分问题来测试ChatGPT4.
- 评估了ChatGPT4答案的准确性和响应时间.
- 使用描述性统计数据来分析聊天机器人的性能.
主要成果:
- 在FRCS Orth Part A考试中,ChatGPT4获得了67.5%的总分.
- 人工智能模型的表现没有达到考试的通过门.
- 准确性和响应时间是评估中的关键指标.
结论:
- 聊天GPT4目前无法通过FRCS骨科检查.
- 局限性包括缺乏高级思维和临床专业知识.
- 人工智能需要进一步发展,以满足专业医疗检查的需求.


