一台机器可以通过测试吗? 评估GPT-4.0在整形外科委员会考试中的精度
Abdullah A Al Qurashi1,2,3, Ibrahim Abdullah S Albalawi4, Ibrahim R Halawani5
1From the College of Medicine, King Saud bin Abdulaziz University for Health Sciences at the National Guards, Jeddah, Saudi Arabia.
Plastic and reconstructive surgery. Global open
|December 19, 2023
概括
人工智能,特别是GPT-4.0,显示出有前途的塑性手术委员会考试的学习辅助工具. 虽然通常准确和清晰,但它的表现随着复杂的主题而变化,这表明了未来医疗教育中人工智能发展的领域.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 整形外科 整形外科 整形外科
背景情况:
- 人工智能 (AI) 在医学教育中越来越有价值.
- 本研究评估了GPT-4.0大语言模型在整形外科委员会考试问题上的表现.
研究的目的:
- 评估GPT-4.0作为整形外科的学习工具的有效性.
- 探索AI在为未来的外科医生准备获得董事会认证方面的潜力.
主要方法:
- 从19个章节的标准整形手术参考书中利用了50个问题.
- 评估了GPT-4.0对准确性,清晰性,完整性和简洁性的反应.
- 进行了相关性分析,以将响应参数与整体性能联系起来.
主要成果:
- 在三分尺度上,GPT-4.0获得了高平均分:准确度 (2.88),清晰度 (3.00),完整性 (2.88),简洁性 (2.92).
- 响应的完整性与准确性有显著的相关性 (P < 0.0001).
- 各章节的表现各不相同,表明复杂主题的限制.
结论:
- GPT-4.0显示出作为塑性手术委员会考试准备的辅助工具的巨大潜力.
- 高分数表明人工智能可以提供准确,清晰,完整和简洁的医疗信息.
- 需要进一步的研究来提高AI在复杂的医学科目上的表现,以便在更广泛的教育应用中.


