相关实验视频
Updated: Jun 16, 2025

08:06
Mixed Reality Assisted Radical Endoscopic Thyroidectomy
Published on: January 31, 2025
227
评估ChatGPT-3.5和ChatGPT-4在台湾整形外科委员会考试中的表现
Ching-Hua Hsieh1, Hsiao-Yun Hsieh1, Hui-Ping Lin1
1Department of Plastic Surgery, Kaohsiung Chang Gung Memorial Hospital, Chang Gung University and College of Medicine, Kaohsiung, 83301, Taiwan.
Heliyon
|August 16, 2024
概括
与ChatGPT-3.5相比,ChatGPT-4在台湾塑料手术委员会考试中表现优异,达到59%的正确答案率. 这次评估强调了人工智能.
科学领域:
- 医疗教育中的人工智能
- 在医疗保健中的自然语言处理.
- 外科培训和评估的外科.
背景情况:
- 像ChatGPT这样的大型语言模型在医疗许可证考试中表现不同.
- 台湾整形外科委员会考试是评估外科知识的基准.
- 在专业医疗检查中评估AI性能对于了解其潜力和局限性至关重要.
研究的目的:
- 评估ChatGPT-3.5和ChatGPT-4在台湾塑料手术委员会考试中的表现.
- 为了比较不同的ChatGPT版本在回答整形外科董事会问题的准确性.
- 确定人工智能在整形外科教育和评估中的潜在应用.
主要方法:
- 利用了过去8年台湾整形外科委员会考试中的1375个问题.
- 包括单选题 (985) 和多选题 (390) 的问题格式.
- 通过为每一个问题启动一个新的聊天会话来确保公正的响应.
主要成果:
- 聊天GPT-4的整体正确答案率达到了59%,明显超过了聊天GPT-3.5的41%.
- 聊天GPT-4通过了八项年度考试中的五项,而聊天GPT-3.5全部失败.
- 在单选题中,ChatGPT-4得分为66%,在多选题中得分为43%,而ChatGPT-3.5得分分别为48%和23%.
结论:
- 聊天GPT-4显示了对整形手术委员会考试问题的有前途的能力.
- 预计未来的ChatGPT代将表现出更好的性能.
- 人工智能集成可以增强整形外科教育,评估和候选人准备.

