在智利医疗执照考试中探索ChatGPT版本3.5,4和4的性能:观察性研究
Marcos Rojas1, Marcelo Rojas2, Valentina Burgess2
1Graduate School of Education, Stanford University, Stanford, CA, United States.
JMIR medical education
|April 30, 2024
概括
聊天GPT版本4和4V成功通过了智利医疗执照考试 (EUNACOM),表现优于3.5.5版本. 性能因医疗专业而异,表明需要在医学教育中量身定制的人工智能培训.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 在医疗保健中的自然语言处理.
背景情况:
- 开放AI的ChatGPT模型 (3.5,4和4V) 显示了医疗检查和教育的全球潜力.
- 关于ChatGPT在非英语医学执照考试中的有效性存在有限的研究,例如智利的EUNACOM.
- 评估ChatGPT对不同语言和文化背景的适应性对于其医疗应用至关重要.
研究的目的:
- 评估ChatGPT版本3.5,4和4V在智利国家医学知识考试EUNACOM上的表现.
- 为了比较不同版本的ChatGPT在EUNACOM内的各种医学学科的准确率.
- 确定医疗许可评估人工智能模型的潜在局限性和改进领域.
主要方法:
- 利用了来自智利大学的三个官方EUNACOM实践演习 (540个问题).
- 在实践演练中为每个ChatGPT版本 (3.5,4和4V) 进行了三次尝试.
- 系统地分类和分析每个尝试和ChatGPT版本的响应准确率.
主要成果:
- 所有的ChatGPT版本都通过了EUNACOM的实践演习.
- 聊天GPT版本4 (79.32%准确率) 和4V (78.83%准确率) 的表现明显优于版本3.5 (57.53%准确率).
- 版本4和4V在手术中显示出最高的准确性,而3.5版本在精神病学中表现出色;性能在医学领域各不相同.
结论:
- 聊天GPT证明了通过EUNACOM的能力,版本之间有显著的性能差异.
- 人工智能的进步并没有显著改善基于图像的问题的表现,这表明需要专门培训.
- 这些发现突出了人工智能增强医学教育和认知技能的潜力,需要进一步研究细微的人工智能培训.
关键词:
在这里,我们可以看到AIAIAI.聊天GPT 聊天GPT 聊天欧盟通讯社 (EUNACOM) 是一个国际通讯机构.人工智能是一种人工智能.生成型的人工智能 (GAI)医学教育 医学教育医疗执照 医疗执照医疗许可证考试的医学许可证考试医疗许可证 医疗许可证更多相关视频
11:12Driving Simulation in the Clinic: Testing Visual Exploratory Behavior in Daily Life Activities in Patients with Visual Field Defects
Published on: September 18, 2012
17.4K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
548
