聊天GPT-4 USMLE学科和临床技能的全方位表现:比较分析
Brenton T Bicknell1, Danner Butler2, Sydney Whalen3
1UAB Heersink School of Medicine, 1670 University Blvd, Birmingham, AL, 35233, United States, 1 2566539498.
JMIR medical education
|November 6, 2024
概括
最新的ChatGPT-4 Omni模型显示了医学知识和临床技能的显著改进,在USMLE风格问题上表现优于以前的版本和医学学生. 这凸显了它作为医学培训教育工具的潜力.
科学领域:
- 人工智能在医学中的应用
- 医疗教育 技术 技术 医学教育
- 大型语言模型
背景情况:
- 最近的大型语言模型 (LLM) 证明了通过医疗许可证考试的能力.
- 在对特定医学领域LLM绩效的详细分析中存在差距.
- 评估医学教育中的LLM实用性需要细粒度的绩效数据.
研究的目的:
- 为了评估和比较连续的ChatGPT版本 (GPT-3.5,GPT-4,GPT-4 Omni) 的准确性.
- 评估美国医学执照考试 (USMLE) 学科和临床职务人员的绩效.
- 在模拟的临床场景中评估诊断和管理技能.
主要方法:
- 采用了750个基于临床图片的多选题.
- 测试了聊天GPT 3.5,聊天GPT 4 和聊天GPT 4 Omni.
- 使用标准化协议和统计分析评估准确性.
主要成果:
- GPT-4 Omni实现了90.4%的准确性,超过了GPT-4 (81.1%) 和GPT-3.5 (60.0%).
- GPT-4 Omni在社会科学 (95.5%),行为/神经科学 (94.2%) 和药理学 (93.2%) 方面表现出色.
- GPT-4 Omni 显示出卓越的诊断 (92.7%) 和管理 (88.8%) 准确性,显著超过医学学生的平均水平 (59.3%).
结论:
- 与前任相比,GPT-4 Omni在USMLE学科和临床技能方面取得了显著的改善.
- 像GPT-4 Omni这样的LLM作为医学学生的教育辅助工具具有显著的潜力.
- 仔细的整合和批判性分析对于有效地利用医学教育中的LLMs至关重要.
关键词:
医疗教育中的人工智能聊天GPT 聊天GPT 聊天聊天GPT 3.5 3.5 在线聊天聊天GPT 4 聊天GPT 4 在线聊天聊天GPT 4 Omni 在线聊天法学士 (LLM) 是一个专业.美国米勒 (USMLE)美国医疗执照考试医学中的人工智能临床技能 临床技能教育技术的教育技术.大型语言模型医学教育 医学教育医学执照考试 医学执照考试医学学生资源 医学学生资源医学院的学生 医学院的学生更多相关视频
07:31A Computerized Functional Skills Assessment and Training Program Targeting Technology Based Everyday Functional Skills
Published on: February 13, 2020
6.9K
09:52Setting Up a Stroke Team Algorithm and Conducting Simulation-based Training in the Emergency Department - A Practical Guide
Published on: January 15, 2017
17.1K
