在3000个USMLE®风格问题中分析影响ChatGPT性能的问题特征
Michael Alfertshofer1,2, Samuel Knoedler3,4, Cosima C Hoch5
1Department of Oral and Maxillofacial Surgery, Ludwig-Maximilians-University Munich, Munich, Germany.
像ChatGPT这样的人工智能 (AI) 在医学教育中显示出潜力,但需要评估. 这项研究发现,ChatGPT正确回答了57.7%的USMLE Step 2CK问题,性能因医疗专业和问题难度而异.
科学领域:
- 医学教育 医学教育
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 人工智能 (AI) 和大型语言模型 (LLM) 在医学上表现有前途.
- 对AI在医疗应用中的性能进行全面评估至关重要.
- 本研究专门评估了ChatGPT在USMLE Step 2CK问题上的表现.
研究的目的:
- 为了评估ChatGPT在USMLE Step 2CK练习问题上的准确性和性能.
- 分析不同医学专业,问题类型和难度等级的AI性能.
- 为开发AI耐药医学检查提供信息,并指导AI在医学教育中的整合.
主要方法:
- 从AMBOSS学习平台提取了3000个基于文本的USMLE Step 2CK练习问题.
- 手动输入问题到ChatGPT进行分析.
- 评估了ChatGPT在各种类别和难度级别的准确性和性能.
主要成果:
- 在测试问题上,ChatGPT的整体准确率为57.7%.
- 根据医疗类别的表现差异很大,最高分数在"男性生殖系统" (71.7%) 和最低的"免疫系统" (46.3%).
- 基于表格问题的表现较低,问题难度与准确性之间存在负相关性 (r=-0.285,p<0.001).
结论:
- 聊天GPT的表现接近USMLE Step 2CK的通过门,但根据类别,类型和难度而异.
- 这些发现有助于教育工作者创建AI耐药考试,并将AI工具集成到教学策略中.
- 了解人工智能的局限性是学生将人工智能作为积极的学习辅助工具而不是替代品的关键.
更多相关视频
10:17Improving Student Outcomes with an Adaptable Molecular Cloning Course-Based Undergraduate Research Experience
Published on: November 15, 2024
06:28E-Patient Counseling Trial E-PACO: Computer Based Education versus Nurse Counseling for Patients to Prepare for Colonoscopy
Published on: August 1, 2019
相关概念视频
Comparing the Survival Analysis of Two or More Groups
Surveys
Analysis of Population Pharmacokinetic Data
Cochran's Q Test
Assessment of the Gastrointestinal System II: Health Perception Pattern
Health Perception Patterns
Health perception patterns offer valuable insights into a patient's lifestyle habits and how they may impact their GI health. These patterns include:
Model Approaches for Pharmacokinetic Data: Compartment Models
Two primary types of compartment models are recognized: mammillary and catenary. The more...
