快速工程对ChatGPT变体在医学学生考试中不同类型问题的性能的影响:横截面研究
Ming-Yu Hsieh1,2, Tzu-Ling Wang3, Pen-Hua Su2,4
1Division of Pediatric Surgery, Department of Surgery, Chung Shan Medical University Hospital, Taichung City, Taiwan.
JMIR medical education
|October 1, 2025
概括
快速工程增强了旧的ChatGPT模型,但像GPT-4o这样的高级版本在没有它的情况下表现出色,超过了医学学生. 教育中的未来人工智能应该专注于模型选择而不是快速设计.
科学领域:
- 医疗教育中的人工智能
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 显示了医学教育评估的潜力.
- 快速工程对各种ChatGPT模型及其相对于医学学生的性能的影响还不清楚.
研究的目的:
- 系统地评估快速工程对五种ChatGPT变体 (GPT-3.5,GPT-4.0,GPT-4o,GPT-4o1-mini,GPT-4o1) 的影响.
- 通过标准化考试,将这些模型与医学四年级学生进行比较.
主要方法:
- 使用了100项考试数据集 (MCQ,简短答案,案例分析,基于图像的问题).
- 在5个运行中,测试了带有和没有迅速工程的模型.
- 性能与143名医学四年级学生进行了比较,使用标准化评分和统计分析 (配对t测试,科恩d).
主要成果:
- 快速工程显著改善了GPT-3.5和GPT-4.0的性能.
- 优化的聊天GPT变体 (GPT-4o,GPT-4o1-mini,GPT-4o1) 显示了来自快速工程的最小收益.
- 高级法学士课程的变体在中学期和期末考试中与第四年医学学生的成绩相匹配或超过.
结论:
- 快速工程对于早期的LLM代来说是有益的,但对高级模型的影响较小.
- 成熟的LLM表现出卓越的表现,超过了医学学生的基准.
- 未来将人工智能整合到医学教育中,应该优先考虑模型选择和关键使用,而不是快速优化.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.3K
13:44Project-Based Learning Guidelines for Health Sciences Students: An Analysis with Data Mining and Qualitative Techniques
Published on: December 9, 2022
4.2K
