聊天GPT可以生成与外科医生写的类似的外科多选题吗?
Yavuz Selim Kıyak1, Ali Kağan Coşkun2, Şahin Kaymak2
1Department of Medical Education and Informatics, Gazi University Faculty of Medicine, Ankara, Turkey.
概括
与外科医生撰写的问题相比,ChatGPT生成的外科多选题显示出不同的表现. 虽然一个主题显示了相关性,但大多数人工智能生成的问题在医学考试中缺乏足够的项目歧视,这凸显了对人类专家审查的需求.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 进行外科手术培训.
背景情况:
- 评估人工智能产生的医学教育内容的有效性.
- 评估外科培训多选题 (MCQ) 的质量.
研究的目的:
- 为了比较由ChatGPT生成的外科MCQ质量与由人类外科医生创建的质量.
- 分析人工智能生成的MCQ的统计属性和项目歧视.
主要方法:
- 医学四年级学生 (n=112) 根据五个整体外科学习目标评估了MCQ.
- 聊天GPT和外科医生独立生成了每个目标的五个MCQ.
- 分析了两个问题集的统计属性,包括项目歧视.
主要成果:
- 在聊天GPT和大肠直肠手术的人类问题之间发现了显著的正相关性.
- 只有一个ChatGPT生成的MCQ (结肠直肠) 显示了可接受的项目歧视.
- 人类编写的MCQ始终达到可接受的歧视水平.
结论:
- 聊天GPT可以在特定领域产生可比的外科MCQ,但由于性能变化,需要人类监督.
- 将人工智能工具与人类专业知识相结合,对于提高医学教育材料的质量和效率至关重要.
- 需要进一步的研究来完善人工智能算法,以便在手术中生成高质量的评估工具.


