相关实验视频
Updated: Jul 15, 2026

08:08
Simulator Training for Endovascular Neurosurgery
Published on: May 6, 2020
3.6K
人工智能作为泌尿器官培训能力的歧视者:我们到达了吗?
Naji J Touma1, Ruchit Patel1, Thomas Skinner1
1Department of Urology, Queen's University, Kingston, Ontario, Canada.
The Journal of urology
|December 9, 2024
概括
像ChatGPT这样的生成人工智能 (AI) 工具可以为泌尿科医生创建检查问题,但这些问题可能缺乏歧视力,并且由于潜在的不准确性和措辞问题,需要教师仔细审查.
科学领域:
- 医疗教育 技术 技术 医学教育
- 医疗保健中的人工智能
- 泌尿病学培训评估 评估
背景情况:
- 医学教育依赖于评估,以衡量学员的进步和能力.
- 生成型人工智能 (AI) 越来越多地被用于临床实践和教育.
- 评估人工智能生成的内容对高风险检查的有效性至关重要.
研究的目的:
- 评估大型语言模型ChatGPT (版本4) 在生成歧视性考试问题方面的能力.
- 评估ChatGPT在为毕业的泌尿科医生创建多选择题 (MCQ) 的表现.
- 在泌尿器科委员会认证模拟中确定人工智能生成的MCQ的心理测量属性和面部有效性.
主要方法:
- 聊天GPT (版本4) 创建了20个MCQ用于泌尿学模拟委员会考试,使用特定的泌尿学指南.
- 对ChatGPT生成的MCQ进行了心理测量分析,包括歧视指数和点-二次相关性.
- 教职员工审查了MCQs的面部有效性,准确性和对文献的坚持.
主要成果:
- 在ChatGPT MCQ中,平均得分为60.7%,与总体考试平均得分为61.1%相似.
- 大多数ChatGPT MCQs (25/30) 的歧视指数>0.3,表明有能力区分绩效水平.
- 教师的评估揭示了诸如不完整的干,多个合理的答案,以及在35%的生成的MCQs的事实不准确等问题.
结论:
- 虽然ChatGPT生成的MCQ可能会产生类似的整体分数,但它们往往缺乏强大的歧视力.
- 对问题措辞和潜在的人工智能幻觉的担忧需要严格的质量控制.
- 在使用ChatGPT生成的问题在泌尿器科培训评估中之前,主题专家进行彻底的审查是必不可少的.

