相关实验视频
Updated: Sep 18, 2025

08:08
Simulator Training for Endovascular Neurosurgery
Published on: May 6, 2020
3.8K
聊天GPT可以通过泌尿病学奖学金考试吗? 人工智能能力在外科培训评估评估中的能力
Kathleen Lockhart1, Ashan Canagasingham1, Wenjie Zhong1
1Royal North Shore Hospital, St Leonards, New South Wales, Australia.
BJU international
|June 20, 2025
概括
在澳大利亚泌尿病学奖学金考试中,ChatGPT的表现比人类学员差. 考试人员准确地识别了人工智能 (AI) 产生的答案,显示出高的检测率.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 泌尿器科 泌尿器科 泌尿器科 泌尿器科
背景情况:
- 人工智能 (AI) 越来越多地融入医疗教育,需要进行绩效评估.
- 一个著名的AI语言模型ChatGPT在医疗评估中具有潜在的应用.
研究的目的:
- 为了比较ChatGPT与澳大利亚泌尿病学书面奖学金考试的人类学员的表现.
- 评估考官在区分人工智能产生的答案和人类实习生的答案方面的准确性.
主要方法:
- 20篇考试论文 (10名实习生,10名通过ChatGPT-3.5和-4.0生成的AI) 被两个盲目的泌尿科医生独立标记.
- 评估包括整体通过/失败,通过问题的比例,以及调整后的总分.
- 审查人员对作者 (AI或实习生) 进行了盲目的判断.
主要成果:
- 与ChatGPT (6/10) 相比,实习生的通过率更高 (9/10).
- 在通过问题的比例 (89.4% vs 80.9%) 和调整的总分 (79.2% vs 78.1%) 中,实习生得分更高.
- 审查人员在识别人工智能生成的内容方面表现出高准确度 (91.7%) 和灵敏度 (100%).
结论:
- 在奖学金书面考试中,ChatGPT的表现不如人类泌尿病学学员的表现.
- 检查人员在识别人工智能产生的反应方面非常有效.

