聊天GPT在儿科委员会预备考试中获得通过分数,但引发了红旗
1University of Florida College of Medicine, Gainesville, FL, USA.
Global pediatric health
|March 26, 2024
概括
像ChatGPT这样的人工智能聊天机器人显示了为儿科考试准备的潜力,但存在局限性. 聊天GPT-4取得了通过分数,但却在复杂的儿科医疗场景中扎,这表明需要谨慎.
科学领域:
- 医疗教育 医学教育
- 人工智能在医学中的应用
- 儿科 儿科 儿科
背景情况:
- 人工智能 (AI) 在医学教育和评估中的整合正在迅速发展.
- 在高风险的考试中评估人工智能工具的性能对于理解它们的实用性和局限性至关重要.
- 美国儿科学会 (AAP) 的PREP®自我评估作为儿科委员会准备的基准.
研究的目的:
- 评估OpenAI的ChatGPT-3.5和ChatGPT-4.0在儿科委员会预备考试问题上的表现.
- 将AI性能与既定的通过分数和人类测试者平均值进行比较.
主要方法:
- 测试了OpenAI的ChatGPT (3.5和4.0) 的两个版本,使用了2021年和2022年AAP PREP®自我评估中的问题.
- 总共有488个问题被输入到AI模型中.
- 人工智能生成的分数与PREP®考试的通过门 (70%) 和人类平均分数进行了比较.
主要成果:
- 聊天GPT-3.5在2021年 (58.85%) 和2022年 (55.46%) 考试中得分低于通过.
- 聊天GPT-4.0在两次考试中都超过了通过分数,在2021年达到79.84%,在2022年达到84.21%.
- 虽然ChatGPT-4.0获得了通过分数,但其表现突出了复杂儿科病例评估中的潜在缺陷.
结论:
- 公共可用的AI聊天机器人可以在儿科委员会预备考试中获得通过分数.
- 人工智能处理复杂儿科医疗场景的能力存在重大局限性.
- 在这种情况下,使用人工智能会带来潜在的风险,因为它在评估弱势儿科患者群体方面的局限性.


