相关实验视频
Updated: May 5, 2026

08:58
Development of a Uterosacral Ligament Suspension Rat Model
Published on: August 17, 2022
3.9K
在泌尿外科医学的大型语言模型的性能比较分析
Ghanshyam S Yadav1, Kshitij Pandit2, Phillip T Connell3
1From the Division of Urogynecology and Reconstructive Pelvic Surgery, UC San Diego, San Diego, CA.
Urogynecology (Philadelphia, Pa.)
|July 2, 2024
概括
像GPT-4这样的大型语言模型看起来很有前途,但尚未通过泌尿后科考试. 临床医生应该在患者护理中谨慎使用这些AI工具,直到有进一步的证据.
科学领域:
- 泌尿和妇科 泌尿和妇科
- 人工智能的人工智能
- 医学教育 医学教育
背景情况:
- 大型语言模型 (LLM) 在医学中越来越受欢迎.
- 缺乏关于尿道内科学LLM成绩的数据.
研究的目的:
- 为了比较ChatGPT-3.5,GPT-4和Bard在美国泌尿科医生协会自我评估考试中的表现.
主要方法:
- 三个LLM (ChatGPT-3.5,GPT-4,Bard) 在185个考试问题上进行了测试.
- 对答案的正确性,逻辑推理和来源进行了评估.
- 统计分析使用了费舍尔精确或奇平方测试.
主要成果:
- GPT-4获得了最高的正确率 (61.6%),其次是GPT-3.5 (54.6%) 和Bard (42.7%).
- 模型性能随着问题难度的下降而下降.
- 巴德提供了最频繁的来源参考 (97.5%),包括期刊文章和指南.
结论:
- 在评估的LLM中,没有一个在泌尿和妇科自我评估考试中获得通过分数.
- 尽管GPT-4的性能优异,但在等待进一步研究之前,建议对临床应用保持谨慎.

