新的人工智能聊天GPT在2022年泌尿器科自我评估研究计划中的表现不佳
Linda My Huynh1, Benjamin T Bonebrake2, Kaitlyn Schultis2
1MD/PhD Scholars Program, University of Nebraska Medical Center, Omaha, Nebraska.
像ChatGPT这样的大型语言模型在美国泌尿病学协会考试中显示出有限的准确性. 尽管通过多选题进行了改进,但错误的答案始终被证明是合理的,这可能会导致医学错误信息的风险.
科学领域:
- 医学教育 医学教育
- 人工智能在医学中的应用
- 泌尿器科 泌尿器科 泌尿器科 泌尿器科
背景情况:
- 大型语言模型 (LLM) 在各个领域都显得有前途,但它们在医学教育中的实用性需要彻底评估.
- 美国泌尿病学会 (AUA) 自我评估研究计划是泌尿病专业人士的关键教育资源.
研究的目的:
- 评估ChatGPT作为尿道学学员和执业医生使用AUA自我评估研究计划的教育工具的有效性.
- 评估ChatGPT在回答泌尿病学评估问题的准确性和一致性.
主要方法:
- 使用了来自2022年AUA自我评估研究计划的135个问题 (不包括视觉项目).
- 问题被分类为开放式或多选题.
- 聊天GPT的响应被评估为正确性,对于不确定的答案,再生时间高达两次.
- 准确性,一致性和质量由独立的研究人员和医生评审员评估.
主要成果:
- 聊天GPT的准确性很低:开放式问题为26.7%,多选题为28.2%.
- 不确定的答案是常见的 (29.6%是开放式的,3.0%是多选项的).
- 恢复并没有显著改善正确答案的比例,而ChatGPT始终为错误的答案提供理由.
结论:
- 聊天GPT在AUA自我评估研究计划中的表现没有达到预期,与其在一般医疗执照考试中的表现不同.
- 与开放式问题相比,多选择题的准确性更高.
- 一贯产生不正确的理由突出显示,如果不加以控制,传播医学错误信息的风险很大.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
05:04Author Spotlight: Evaluating Clinicians' Adoption of Ultrasound-Guided Vascular Cannulation Through Simulation Training
Published on: August 9, 2024
相关概念视频
Urologic Endoscopic Procedure: Cystoscopic Examination
Anatomy of the Genitourinary System II: Bladder and Urethra
Urodynamic Studies: Uroflowmetry
Imaging Studies V: Intravenous Urography and Retrograde Pyelography
Imaging Studies I: Kidney, Ureter, and Bladder Studies
