评估聊天GPT在泌尿病学中的性能:对知识解释和患者指导进行比较研究
Bahadır Şahin1, Yunus Emre Genç1, Kader Doğan1
1Department of Urology, Marmara University, School of Medicine, Marmara University, Istanbul, Turkey.
Journal of endourology
|May 30, 2024
概括
这项研究评估了泌尿病学中的聊天生成预训练变压器 (ChatGPT). 与ChatGPT-3.5相比,ChatGPT-4的准确性有所提高,但都不应用于诊断或治疗决策.
科学领域:
- 人工智能的人工智能
- 泌尿器科 泌尿器科 泌尿器科 泌尿器科
- 医疗信息学 医疗信息学
背景情况:
- 像ChatGPT这样的大型语言模型 (LLM) 越来越容易获得.
- 评估LLM在泌尿病学等专业医疗领域的表现至关重要.
- 了解LLM的能力和局限性对于安全融入医疗保健至关重要.
研究的目的:
- 评估ChatGPT (3.5和4版本) 在泌尿病领域的性能.
- 为了比较ChatGPT的反应与泌尿科住院医生的反应.
- 评估ChatGPT在提供医疗建议和指令方面的可靠性.
主要方法:
- 专家策划的泌尿器科问题 (n=35) 用于比较ChatGPT版本与泌尿器科住院患者.
- 评估了ChatGPT在泌尿学辩论主题上的可靠性.
- 通过专家评价来评估ChatGPT提供患者建议的能力.
主要成果:
- 聊天GPT-4正确回答了71.4%的问题,而聊天GPT-3.5.5.的回答率为54%.
- 聊天GPT-4的表现接近了高级泌尿病学住院医生的表现.
- 两种版本在辩论主题上都显示出不同的结果,但在患者指导方面取得了相似的成功.
结论:
- 与ChatGPT-3.5.5相比,ChatGPT-4在泌尿病学中显示出更好的精度.
- 在非临床问题上,LLM可以提供快速,安全的答案,但不适用于诊断或治疗选择.
- 需要进一步的研究来定义AI在临床泌尿病学中的作用.


