在良性前列腺增生症中,用于临床决策支持的生成大语言模型的现实世界的可行性
Yuqi Li1, Chunyang Meng1, Lei Peng2
1Department of Urology, Affiliated Hospital of Southwest Medical University, Luzhou, Sichuan, China.
International journal of surgery (London, England)
|November 13, 2025
概括
像ChatGPT和DeepSeek这样的大型语言模型在良性前列腺增生症 (BPH) 中展示了专家级的知识,超过了医生. 深度搜索在BPH的临床决策支持方面表现出色,展示了AI.
科学领域:
- 人工智能在医学中的应用
- 泌尿器科 泌尿器科 泌尿器科 泌尿器科
- 临床决策支持系统 临床决策支持系统
背景情况:
- 良性前列腺增生 (BPH) 导致下泌尿道症状 (LUTS),影响生活质量,并构成公共卫生挑战.
- 人工智能 (AI),特别是大型语言模型 (LLM),显示出临床决策支持的前景.
- 评估LLM临床知识和BPH的决策至关重要.
研究的目的:
- 系统地评估主流生成性LLM关于BPH的临床知识.
- 在现实世界BPH临床场景中探索LLMs的决策支持能力.
主要方法:
- 使用30个与BPH相关的临床问题评估了ChatGPT和DeepSeek.
- 医生在封闭式条件下回答了同样的问题,以便进行比较.
- 六个真实的BPH病例模拟了AI评估的诊断和治疗场景.
主要成果:
- 在临床知识评估中,ChatGPT和DeepSeek的表现都超过了医生组.
- LLM的表现与主治医生的表现相比,优于住院医生的表现.
- 与ChatGPT相比,DeepSeek在临床决策支持方面表现出更高的准确性和逻辑连贯性.
结论:
- 聊天GPT和DeepSeek在BPH中的临床知识与主治医生的临床知识相当.
- LLM,特别是DeepSeek,显示出在BPH中支持临床决策的巨大潜力.
- 医疗保健中的人工智能对改善患者护理具有重大承诺,尽管目前的局限性.


