评估人工智能在回答有关上毒素和神经神经调节的问题的表现
Ibrahim Hacibey1, Ahmet Halis2
1Department of Urology, Basaksehir Çam and Sakura City Hospital, Istanbul, Türkiye. drihacibey@gmail.com.
Investigative and clinical urology
|May 2, 2025
概括
在回答关于过度活动膀 (OAB) 治疗的临床问题时,ChatGPT的表现优于Gemini和Copilot,比如甲胺毒素和神经神经调节 (SNM). 这表明ChatGPT是OAB管理信息的更可靠的人工智能工具.
科学领域:
- 泌尿器科 泌尿器科 泌尿器科 泌尿器科
- 人工智能在医学中的应用
- 医疗信息系统 医疗信息系统
背景情况:
- 过度活跃的膀 (OAB) 管理涉及复杂的治疗方法,如胺毒素和神经神经调节 (SNM).
- 人工智能 (AI) 工具越来越多地用于医疗信息检索,需要对其临床准确性的评估.
研究的目的:
- 评估ChatGPT,Gemini和Copilot在回答有关OAB管理的临床相关问题的表现.
- 为了比较人工智能对毒素和SNM产生的反应的准确性,完整性,清晰性和实用性.
主要方法:
- 对每个AI模型提出了一套30个关于OAB治疗的标准化问题.
- 泌尿外科专家使用4点的利克特度表来评估事实准确性,相关性,清晰性,结构和实用性的反应.
- 使用统计分析,包括单向ANOVA,来比较人工智能模型的性能.
主要成果:
- 聊天GPT获得了最高的平均得分 (3.98/4),明显优于双子座 (3.20/4) 和Copilot (2.60/4) (p=0.001).
- 在临床应用,程序细节和OAB治疗的安全信息方面,ChatGPT表现出卓越的性能.
- 在大多数评估类别中,Gemini和Copilot之间没有发现显著的性能差异.
结论:
- 聊天GPT在为过度活跃的膀管理提供准确和全面的信息方面表现出卓越的能力.
- 这些发现表明,ChatGPT作为医疗保健专业人员和寻求有关OAB治疗信息的患者的宝贵资源的潜力.
- 对于Gemini和Copilot,需要进一步开发和验证,未来的研究重点是将AI整合到临床实践中.


