用大型语言模型改变神经外科实践:在复杂病例管理中,ChatGPT-Omni和Gemini的比较性能
Barış Çöllüoğlu1, Şamil Dikici1
1Department of Neurosurgery, Cam and Sakura City Hospital, Basaksehir, Istanbul, Turkey.
World neurosurgery
|May 22, 2025
概括
在评估神经外科病例方面,ChatGPT-Omni的表现优于Gemini. 这种人工智能工具展示了卓越的准确性和相关性,显示了临床决策支持和神经外科教育的前景.
科学领域:
- 人工智能在医学中的应用
- 大型语言模型 (LLM) 的神经外科应用
- 临床决策支持系统 临床决策支持系统
背景情况:
- 人工智能 (AI) 的进步,特别是大型语言模型 (LLM),在神经外科等医疗领域创造了新的机会.
- 该研究解决了评估和比较领先LLM在处理复杂的神经外科临床病例调查方面的表现的需要.
研究的目的:
- 为了比较两个先进的LLM,ChatGPT-Omni和Gemini在解决神经外科手术中的临床案例问题的表现.
- 评估LLM对模拟神经外科情景的反应的准确性,相关性和清晰性.
主要方法:
- 一项前性观察性研究涉及500个基于病例的神经外科问题,涉及10种疾病,模拟现实世界的临床场景.
- 在两个月的时间里,两次 (第一阶段和第二阶段) 提出问题,以评估响应的一致性.
- 两位独立的神经外科医生使用6点的利克特度量表来评估反应.
主要成果:
- 聊天GPT-Omni在所有评估指标和条件上始终优于Gemini.
- 与双子座相比,ChatGPT-Omni的平均得分更高 (第一阶段:5.38 ± 0.12;第二阶段:5.46 ± 0.08) (第一阶段:4.93 ± 0.15;第二阶段:5.1 ± 0.14).
- 在所有神经外科条件下,ChatGPT-Omni在统计学上表现出显著的优越语境准确性 (P < 0.001).
结论:
- 与双子座相比,ChatGPT-Omni在神经外科病例调查的准确性,相关性和清晰度方面表现优越.
- 两种LLM都随着时间的推移表现出改善,但ChatGPT-Omni始终表现出色,表明其潜在的实用性.
- 在神经外科决策支持和医学教育方面,LLM,特别是ChatGPT-Omni,具有变革性的潜力.
更多相关视频
13:12Translational Brain Mapping at the University of Rochester Medical Center: Preserving the Mind Through Personalized Brain Mapping
Published on: August 12, 2019
45.8K
14:58Comprehensive Endovascular and Open Surgical Management of Cerebral Arteriovenous Malformations
Published on: October 20, 2017
9.9K
