人工智能模型在风湿病学委员会级别问题的比较性能:评估谷歌双子座和聊天GPT-4o
Enes Efe Is1, Ahmet Kivanc Menekseoglu2
1Department of Physical Medicine and Rehabilitation, Sisli Hamidiye Etfal Training and Research Hospital, University of Health Sciences, Seyrantepe Campus, Cumhuriyet ve Demokrasi Avenue, Istanbul, Turkey. enefeis@gmail.com.
Clinical rheumatology
|September 28, 2024
概括
聊天GPT-4o在风湿病学委员会级别问题上表现出卓越的表现,达到86.9%的准确率,而谷歌双子座的60.2%. 两种人工智能模型都显示精度降低,问题难度增加,突出显示了人工智能在临床实践中的潜力.
科学领域:
- 人工智能在医学中的应用
- 风湿病学教育和评估
- 临床决策支持系统 临床决策支持系统
背景情况:
- 人工智能 (AI) 模型越来越多地被评估为它们在专业医疗领域的实用性.
- 评估AI在回答复杂的医疗问题方面的表现,对于理解它们的临床适用性至关重要.
- 风湿病学委员会考试需要高度的专业知识,这使得它们成为AI能力的严格测试.
研究的目的:
- 评估和比较ChatGPT-4o和谷歌双子座在回答类风湿病委员会级别问题的表现.
- 评估这些AI模型在专业医疗领域的准确性,可靠性和难度分类能力.
- 确定AI作为帮助临床医生在风湿病学实践中的工具的潜力.
主要方法:
- 一项横截面研究使用了来自 BoardVitals 问题库的 420 个类风湿病委员会级别问题.
- 聊天GPT-4o和Google Gemini都回答了这些问题,并根据难度分类它们 (容易,中等,难).
- 通过重新询问问题来评估答案的可靠性;分析了准确性和分类.
主要成果:
- 聊天GPT-4o实现了86.9%的准确性,明显超过谷歌双子座的60.2% (p < 0.001).
- 可靠性是一致的,ChatGPT-4o的成功率为86.7%,Google Gemini在重新请求时的成功率为60.5%.
- 聊天GPT-4o在特定的风湿病学子领域表现出更高的准确性,包括基本和临床科学,骨关节炎和类风湿性关节炎.
结论:
- 聊天GPT-4o在回答类风湿病委员会级别问题方面明显超过了谷歌Gemini,这表明它具有专业知识的高级能力.
- 随着问题难度的增加,这两种AI模型的性能都下降了,这表明处理高度复杂的查询存在局限性.
- 人工智能模型显示出作为临床医生的辅助工具的潜力,可能提高医疗保健效率,尽管建议在真实临床场景中进一步验证.


