大型语言模型的比较性能分析:ChatGPT-3.5,ChatGPT-4和谷歌双子在葡萄糖皮质激素诱导的骨质疏松症中
Linjian Tong1, Chaoyang Zhang2, Rui Liu1
1Clinical College of Neurology, Neurosurgery and Neurorehabilitation, Tianjin Medical University, Tianjin, 300070, China.
Journal of orthopaedic surgery and research
|September 17, 2024
概括
大型语言模型 (LLM) 在医学上表现有前途. 聊天GPT-4在回答有关葡萄糖皮质激素诱导骨质疏松症 (GIOP) 和指导方针的问题方面表现出色,而谷歌双子提供了更简洁的答案.
科学领域:
- 人工智能在医学中的应用
- 医疗保健的自然语言处理.
- 医疗信息综合 医学信息综合
背景情况:
- 大型语言模型 (LLM) 可以增强医疗信息管理,患者护理,研究和临床决策.
- 评估LLM的表现对于其有效地融入临床实践至关重要.
研究的目的:
- 为了比较ChatGPT-3.5,ChatGPT-4和Google Gemini在回答有关葡萄糖皮质醇诱导骨质疏松症 (GIOP) 的问题上的表现.
- 根据专家医生评级,评估LLM答案的准确性和简洁性.
主要方法:
- 产生了34个一般GIOP问题和25个基于2022年美国风湿病学会 (ACR) GIOP指南的问题.
- 提交问题给ChatGPT-3.5,ChatGPT-4和谷歌双子座.
- 三位整形外科医生使用1-4点的等级对LLM反应进行了评分;分数>9是"好",6-9"中等",<6"差".
主要成果:
- 谷歌Gemini为一般GIOP和2022年ACR-GIOP指南问题提供了更简洁的答案.
- 在病原问题上,ChatGPT-4获得的总分数 (TS) 比ChatGPT-3.5高得多.
- 聊天GPT-4的2022年ACR-GIOP指南问题的TS超越了谷歌双子座的;聊天GPT-3.5和聊天GPT-4展示了卓越的自我纠正能力.
结论:
- 谷歌Gemini提供简洁,直观的答案,而ChatGPT-4在回答GIOP和指南特定问题方面表现出卓越的表现.
- 与谷歌双子相比,ChatGPT-3.5和ChatGPT-4表现出更好的自我纠正能力.


