对近视护理的大型语言模型的性能进行比较:对ChatGPT-3.5,ChatGPT-4.0和Google Bard进行比较分析
Zhi Wei Lim1, Krithi Pushpanathan2, Samantha Min Er Yew2
1Yong Loo Lin School of Medicine, National University of Singapore, Singapore.
EBioMedicine
|August 25, 2023
概括
与其他大型语言模型 (LLM) 相比,ChatGPT-4.0在回答近视问题方面表现出更高的准确性. 需要持续评估,以提高患者信息的LLM准确性.
科学领域:
- 医疗保健中的人工智能
- 眼科 眼科研究 眼科研究
- 医疗信息传播 医疗信息传播
背景情况:
- 大型语言模型 (LLM) 显示出产生类似人类反应的前景.
- 评估LLM的医学准确性至关重要.
- 公众经常在网上寻找近视信息.
研究的目的:
- 评估三个LLM (ChatGPT-3.5,ChatGPT-4.0,Google Bard) 在响应近视相关查询时的准确性.
- 为了比较不同LLM在特定医疗领域的表现.
主要方法:
- 在6个领域策划了31个近视护理问题.
- 答案由三个儿科眼科医生在3分准确度尺度上评估.
- 还评估了全面性和自我纠正能力.
主要成果:
- 聊天GPT-4.0获得了最高的准确性 (80.6%的"好"评分).
- 所有的LLM都表现出高度的全面性和显著的自我纠正能力.
- 在"治疗和预防"领域,ChatGPT-4.0也表现出色.
结论:
- LLM,特别是ChatGPT-4.0,显示出提供准确近视信息的潜力.
- 持续的策略和评估对于提高医学LLM准确性至关重要.


