研究大型语言模型在关于折射手术问题的作用
1Adana 5 Ocak State Hospital, Department of Ophthalmology, Adana, Turkey.
International journal of medical informatics
|January 9, 2025
概括
与谷歌Gemini和微软Copilot相比,ChatGPT-4.0在回答折射手术问题方面表现出卓越的准确性和可靠性,尽管可读性得分较低.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越多地用于临床信息传播.
- 在面向患者的医疗查询中评估LLM绩效至关重要.
研究的目的:
- 为了评估ChatGPT-4.0,Google Gemini和微软Copilot对于折射手术患者询问的有效性.
- 在这种情况下,比较LLM的准确性,可靠性和可读性.
主要方法:
- 两位眼科医生使用5分利克特尺度对25个折射手术问题的LLM反应进行了评估.
- 在DISCERN尺度上评估了响应可靠性.
- 弗莱什阅读易度和弗莱什-金凯德等级水平评估了可读性.
主要成果:
- 在LLM中观察到利克特分数的显著差异 (p=0.022).
- 聊天GPT-4.0的得分高于微软的Copilot (p=0.005),但不高于谷歌的Gemini (p=0.087).
- 聊天GPT-4.0获得了最高的DISCERN可靠性得分,但可读性得分最低.
结论:
- 聊天GPT-4.0提供了关于折射手术的更可靠,更准确的信息.
- 在复杂性方面,LLM的答案各不相同,ChatGPT-4.0更复杂,但在可信度方面更优越.


