大型语言模型在白内障护理信息提供中的评估:量化比较
Zichang Su1, Kai Jin2, Hongkang Wu1
1Eye Center, The Second Affiliated Hospital, School of Medicine, Zhejiang University, Hangzhou, 310009, China.
Ophthalmology and therapy
|November 8, 2024
概括
大型语言模型 (LLM) 显示出对白内障信息的希望. 聊天GPT-4o在回答白内障相关问题方面表现出高度准确和完整性,突出了在线医疗咨询的潜力.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 在全球范围内,白内障是导致失明的主要原因.
- 患者越来越多地在网上寻找健康信息,但难以确定可靠的来源.
- 大型语言模型 (LLM) 提供了准确,类似人类的医疗信息传递的潜力.
研究的目的:
- 评估LLMs在回答白内障护理问题的准确性和全面性.
- 为了比较在特定的医疗领域的各种LLM的表现.
主要方法:
- 在六个领域策划了46个常见的白内障护理问题.
- 来自多个LLM的答案被眼科医生独立评估,以确定其准确性和完整性.
- 达成共识的方法决定了最终的评级",糟糕"的答案经过自我纠正和重新评估.
主要成果:
- 聊天GPT-4o和谷歌巴德获得了很高的准确度得分 (8.7/9).
- 聊天GPT-4o在完整性 (13.22/15) 中领先,并获得了最高的"好"评分.
- 所有评估的LLM在自我纠正提示后都得到了改善,特别是在"预防"领域.
结论:
- LLM,特别是ChatGPT-4o,可以为白内障相关的查询提供准确和全面的答案.
- 这些发现表明,LLM具有支持在线医疗咨询的潜力.
- 持续评估和提高LLM对于可靠的医疗信息传播至关重要.


