评估大型语言模型对 funduscopic 疾病知识的熟练程度
Jun-Yi Wu1, Yan-Mei Zeng2, Xian-Zhe Qian2
1Department of Ophthalmology, Wuhan Fourth Hospital, Wuhan 430033, Hubei Province, China.
International journal of ophthalmology
|July 21, 2025
概括
聊天GPT-4在眼镜疾病诊断方面表现强,与眼科医生相当. 这突显了验证的大型语言模型 (LLM) 的潜力,可以显著帮助医疗保健专业人员并改善患者护理.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 眼底镜疾病需要专家对视网膜图像进行解释.
- 大型语言模型 (LLM) 越来越多地被用于医学应用.
- 对人类专家进行LLM绩效评估对于临床采用至关重要.
研究的目的:
- 为了比较五个LLM的诊断准确性与人类专家在囊镜疾病.
- 为了评估ChatGPT-3.5,ChatGPT-4,PaLM2,Claude 2和SenseNova的性能.
- 与眼科医生和 funduscopic 疾病专家对比LLM的能力.
主要方法:
- 对五名LLM和两个人类队伍进行了100项的脑镜疾病测试.
- 基于平均得分,反应稳定性和答案信心来评估表现.
- 在LLM和人群表现之间进行了比较分析.
主要成果:
- 在LLM中,ChatGPT-4和PaLM2的平均相关性是最高的.
- 聊天GPT-4获得了最高的平均分数和信心水平.
- 聊天GPT-4的表现与眼科医生相似,但低于眼镜疾病专家.
结论:
- 聊天GPT-4表现出在 funduscopic 疾病评估中显著的熟练程度.
- 经过验证的LLM在增加医疗保健服务方面表现有前途.
- 未来的LLM进步可以为患者和医生带来巨大的好处.
更多相关视频
07:12Development of a Gaze-Contingent Display Framework Designed for Perceptual and Oculomotor Research with Simulated Central Vision Loss
Published on: April 11, 2025
565
08:54Author Spotlight: Understanding Age-Related Macular Degeneration Pathophysiology with QAF Workflow
Published on: May 26, 2023
1.7K
