增强糖尿病视网膜病变查询响应:评估眼科医学的大型语言模型
Hongkang Wu1, Zichang Su1, Xiangji Pan1
1Eye Center, Zhejiang University School of Medicine Second Affiliated Hospital, Hangzhou, Zhejiang, China.
The British journal of ophthalmology
|June 30, 2025
概括
大型语言模型 (LLM) 显示了准确回答糖尿病视网膜病变 (DR) 问题的潜力. 为了在眼科中临床使用,需要进一步提高可读性和持续验证.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 糖尿病视网膜病变 (DR) 是导致失明的主要原因.
- 大型语言模型 (LLM) 越来越多地用于健康信息.
- 对DR查询的LLM响应的准确性需要评估.
研究的目的:
- 评估LLM对糖尿病视网膜病变 (DR) 问题的答案的准确性和全面性.
- 在眼科背景下评估LLM的可读性和自我校正能力.
主要方法:
- 一项横截面研究分析了6个LLM对42个DR相关问题的252个答案.
- 咨询眼科医生独立对答案进行了准确性和全面性的分级.
- 统计学分析了可读性和自我校正能力.
主要成果:
- 在单词和字符数量方面,LLM的回复有所不同,在可读性方面存在显著差异 (ChatGPT-3.5是最难读的).
- 响应的准确性通常很高,ChatGPT-4.0获得了97.6%的好评.
- 自行纠正提示从6.4到7.5.5的平均准确度得分显著改善.
结论:
- LLM 显示了关于糖尿病视网膜病变 (DR) 的准确和全面答案的潜力.
- 在眼科临床整合之前,需要提高可读性.
- 持续验证对于确保LLM生成信息的可靠性至关重要.


