提高眼部疾病诊断的可解释性:对多模式大语言模型的零射击研究
Yating Pan1, Janna Hastings2,3,4
1Department of Computational Linguistics, University of Zurich.
Studies in health technology and informatics
|August 8, 2025
概括
多模式大语言模型 (LLM) 可以使用视觉数据和临床信息来解释眼科诊断. 在生成可靠的临床解释方面,GPT-o1表现最好.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 从视觉基础模型来解释眼病诊断的解释性解释仍然是一个挑战.
- 多模式大语言模型 (LLM) 通过整合视觉和临床数据来产生这种解释的潜力.
研究的目的:
- 评估多式联络LLM在为眼科诊断产生可解释的解释方面的有效性.
- 用技术和临床指标比较不同LLM的性能.
主要方法:
- 微调RETFound对BRSET数据集的性能进行了改进,在糖尿病视网膜病变和玻璃眼瘤中实现了高AUC-ROC.
- 结合视觉变压器衍生的突出地图与临床元数据.
- 通过技术和临床评估评估了五种不同的LLM.
主要成果:
- 在产生临床解释方面,GPT-o1表现出卓越的性能,精度为79.32%,回忆率为77.18%,F1得分为78.25%.
- 对于GPT-o1,幻觉发生率为20.68%.
- 基础的诊断准确性和先进的模型架构对于可靠的解释至关重要.
结论:
- 多模式的LLM,特别是GPT-o1,在解释眼科诊断方面表现有前途.
- 确保高诊断准确度和使用先进的模型架构是开发可靠的人工智能驱动的临床解释的关键.
- 未来的发展应该考虑综合验证机制,以尽量减少幻觉.


