眼科临床病例的综合视觉和基于文本的分析,使用大型语言模型
Vera Sorin1,2,3, Noa Kapelushnik4,5, Idan Hecht4,6
1Department of Diagnostic Imaging, Chaim Sheba Medical Center, Emek Haela St. 1, 52621, Ramat Gan, Israel. verasrn@gmail.com.
Scientific reports
|February 10, 2025
概括
生成型人工智能,特别是多式联通GPT-4V,可以分析眼睛图像和临床文本进行诊断. 添加临床背景显著提高了AI和医生的诊断准确度.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 眼科诊断依赖于将眼科检查结果与临床背景相结合.
- 生成型人工智能 (AI) 模型越来越能够分析结合的文本和视觉数据.
- 多模式人工智能有可能增强医疗保健应用,包括医学诊断.
研究的目的:
- 通过使用集成的眼睛图像和临床文本来评估多模式GPT-4V的诊断性能.
- 将AI的诊断精度与非眼科医生医生的诊断精度进行比较.
- 评估临床背景对人工智能和人类评估者的诊断准确性的影响.
主要方法:
- 一项回顾性研究,涉及40名眼科患者病例与眼部图像.
- GPT-4V仅提供图像,然后附带临床文本.
- 非眼科医生也提供了诊断,并没有临床背景.
- 来自GPT-4V和医生的诊断被董事会认证的眼科医生评估.
主要成果:
- 仅使用图像,GPT-4V的准确度达到47.5%,加上临床背景,准确度达到67.5%.
- 非眼科的医生在没有上下文的情况下达到60.0%的准确率,在有上下文的情况下达到72.5%.
- 添加临床背景显著改善了所有参与者的诊断准确性 (p=0.033).
结论:
- 多式联机GPT-4V表现出能够同时分析视觉和文本数据以进行准确的临床诊断的能力.
- 临床背景的整合提高了人工智能和人类医生的诊断性能.
- 多模式大型语言模型显示出对推动眼科患者护理和研究的重大前景.


