在现实世界的视网膜诊所设置中应用多模式生成人工智能
Seyyedehfatemeh Ghalibafan1, David J Taylor Gonzalez1, Louis Z Cai1
1Department of Ophthalmology, Bascom Palmer Eye Institute, University of Miami Miller School of Medicine, Miami, Florida; and.
Retina (Philadelphia, Pa.)
|September 17, 2024
概括
具有视觉能力的生成预训练型变压器4在通过开放式问题诊断玻璃甲状腺疾病时显示出有限的准确性,但在标准化问题中具有临床使用的潜力.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医学诊断 医学诊断 医学诊断
背景情况:
- 玻璃甲状腺疾病带来了重大的诊断挑战.
- 具有视觉能力的大型语言模型 (LLM) 是医疗保健中的新兴工具.
- 在现实世界的临床环境中评估LLM绩效至关重要.
研究的目的:
- 评估具有视觉 (GPT-4V) 的生成预训练变压器4的诊断准确性,用于玻璃甲状腺疾病.
- 为了评估GPT-4V在国际疾病分类第10版 (ICD-10) 编码中的表现.
- 为了比较GPT-4V在简单而复杂的眼科病例上的性能.
主要方法:
- 在巴斯科姆帕尔默眼科诊所 (巴斯科姆帕尔默眼科诊所,2010年1月 - 2023年3月) 进行了回顾性横截面研究.
- 来自143名患者的256只眼睛的分析,使用GPT-4V进行视网膜图像分析和ICD-10编码.
- 诊断准确度通过开放式和多选择题进行评估,由视网膜专家进行验证.
主要成果:
- 对于开放式问题,GPT-4V的准确率为13.7%,对于多选题的问题,准确率为31.3%.
- ICD-10编码准确度为开放式问题的5.5%,多选题的问题为31.3%.
- 准确的诊断包括后部玻璃体脱落,非脱性AMD和视网膜脱落;简单和复杂的病例之间没有显著差异.
结论:
- GPT-4V在临床护理和记录管理方面显示出潜力,特别是在标准化问题方面.
- 在开放式场景中的有效性有限,限制了其用于复杂的医疗建议的使用.
- 需要进一步开发,以提高GPT-4V在复杂的诊断和编码任务中的能力.


