揭露临床失能:对GPT-4V (视力) 的基准研究,用于眼科多模式图像分析
Pusheng Xu1, Xiaolan Chen1, Ziwei Zhao1
1School of Optometry, The Hong Kong Polytechnic University, Kowloon, Hong Kong SAR, China.
The British journal of ophthalmology
|May 24, 2024
概括
一个GPT-4V (视觉) 聊天机器人在解释眼部多模式图像时显示出有限的准确性,只有30.6%的答案是准确的. 目前的能力对于临床眼科医学的决策是不够的.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 人工智能 (AI) 在医疗诊断中的整合为提高效率和准确性提供了潜力.
- 大型语言模型,特别是像GPT-4V (视觉) 这样的视觉语言模型,正在被探索它们解释复杂医学图像的能力.
研究的目的:
- 评估基于GPT-4V (视觉) 的聊天机器人的性能和局限性,以解释各种眼部多式模式图像.
- 为未来发展眼科诊断中人工智能工具建立一个基准.
主要方法:
- 开发并测试了一款由GPT-4V (视觉) 驱动的数字眼科医生应用程序.
- 使用了60个眼睛图像的数据集,涵盖6种模式 (裂纹灯,SLO,FPP,OCT,FFA,超声波) 和60种条件.
- 聊天机器人回答了每张图像的10个开放式问题,涵盖识别,病变检测,诊断和决策支持.
- 通过手动和自动评估,对答案的准确性,可用性,安全性和诊断可重复性进行了评估.
主要成果:
- 总体准确率为30.6%,可用性为21.5%,安全性 (无伤害) 为55.6%.
- 性能因模式而异,裂纹灯图像产生更好的结果 (42.0%准确率) 比后极 (FPP) 图像 (13.7%准确率) 的底部摄影更好.
- GPT-4V (视觉) 在识别成像模式方面实现了95.6%的准确性,但在病变识别 (25.6%),诊断 (16.1%) 和决策支持 (24.0%) 中表现较差.
- 诊断重复率为63.3%,句子与人类答案的相似性为55.5%.
结论:
- GPT-4V (视力) 目前不适合眼科临床决策.
- 该研究提供了有价值的见解,并为改善眼科多式联络图像解释中的AI模型提供了基准.


