视觉语言模型用于光学连贯断层扫描上的斑点疾病的特征检测
Fares Antaki1,2,3, Reena Chopra1,2,4, Pearse A Keane1,2,4
1Institute of Ophthalmology, University College London, London, United Kingdom.
JAMA ophthalmology
|May 2, 2024
概括
视觉语言模型 (VLMs) 在检测斑点疾病特征方面表现有限,在OCT扫描上,尽管语言一致性强. 需要对大型数据集进行进一步验证,以评估其眼科潜力.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗成像医学成像
背景情况:
- 视觉语言模型 (VLM) 是一种先进的AI,能够处理图像和文本数据.
- 虽然VLM表现出通用能力,但它们在眼科中的具体表现仍未得到充分探索.
- 在眼科中评估VLM的性能对于潜在的临床应用至关重要.
研究的目的:
- 评估双子Pro视觉语言模型的诊断准确性和管理建议能力,用于使用光学连贯性断层扫描 (OCT) 扫描的斑点疾病.
- 确定VLM在识别关键病理特征,提供转诊紧急情况,并基于OCT成像建议治疗计划方面的有效性.
- 评估VLM建议的内部一致性.
主要方法:
- 通过使用开源光学一致性断层图像数据库进行了横截面诊断准确性研究.
- 该数据集包括50名患有包括黄斑孔,糖尿病黄斑,中央血清性胆色素变异和与年龄相关的黄斑退化等疾病的患者的OCT B扫描.
- 双子Pro被要求提取10种病理特征,转诊建议和治疗方法的结构化数据,结果与专家标签进行比较.
主要成果:
- 在特征检测方面,VLM的平均F1得分为10.7%,在诸如黄斑孔 (36.4%) 等特定条件方面,得分可测量.
- 对这些疾病的诊断准确率为34%,推推的准确率为56%.
- 尽管诊断性能有限,但VLM在转诊和治疗建议之间显示出很高的一致性 (96-98%),表明其语言处理能力强.
结论:
- 一般视觉语言模型 (Gemini Pro) 在识别病理特征和从OCT扫描中管理黄斑疾病方面表现出有限的能力.
- 该模型的高内部一致性表明,尽管视觉解释有局限性,但语言处理能力强大.
- 在广泛的眼科专用数据集上,VLM的持续开发和验证对于确定其未来的临床实用性至关重要.


