相关实验视频
Updated: May 10, 2025

13:51
Cross-Modal Multivariate Pattern Analysis
Published on: November 9, 2011
19.9K
使用多模式大语言模型 (ChatGPT) 对整个视觉场测试报告的连贯解释
Jeremy C K Tan1,2,3
1Faculty of Medicine, University of New South Wales, Kensington, NSW 2033, Australia.
Vision (Basel, Switzerland)
|April 23, 2025
概括
大型语言模型 (LLM) 在解释视觉现场测试可靠性和诊断眼症方面表现出高准确性. 然而,对这些人工智能工具来说,准确地分类缺陷类型仍然是一个挑战.
科学领域:
- 眼科医生 眼科 眼科
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 青光眼的诊断严重依赖于视野 (VF) 测试.
- 解释VF报告需要在识别敏感性和可靠性数据方面的专业知识.
- 大型语言模型 (LLM) 为自动化医疗数据分析提供了潜力.
研究的目的:
- 评估商业LLM (ChatGPT 4o) 在从VF测试报告中提取和解释数据的准确性.
- 评估LLM在识别眼缺陷,可靠性指标和诊断分类方面的一致性.
- 确定LLM在处理多式联络医疗数据方面的能力和局限性.
主要方法:
- 60名受试者 (60只眼睛) 的匿名单页VF测试报告被ChatGPT 4o分析.
- 该LLM评估了四个领域:测试可靠性,缺陷类型,缺陷严重程度和整体诊断.
- 关键的结果措施包括数据提取的准确性,眼缺陷的解释和诊断分类.
主要成果:
- 该LLM在提取全球灵敏度和可靠性指标以及分类测试可靠性方面实现了100%的准确性.
- 对于健康的眼睛,可疑的眼睛或眼的眼睛,诊断分类准确率高达96.7%.
- 定义缺陷类型的准确性中等 (73.3%),错误往往是由于错位造成的,特别是混上半场和下半场.
结论:
- 多模式LLM在处理和解释来自VF报告的结构化数据,特别是数字和基于文本的信息方面显示出巨大的潜力.
- 该LLM的表现突显了其在可靠性评估和诊断分类方面的优势,但也揭示了精确缺陷类型识别的局限性.
- 需要进一步开发,以提高LLM准确解释基于图像或复杂的空间信息的能力,在VF报告中进行全面的青光眼评估.

