评估ChatGPT-4的诊断准确性:视觉数据集成的影响
Takanobu Hirosawa1, Yukinori Harada1, Kazuki Tokumasu2
1Department of Diagnostic and Generalist Medicine, Dokkyo Medical University, Shimotsuga, Japan.
JMIR medical informatics
|April 9, 2024
概括
将图像数据添加到ChatGPT-4并没有提高诊断准确度. 纯文本版本在识别顶级诊断方面表现更好,表明了临床使用多式联络人工智能的当前局限性.
科学领域:
- 医疗人工智能 医疗人工智能
- 临床诊断 临床诊断 临床诊断
- 多模式人工智能系统 多模式人工智能系统
背景情况:
- 多模式生成人工智能,如ChatGPT-4与视觉 (ChatGPT-4V),集成文本和视觉数据进行高级分析.
- 图像数据集成对医疗保健中AI诊断准确性的潜在影响仍然在很大程度上未被探索.
研究的目的:
- 评估将图像数据纳入ChatGPT-4的诊断准确度的影响.
- 为了比较ChatGPT-4V (文本+图像) 与ChatGPT-4 (仅文本) 的诊断性能.
主要方法:
- 从美国病例报告杂志 (2022年1月至2023年3月) 分析了363份病例报告.
- 通过将人工智能生成的差异诊断与病例报告中的最终诊断进行比较来评估诊断准确性.
- 两位医生独立审查了准确性,第三位医生解决了差异.
主要成果:
- 聊天GPT-4V并没有显著改善最终诊断在前10个差异清单中的包含 (85.1%与87.9%).
- 只有文本的ChatGPT-4在正确识别顶部诊断方面超过了ChatGPT-4V (55.9%与44.4%相比).
- 人工智能自我报告表明,在超过一半的病例中,图像数据仅为差异诊断贡献了30%的权重.
结论:
- 目前的ChatGPT-4V系统主要依赖于文本信息,低利用视觉数据的诊断潜力.
- 对于多式联络人工智能来说,需要进一步的进展,以有效地整合和利用临床图像数据,以提高诊断性能.
- 改进人工智能系统中的多式联通数据集成可以通过更准确的诊断见解,显著地使患者护理受益.
关键词:
聊天GPT 聊天GPT 聊天聊天GPT-4 视觉视觉聊天GPT-4V 在线聊天在 GPT 中,GPT 必须是 GPT.在法学士 (LLM) 课程中.在法律上,LLMs.在NLP中,我们使用了NLP.人工智能的人工智能是人工智能.临床决策支持 临床决策支持决策支持提供了决策支持.诊断 诊断 诊断 诊断 诊断 诊断诊断 诊断 诊断 诊断诊断 诊断 诊断 诊断 诊断 诊断诊断 诊断 诊断 的 诊断 诊断 诊断 诊断 的 诊断诊断的卓越 诊断的卓越诊断 诊断 诊断 诊断 诊断图片 图片 图片 图片 图片图片 图片 图片 图片 图片影像成像技术 影像成像技术语言模型语言模型语言模型语言模型大型语言模型自然语言处理自然语言处理.

