在医学领域,多模式GPT-4视觉的专家级准确性背后隐藏着隐藏的缺陷
Qiao Jin1, Fangyuan Chen2, Yiliang Zhou3
1National Library of Medicine, National Institutes of Health, Bethesda, MD, USA.
NPJ digital medicine
|July 23, 2024
概括
具有视觉 (GPT-4V) 的生成预训练变压器4与医疗图像挑战的医生准确性相匹配. 然而,GPT-4V经常提供有缺陷的推理,即使是正确的答案,强调需要谨慎在临床使用.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 临床决策支持系统 临床决策支持系统
背景情况:
- 具有视觉的生成预训练变压器4 (GPT-4V) 在医疗任务中表现有前途.
- 之前的评估只关注多选题的准确性.
- 人工智能在医学中的临床实用性需要更深入的评估,而不仅仅是简单的准确性.
研究的目的:
- 综合分析GPT-4V在新英格兰医学杂志 (NEJM) 图像挑战中的表现.
- 评估GPT-4V的图像理解,医学知识回忆和多式联络推理.
- 将GPT-4V的诊断准确性和逻辑质量与人类医生进行比较.
主要方法:
- 利用了NEJM图像挑战数据集,这是对医学诊断技能的公认测试.
- 评估了GPT-4V在多选题中的准确性及其在医生错误问题上的表现.
- 分析了GPT-4V生成的理由的质量和准确性,特别是对正确答案.
- 专注于特定领域,包括图像理解和逐步推理.
主要成果:
- 在多选题问题上,GPT-4V的准确性与人类医生 (81.6%与77.8%) 相当.
- 在人类医生犯错误的情况下,GPT-4V的准确性高 (超过78%) .
- 在GPT-4V的正确答案中,很大一部分伴随着有缺陷的理由 (35.5%),特别是在图像理解 (27.2%).
结论:
- 在医学图像挑战准确度方面,GPT-4V表现出强的性能,与人类医生竞争.
- 错误的推理的普遍性,即使是正确的最终答案,也表明GPT-4V当前推理能力的局限性.
- 在临床整合之前,进一步深入评估多式人工智能推理至关重要,以确保患者安全和诊断可靠性.


