在医学中多模式GPT-4视觉的专家级准确性背后隐藏的缺陷
Qiao Jin1, Fangyuan Chen2, Yiliang Zhou3
1National Library of Medicine, National Institutes of Health, Bethesda, MD, USA.
ArXiv
|February 27, 2024
概括
具有视觉 (GPT-4V) 的生成预训练变压器4与医疗图像挑战的医生准确性相匹配. 然而,GPT-4V往往为正确答案提供了有缺陷的推理,突出了临床使用前需要谨慎.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 临床决策支持 临床决策支持
背景情况:
- 具有视觉的生成预训练变压器4 (GPT-4V) 在医疗任务中表现有前途.
- 以前的评估主要集中在多选题问题的准确性上.
- 人工智能在医学中的临床实用性需要了解其推理过程.
研究的目的:
- 综合分析GPT-4V在新英格兰医学杂志 (NEJM) 图像挑战中的表现.
- 评估GPT-4V的图像理解,医学知识回忆和多式联络推理.
- 评估GPT-4V的理由的质量,特别是在提供正确答案时.
主要方法:
- 利用了NEJM图像挑战,这是一个针对医疗专业人员的诊断测试.
- 评估了GPT-4V在多选题中的准确性.
- 分析了GPT-4V的逐步推理和图像解释的逻辑生成.
- 与人类医生比较GPT-4V的性能和推理.
主要成果:
- 在多选题问题上,GPT-4V的准确性与医生相比相当 (81.6%与77.8%).
- 在医生犯错误的情况下,GPT-4V显示出高准确度 (超过78%) .
- 在GPT-4V的正确答案中,很大一部分 (35.5%) 被错误的理由支持,特别是图像理解 (27.2%).
结论:
- 在医学图像挑战准确度方面,GPT-4V表现出强的性能.
- 人工智能模型经常产生错误的推理,尽管得出正确的结论.
- 在多式人工智能模型临床集成之前,对人工智能推理的深入评估至关重要.


