人工智能模型GPT-3的诊断和选准确性:一个观察性研究
David M Levine1, Rudraksh Tuwani2, Benjamin Kompa3
1Division of General Internal Medicine and Primary Care, Brigham and Women's Hospital, Boston, MA, USA; Harvard Medical School, Boston, MA, USA.
The Lancet. Digital health
|July 26, 2024
概括
生成预训练型变压器3 (GPT-3) 显示出强大的诊断能力,表现优于普通人,但略落后于医生. 然而,它的分拣准确度与非专业人士相比,突出了人工智能医疗保健应用中需要改进的领域.
科学领域:
- 人工智能在医学中的应用
- 自然语言处理自然语言处理.
- 临床决策支持 临床决策支持
背景情况:
- 医疗保健中的当前人工智能通常依赖于单一任务,标记数据,限制了概括性.
- 与临床医生相比,通用AI语言模型的诊断和选性能尚不清楚.
研究的目的:
- 为了比较生成预训练变压器3 (GPT-3) 的诊断和选准确性,与医生和平民进行比较.
- 评估GPT-3对其预测的信心的校准.
主要方法:
- 评估了GPT-3的性能,对48个合成案例视频进行了评估,涉及各种敏度级别.
- 与5000名普通人 (使用互联网搜索) 和21名医生进行了比较.
- 诊断准确度是通过在前三个预测中包含基准真相诊断来衡量的;分类准确度是根据预定义的类别进行评估的.
主要成果:
- GPT-3实现了88%的诊断准确度 (前三名),超过非专业人士 (54%),但低于医生 (96%).
- 对GPT-3的分离精度为70%,类似于非专业人士 (74%),但低于医生 (91%).
- GPT-3的信心是相当好的校准,尽管准确性随着病例敏度的增加而下降.
结论:
- 一般用途的人工智能语言模型在诊断方面表现有前途,超过非专业人士的能力.
- GPT-3的分类性能需要进一步改进,以匹配医生级准确度.
- 人工智能模型需要对临床部署进行仔细评估,特别是在基于敏度的性能和潜在的分类错误方面.


