评估ChatGPT和Bard/Gemini与前列腺成像报告和基于前列腺多参数MRI文本报告的数据系统分类的放射科医生的性能
Kang-Lung Lee1,2,3,4, Dimitri A Kessler1,2, Iztok Caglic2
1Department of Radiology, University of Cambridge, Cambridge CB2 0QQ, United Kingdom.
The British journal of radiology
|November 13, 2024
概括
大型语言模型显示出临床使用的潜力,但目前的版本在MRI报告中的前列腺成像报告和数据系统 (PI-RADS) 准确分类方面存在困难. 与人类放射科医生相比,像GPT-4和Gemini这样的新型号显示出更好的,但仍然有限的性能.
科学领域:
- 放射学中的人工智能
- 医疗报告的自然语言处理.
- 前列腺癌的诊断方法 前列腺癌的诊断方法
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于临床应用.
- 准确的前列腺成像报告和数据系统 (PI-RADS) 分类对于前列腺癌诊断至关重要.
- 在解释复杂的医疗报告时评估LLM的表现是必不可少的.
研究的目的:
- 评估各种大型语言模型 (LLM) 赋予PI-RADS类别的能力.
- 用多参数前列腺MRI的临床文本报告来比较LLM的表现与人类泌尿放射学家.
主要方法:
- 分析了100名连续的未经活检患者的前列腺多参数MRI报告.
- 报告被两个泌尿放射学家和四名LLM独立分类:ChatGPT-3.5,ChatGPT-4o mini,Bard和Gemini.
- 原来的放射科医生分类被认为是最终的标准.
主要成果:
- 人类放射科医生实现了高精度 (95%和90%).
- 最初的LLM (GPT-3.5,Bard) 的准确性较低 (67%),而Bard表现出一种"幻觉" (PI-RADS 6).
- 更新后的LLM (GPT-4,Gemini) 显示了更高的准确度 (83%和79%),性能根据PI-RADS的怀疑级别而有所不同.
结论:
- 从文本报告中准确分类PI-RADS类别的LLMs显示出局限性,尽管新版本的性能得到了改进.
- 人类放射科医生在PI-RADS分类准确性方面明显优于目前的LLM.
- 在将LLM整合到PI-RADS评估的临床实践中之前,建议谨慎.


