将大型语言模型和人类阅读器精度与"新英格兰医学杂志"的图像挑战案例图像输入进行比较
Pae Sun Suh1, Woo Hyun Shim1, Chong Hyun Suh1
1From the Department of Radiology, Research Institute of Radiological Science and Center for Clinical Imaging Data Science, Yonsei University College of Medicine, Seoul, Republic of Korea (P.S.S.); Department of Radiology and Research Institute of Radiology (W.H.S., C.H.S., K.J.P., P.H.K., S.J.C., Y.A., S.P., H.Y.P., N.E.O.), Department of Medical Science, Asan Medical Institute of Convergence Science and Technology (W.H.S., H.H.), and Department of Internal Medicine (C.Y.W.), Asan Medical Center, University of Ulsan College of Medicine, Olympic-ro 33, Songpa-gu, 05505 Seoul, Republic of Korea; University of Ulsan College of Medicine, Seoul, Republic of Korea (M.W.H.); Department of Orthopaedic Surgery, Seoul Seonam Hospital, Republic of Korea (S.T.C.); and Department of Pulmonary and Critical Care Medicine, Gumdan Top Hospital, Incheon, Republic of Korea (H.P.).
大型语言模型 (LLM) 在解释放射图像方面表现有前途,表现优于医学学生,但没有经验丰富的放射科医生. 随着更长的文本输入,无论使用图像,LLM的准确性都会提高.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 自然语言处理自然语言处理.
背景情况:
- 整合文本和视觉的多式大型语言模型 (LLM) 越来越多地使用,但它们在放射学中的诊断准确性仍在审查中.
- 该研究解决了评估LLM绩效与解释复杂医疗病例的人类专业知识的需要.
研究的目的:
- 评估领先的LLM在解释放射图像方面的准确性,与不同经验水平的人类读者相比.
- 确定影响LLM业绩的因素,特别是图像对文本输入和文本长度的影响.
主要方法:
- 从2005年到2024年,对272个图像挑战案例进行了回顾性审查.
- 评估了四位LLM (GPT-4V,GPT-4o,Gemini 1.5 Pro,Claude 3) 和一个由人类读者组成的小组 (放射科医生,临床医生,医学学生).
- 亚组分析检查了具有/没有图像输入和短与长文本描述的LLM准确性,使用多变量逻辑回归和统计比较的概括估计方程进行统计比较.
主要成果:
- GPT-4o取得了最高的LLM准确率 (59.6%),超过了医学学生 (47.1%),但没有初级教师放射科医生 (80.9%) 或正在培训的放射科医生 (70.2%).
- 图像输入或没有图像输入时,LLM的准确性是一致的 (59.6%与54.0%相比),并且在更长的文本描述中显著改善 (几率比率范围,3.26.6).
- 人类阅读器的准确性不受文本长度的影响,突出了性能特征的关键差异.
结论:
- LLM在解释放射病例方面表现出显著的准确性,提供了一种有价值的工具,可以超越经验较少的人类读者.
- 法学士的成绩主要受提供文本信息的长度的影响,更长的描述会产生更好的结果.
- 虽然有前途,但LLM仍然落后于经验丰富的放射科医生,他们依赖文本长度表明了未来发展和优化多式联络医疗AI的领域.
更多相关视频
04:09Predicting Treatment Response to Image-Guided Therapies Using Machine Learning: An Example for Trans-Arterial Treatment of Hepatocellular Carcinoma
Published on: October 10, 2018
05:56Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
