评估大型语言模型的文本和视觉诊断能力,以解决与乳腺成像报告和数据系统Atlas第5版相关的问题
Yasin Celal Güneş1, Turay Cesur2, Eren Çamur3
1Kırıkkale Yüksek İhtisas Hospital, Clinic of Radiology, Kırıkkale, Türkiye.
Diagnostic and interventional radiology (Ankara, Turkey)
|September 9, 2024
概括
大型语言模型 (LLM) 在基于文本的乳腺放射学评估中显示出高准确性,但视觉诊断仍然有限. 建议在放射科医生监督下进一步开发和谨慎的临床使用,以防止误诊.
科学领域:
- 放射学中的人工智能
- 医学成像分析 医学成像分析
- 临床决策支持系统 临床决策支持系统
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医学应用.
- 评估LLM在解释BI-RADS等标准化报告系统方面的表现至关重要.
- 多模式LLM为诊断中整合视觉和文本数据提供了潜力.
研究的目的:
- 评估各种LLM和多式LLM在解释乳腺成像报告和数据系统 (BI-RADS) 类别方面的表现.
- 评估这些模型提供乳腺放射学临床管理建议的能力.
- 将LLM的表现与一般放射科医生和乳腺放射科医生进行比较.
主要方法:
- 一项横截面研究比较了10名LLMs,一般放射科医生和一名乳腺放射科医生对100个基于文本的BI-RADS多选题进行了比较.
- 在100张乳房超声波图像上评估了五个多模式的LLM,用于BI-RADS分类和管理建议.
- 使用统计测试,包括麦克内马尔的,奇平方,克鲁斯卡尔-瓦利斯和威尔科克森的测试进行分析.
主要成果:
- 克劳德3.5索内特在基于文本的评估中获得了最高的准确性 (90%),超过了大多数LLM和一般放射科医生.
- 多模式LLM在乳房超声波图像上表现不同,克劳德3.5索内特达到59%的准确性.
- 克劳德 3.5 索内特提供了最高评级的管理建议 (平均值: 2.12 ± 0.97).
结论:
- 像克劳德3.5索内特这样的LLM在基于文本的BI-RADS解释方面显示出显著的前景.
- 目前的多式联络LLM在乳腺成像视觉诊断方面存在局限性.
- 临床乳腺放射学LLM的谨慎实施和放射科医生监督是必要的,以减轻误诊风险.


