评估ChatGPT在轨道MRI报告中的性能,并对基于变压器的语言模型进行多度评估
Alessandro Tel1, Federico Bolognesi2, Luca Michelutti3
1Maxillofacial Surgery Clinic, Department of Head & Neck and Neuroscience, Academic Hospital of Udine, University of Udine, Udine, Italy. alessandro.tel@uniud.it.
Scientific reports
|October 14, 2025
概括
大型语言模型 (LLM) 显示出从轨道MRI图像生成放射学报告的前景. 然而,像ChatGPT-4这样的当前模型在复杂的病例中扎,缺乏3D解释能力,限制了其诊断可靠性.
科学领域:
- 人工智能在医学中的应用
- 医学成像分析 医学成像分析
- 在医疗保健中的自然语言处理.
背景情况:
- 大型语言模型 (LLM) 在临床实践中越来越多地被采用,包括放射学报告.
- 从MRI数据中解释复杂的解剖区域 (如轨道) 的LLM的有效性尚未得到充分证实.
- 轨道MRI解释需要对复杂的解剖学和病理学的细微了解.
研究的目的:
- 评估ChatGPT-4在从轨道MRI图像中生成临床可靠的放射学报告的能力.
- 用自然语言处理 (NLP) 度量和临床内容识别分数量化评估ChatGPT-4的性能.
- 为了比较LLM生成的报告与放射科医生撰写的基础真相报告.
主要方法:
- 一个多度量化,定量评估框架被应用到由ChatGPT-4生成的25名患有轨道病变的患者的报告.
- 聊天GPT-4处理了关键的2D轨道MRI图像,而不是体积数据.
- 使用NLP指标 (BERTScore,BLEU-4,ROUGE-L),临床实体识别 (RadGraph F1,CheXbert) 和专家临床医生的判断来评估性能.
主要成果:
- BERTScore显示了最高的语言相似性,而RadGraph F1显示了最好的临床实体识别.
- 临床评估表明,在LLM生成的报告和实地真相报告之间存在中度一致.
- 在复杂或透性轨道病变的情况下,LLM的表现下降.
结论:
- 像ChatGPT-4这样的当前LLM显示了协助结构化放射学报告的潜力,但在解释复杂的轨道MRI数据方面存在局限性.
- 无法处理体积数据并保持空间一致性,这阻碍了诊断的可靠性.
- 未来的整合需要先进的视觉模型来实现全面的3D解释,以增强诊断成像中的LLM实用性.
更多相关视频
10:15Utilizing Repetitive Transcranial Magnetic Stimulation to Improve Language Function in Stroke Patients with Chronic Non-fluent Aphasia
Published on: July 2, 2013
18.3K
09:16Study Design for Navigated Repetitive Transcranial Magnetic Stimulation for Speech Cortical Mapping
Published on: March 24, 2023
1.9K
相关概念视频
Improving Translational Accuracy
14.1K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
14.1K
Improving Translational Accuracy
3.5K
3.5K
