使用大型语言模型进行神经放射学报告的客观质量评估
P López-Úbeda1, T Martín-Noguerol2, A Luna2
1NLP Department HT Médica Carmelo Torres n°2, 23007, Jaén, Spain.
Clinical radiology
|March 14, 2026
概括
大型语言模型 (LLM) 对自动化放射学报告质量评估充满希望,在结构和建议方面表现出色,但在完整性和准确性方面扎. 为了全面的质量控制,还需要进一步的精细化.
科学领域:
- 医疗成像中的人工智能
- 放射学质量保证 质量保证
- 在医疗保健中的自然语言处理.
背景情况:
- 放射学报告对于临床决策至关重要,需要高标准的清晰度,完整性和准确性.
- 目前放射学报告的质量评估方法是主观的,劳动密集的,并依赖于专家审查员.
- 大型语言模型 (LLM) 为自动化放射学报告客观质量评估提供了一个潜在的解决方案.
研究的目的:
- 评估LLM在客观和一致地评估神经放射学报告的正式和诊断质量的能力.
- 为了比较三个不同的LLM在根据预定义的质量标准对报告进行分类的表现.
- 为了确定LLMs在自动化放射学报告质量控制中的优点和局限性.
主要方法:
- 分析了277份神经放射学报告,这些报告都经过了独立的质量审查.
- 根据六个标准对报告进行注释:诊断差异,结构,清晰度,完整性,分级系统的使用和测试建议.
- 对三个本地部署的LLM (LLaMA 3.2,DeepSeek R1:7B,Gemma 3:4B) 的分类准确性进行评估.
主要成果:
- 在识别结构和测试建议等积极报告属性方面,LLM表现出强的表现,而DeepSeek表现出高准确度.
- 在检测报告完整性和诊断差异等负面属性时,性能显著下降,低F1分数表明了这一点.
- 模型识别微妙错误和复杂的临床细微差别的能力仍然有限.
结论:
- LLM显示有潜力帮助自动化放射学报告质量控制,提高一致性.
- 需要进一步开发和完善LLM,以克服目前检测复杂错误的局限性.
- 使用LLM的自动化质量评估可以通过提高报告可靠性来支持临床决策.
相关概念视频
Improving Translational Accuracy
3.7K
3.7K
Improving Translational Accuracy
15.4K
Base complementarity between the three base pairs of mRNA codon and the tRNA anticodon is not a failsafe mechanism. Inaccuracies can range from a single mismatch to no correct base pairing at all. The free energy difference between the correct and nearly correct base pairs can be as small as 3 kcal/ mol. With complementarity being the only proofreading step, the estimated error frequency would be one wrong amino acid in every 100 amino acids incorporated. However, error frequencies observed in...
15.4K
