使用大型语言模型进行智能头部和部CTA报告质量检测
Liping Tian1,2, Yao Lu1,2, Xiaolu Fei3
1Department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University, Beijing, 100053, China.
Journal of imaging informatics in medicine
|August 27, 2025
概括
像GPT-4这样的大型语言模型可以准确地检测头部和部CT血管造影 (CTA) 报告中的错误,显著提高了放射学质量控制的效率.
科学领域:
- 放射学
- 人工智能
- 医疗信息学
背景情况:
- 放射性报告的质量控制对于患者的安全和有效诊断至关重要.
- 在放射学报告中自动检测错误可以提高效率和准确性.
- 大型语言模型 (LLM) 在分析医学文本方面表现有前途.
研究的目的:
- 评估GPT-4,ERNIE Bot和SparkDesk在头部和部CT血管学 (CTA) 报告中识别常见错误的性能.
- 评估LLM在支持中国放射学报告的质量控制过程中的潜力.
- 将LLM的效率和准确性与报告质量评估的手动审查进行比较.
主要方法:
- 从两个数据集中收集了15,000份头部和部的CTA报告.
- 确定了六种常见的错误类型,并开发了基于LLM的检测方法.
- 评估报告质量使用5分利克特级别和统计测试 (威尔科克森等级和,弗里德曼,ICC,ANOVA).
- 使用准确度,精度,回忆和F1分数来评估模型性能.
主要成果:
- 在数据集2中的六种常见错误类型中,LLM的检测准确度超过95%.
- 与初步报告相比,最终报告中的错误检测率较低.
- GPT-4与手动评分显示中等一致性 (ICC=0. 517),而ERNIE Bot和SparkDesk的一致性略低.
- 他们比人类审核员更快地评估报告.
结论:
- 在头部和部CTA报告中,LLM可以有效地识别错误类型并区分报告质量.
- 这些模型显著提高了质量控制审查的效率.
- 在加强放射性报告质量保证方面,LLM具有实质性研究和实用价值.


