人工智能能像放射科医生一样撰写报告吗? 对大型语言模型生成的腰椎脊椎MRI报告进行了盲目评估
Moreno Zanardo1, Domenico Albano2,3, Valentina Molinari4
1Radiology Unit, IRCCS Policlinico San Donato, San Donato Milanese, Italy.
European radiology experimental
|February 23, 2026
概括
放射科医生撰写的腰椎MRI报告在质量和结构上优于大型语言模型 (LLM) 产生的报告. 然而,一些人工智能生成的报告与人类无法区分,这表明LLM可能有助于提高报告效率.
科学领域:
- 放射学 放射学是一门学科.
- 人工智能的人工智能
- 医疗信息学 医疗信息学
背景情况:
- 大型语言模型 (LLM) 越来越能够生成医疗报告.
- 与放射科医生书面报告相比,LLM生成的腰椎MRI报告的临床实用性和质量需要评估.
- 评估人工智能生成与人类撰写的报告的区分能力对于理解它们融入临床实践至关重要.
研究的目的:
- 为了比较LLM生成的腰椎MRI报告的质量和临床有用性,与放射科医生的书面报告进行比较.
- 为了确定医疗专业人员是否能够区分人工智能生成和人类编写的腰椎MRI报告.
- 评估LLM在提高放射学报告效率和诊断可靠性方面的潜在作用.
主要方法:
- 一项回顾性研究涉及125个匿名的腰椎MRI报告 (104个是人写的,21个是LLM生成的).
- 五名医疗专业人员盲目评估报告,使用五点的利克特级别来评估临床相关性,清晰度,完整性,诊断准确性和可理解性.
- 评估人员还将报告分类为人工智能生成的或人类撰写的,通过正确的分类率来衡量准确度.
主要成果:
- 放射科医生撰写的报告在所有评估领域的中位数得分明显高 (p < 0.001).
- 在成像技术的描述中没有发现显著差异 (p > 0.175).
- 人工智能产生的报告的识别准确性在评估者之间有所不同,董事会认证的放射科医生达到88.0%的准确性.
结论:
- 放射科医生撰写的腰椎MRI报告显示,与当前LLM生成的报告相比,其质量和结构优越.
- 一些LLM生成的报告与人类撰写的无法区分,特别是对于非专业读者.
- LLM显示出在结构化报告中支持放射科医生的潜力,提高工作流程效率,并在监督下保持诊断可靠性.


