大型语言模型准确地从腹部成像报告中提取大动脉信息,在一个大,现实世界的数据库中
Colleen P Flanagan1, Lawrence D Gerstley2, Steven Okuhn3
1Division of Vascular & Endovascular Surgery, University of California San Francisco, San Francisco, CA; Division of Clinical Informatics & Digital Transformation, University of California San Francisco, San Francisco, CA.
Journal of vascular surgery
|November 7, 2025
概括
大型语言模型 (LLM) 准确地从成像报告中提取腹腔大动脉动脉瘤 (AAA) 数据,而不需要特定任务的培训. 这种人工智能方法提供了一种具有成本效益的解决方案,以减少监控计划中的行政负担.
科学领域:
- 放射学和人工智能的人工智能
- 医疗信息学 医疗信息学
- 心血管成像分析心血管成像分析
背景情况:
- 腹腔大动脉瘤 (AAA) 监测需要广泛的手动数据审查,这使得它昂贵和劳动密集.
- 现有的自然语言处理 (NLP) 工具需要为每个应用程序提供特定任务的人类培训.
- 一般化人工智能提供了一个潜在的解决方案,可以在没有事先培训的情况下自动提取数据.
研究的目的:
- 评估大型语言模型 (LLM) 在从腹部成像报告中提取AAA相关数据的有效性.
- 要确定LLM是否可以在没有基于任务的人类培训的情况下进行数据提取,这与传统的NLP方法不同.
- 评估LLM对AAA监控数据挖掘的可靠性和效率.
主要方法:
- 在本地服务器上利用Llama 3.3 70B LLM分析来自AAA监控注册表 (2008-2024) 的16331份腹部成像报告 (超声波,CT,MRI).
- 通过LLM提取最大腹部大动脉直径或根据描述性术语确定AAA的存在/状态.
- 比较LLM提取的数据与独立的专家审查员使用准确度,灵敏度,积极的预测值和F1得分指标.
主要成果:
- 该LLM的整体精度为0.93,灵敏度为0.96,精度为0.96,F1得分为0.96.
- 在51.9%的报告中存在离散最大腹腔大动脉直径.
- 对于3至7厘米之间的AAA直径,LLM的F1得分在0.97至0.99之间,这表明其可靠性很高.
结论:
- 从腹部成像报告中提取大动脉信息的LLM提取非常可靠,不需要额外的人为导向的培训.
- 在AAA监控中,LLM提供了一种灵活,高效和具有成本效益的数据挖掘方法.
- 这种人工智能方法可以显著减少行政负担,提高心血管成像临床研究的质量和效率.


