使用GPT-4o和Llama-3.3-70B从自由文本中风CT报告中提取数据:注释指南的影响
Jonas Wihl1, Enrike Rosenkranz1, Severin Schramm1
1Department of Diagnostic and Interventional Neuroradiology, TUM University Hospital, School of Medicine and Health, Technical University of Munich, Munich, Germany.
European radiology experimental
|June 19, 2025
概括
像GPT-4o和Llama-3.3-70B这样的大型语言模型 (LLM) 可以从中风CT报告中提取数据. 纳入注释准则显著提高了LLM在这个任务中的准确性.
科学领域:
- 医疗成像中的人工智能
- 放射学自然语言处理用于放射学.
背景情况:
- 评估注释指南对大语言模型 (LLM) 对中风CT报告数据提取的影响.
- 评估LLM在从放射学报告中提取特定成像发现方面的表现.
研究的目的:
- 确定注释准则是否提高了LLM在从中风CT报告中提取数据的准确性.
- 为了比较GPT-4o和Llama-3.3-70B在这个任务中的表现.
主要方法:
- 两个LLM (GPT-4o,Llama-3.3-70B) 从两个中风CT报告数据集 (n=200,n=100) 中提取了10个成像发现.
- 数据提取是使用和不使用新设计的注释准则进行的.
- 使用精度和回忆指标来评估性能.
主要成果:
- GPT-4o的表现始终优于Llama-3.3-70B,精度在0.83-0.95 (GPT-4o) 和0.65-0.86 (Llama-3.3-70B) 之间.
- 包括注释准则在数据集中提高了这两种模型的精度.
- 在数据集B中,GPT-4o和Llama-3.3-70B的精度分别从0.83增加到0.95和0.87增加到0.94.
结论:
- 无论是GPT-4o还是Llama-3.3-70B,都显示出从中风CT报告中提取成像发现的潜力.
- 精确定义的注释准则显著提高了LLM数据提取的准确性.
- 注释准则可以优化数据提取,用于放射学下游应用.


