从文本到数据:开源的大型语言模型从德国病理学报告中提取癌症相关的医疗属性
Stefan Bartels1, Jasmin Carus1
1University Medical Center Hamburg-Eppendorf / University Cancer Center, Martinistr. 52, Hamburg, 22767, Germany.
International journal of medical informatics
|July 3, 2025
概括
开源大型语言模型 (LLM) 可以安全地从德国病理学报告中提取癌症数据. 检索增强使较小的模型与较大的模型相匹配,提高了资源效率的部署.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 结构化的瘤文档对于数据驱动的癌症护理至关重要.
- 从非结构化的德国病理学报告中提取临床特征是具有挑战性的,因为数据保护法律要求在当地部署.
- 开源大型语言模型 (LLM) 为内部数据提取提供了一个潜在的解决方案.
研究的目的:
- 评估开源的LLMs,以从德国病理学报告中提取癌症特征,在安全的,本地环境中.
- 为了比较不同LLM和提示策略的性能,包括检索增强生成 (RAG).
- 评估在德国临床环境中资源高效地部署LLMs的可行性.
主要方法:
- 创建一个由522份注释的德国病理学报告组成的黄金标准数据集.
- 开发一个采集增强生成 (RAG) 管道,使用 15,000 个额外的报告.
- 评估使用零射击,少数射击和RAG增强的少数射击提示的五种调整指令的LLM (Llama 3.3 70B,Mistral Small 24B和三种SauerkrautLM变体).
- 使用实体级精度,回忆,准确性和宏观平均F1分数进行评估.
主要成果:
- 拉玛3.3 70B获得了最高的整体性能 (F1 > 0.90).
- 与RAG相结合的Mistral Small 24B实现了与Llama 70B相比的性能,使用的计算资源显著减少.
- 少数射击促使基线精度提高,RAG进一步提高了性能,特别是在较小的模型中.
- 在提取不太频繁的属性,如转移和分期等方面仍然存在挑战.
结论:
- 具有有效提示和RAG的开源LLM能够从非结构化文本中高质量,符合隐私的瘤信息提取.
- 检索增强允许较小的LLM与较大的LLM匹配,促进在德国临床环境中可扩展和资源高效的部署.
- 未来的工作应该集中在改善稀有但关键属性的提取和平衡培训数据上.


