从自由文本医疗报告中提取结构化数据的管道的开发和评估,使用大型语言模型
Enzo Joseph1, Paul Vallee1, Tanguy Perennec2
1Data Factory & Analytics Department, Institut de Cancérologie de l'Ouest, Nantes-Angers, France.
JCO clinical cancer informatics
|February 18, 2026
概括
像Mistral Large这样的大型语言模型 (LLM) 可以准确地从病理学报告中提取乳腺癌生物标志物. 这项技术在结构化临床数据和推动医疗数字化转型方面表现有前途.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 在瘤学瘤学.
背景情况:
- 病理学报告包含乳腺癌 (BC) 的关键临床数据,但很难在规模上进行结构化.
- 传统的自然语言处理 (NLP) 方法需要大量的手动注释和培训.
- 大型语言模型 (LLM) 为自动数据提取提供了一个潜在的解决方案.
研究的目的:
- 调查Mistral Large LLM在从非结构化病理报告中自动提取三种关键乳腺癌 (BC) 生物标志物的有效性.
- 评估基于LLM的临床数据结构管道的性能.
主要方法:
- 开发和评估了一条管道,将Mistral Large LLM与后处理阶段相结合.
- 评估了两个数据集的性能:1,152份BC病理报告和101名转移性BC患者的黄金标准数据库.
- 探讨了信任提示 (CP),思维链 (CoT) 和几次拍摄的例子对管道性能的影响.
主要成果:
- 对于雌激素受体,孕激素受体和HER2状态/分数,取得了文档级F1分数>95%和回忆/精度>94%.
- 患者水平的F1分数在87% - 90%之间,回忆率在83% - 87%之间,精度> 90%.
- 管道的表现是一致的,无论是CP,CoT,还是包括少数镜头的例子.
结论:
- 证明了像Mistral Large这样的LLM在从病理学报告中提取结构化乳腺癌生物标志物数据方面的巨大潜力.
- 强调了基于LLM的方法对医疗保健文件数字化转型的实用性.
更多相关视频
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.2K
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
1.6K
