从病理学报告中提取肺癌阶段描述符:一种生成语言模型方法
Hyeongmin Cho1, Sooyoung Yoo2, Borham Kim2
1ezCaretech Research & Development Center, Jung-gu, Seoul, Republic of Korea.
Journal of biomedical informatics
|September 5, 2024
概括
生成式语言模型 (GLMs) 可以有效地从肺癌病理学报告中提取关键信息以进行分期. 在演数据集上训练的小型GLM实现了高准确度,有助于临床决策和研究.
科学领域:
- 在瘤学瘤学.
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
背景情况:
- 电子健康记录包含重要的瘤学数据,但难以处理.
- 自然语言处理 (NLP) 和大语言模型 (LLM) 为癌症研究提供了解决方案.
- 从报告中提取病态分期信息可以更新癌症分期.
研究的目的:
- 评估微调生成语言模型 (GLMs) 来提取肺癌病理阶段信息.
- 评估在资源有限的环境中使用较小的GLM的可行性.
主要方法:
- 收集了来自第三级医院的肺癌手术病理学报告.
- 定义了42个关键描述符用于瘤节点 (TN) 分类,创建了一个黄金标准.
- 训练和评估GLM使用来自报告和黄金标准的即时响应对.
主要成果:
- 六个GLM被训练并对信息提取和TN分类进行评估.
- 演式米斯特拉尔-7B型号实现了最高的性能.
- 获得了92.24%的精确匹配比率来提取信息,同时获得T和N分类的0.9876准确度.
结论:
- 用演数据集训练GLM可以提高信息提取性能.
- 小型GLMs (大约2个月) 70亿参数) 可以实现高性能.
- 基于GLM的方法支持临床决策,肺癌分期和研究.


