从使用大型语言模型的非结构化肝胆病理学报告中提取和分类结构化数据:与基于规则的自然语言处理相比的可行性研究
Ruben Geevarghese1, Carlie Sigel2, John Cadley3
1Division of Interventional Radiology, Department of Radiology, Memorial Sloan Kettering Cancer Center, New York, New York, USA.
Journal of clinical pathology
|September 20, 2024
概括
大型语言模型 (LLM) 准确地提取癌症研究的关键病理元素,大大减少了手动治疗时间. 这一进步有望通过简化从病理学报告中提取数据来加速关键的癌症研究.
科学领域:
- 在瘤学瘤学.
- 病理学 信息学 信息学
- 人工智能在医学中的应用
背景情况:
- 在病理学中,结构化报告至关重要,但并未被普遍采用.
- 手动提取必要的病理学元素用于研究是耗时且昂贵的.
- 大型语言模型 (LLM) 为自动数据提取提供了一个潜在的解决方案.
研究的目的:
- 评估使用LLM来提取癌症研究必不可少的病理元素的准确性和可行性.
- 将LLM的绩效与传统的基于规则 (REGEX) 的方法进行比较.
主要方法:
- 追溯分析88份病理报告,涉嫌肝细胞癌的患者.
- 使用的发电预训练变压器 (GPT) 3.5轮机和GPT-4用于元素提取.
- 将LLM精度与基于正则表达式 (REGEX) 的提取方法进行比较.
主要成果:
- 无论是LLMs还是REGEX都在从病理学报告中提取研究元素方面表现出高准确度.
- 评估方法的平均准确度在84.1%至94.8%之间.
结论:
- 法律法规显示,有很大的潜力来简化从病理学报告中提取研究元素.
- 使用LLM的自动提取可以加速癌症研究的步伐.
- 这项技术可以减少与病理学数据策划相关的手工工作和成本.


