从各种前列腺癌电子记录中自动提取成像和病理数据
John M Culnan1, Sergey D Goryachev1, John R Bihn1
1Department of Veterans Affairs Healthcare System, Massachusetts Veterans Epidemiology Research and Information Center, Boston, MA.
JCO clinical cancer informatics
|August 7, 2025
概括
一个新的自然语言处理 (NLP) 算法准确地从活检和MRI报告中提取关键的前列腺癌 (PCa) 数据. 该工具增强了用于未来PCa研究和临床见解的数据提取.
科学领域:
- 泌尿器科 泌尿器科 泌尿器科 泌尿器科
- 医疗信息学 医疗信息学
- 在瘤学瘤学.
背景情况:
- 前列腺癌 (PCa) 研究需要从临床报告中提取准确的数据.
- 从病理学和MRI报告中手动提取数据是耗时且容易出现错误的.
- 需要标准化的数据提取方法来促进大规模的PCa研究.
研究的目的:
- 开发和验证一种自然语言处理 (NLP) 算法,用于从前列腺活检和MRI报告中提取临床相关的数据元素.
- 为了自动提取关键指标,如格里森得分,PI-RADS得分和前列腺尺寸.
主要方法:
- 基于规则的NLP算法是使用VA癌症登记系统和企业数据仓库的手动注释活检和MRI报告开发的.
- 该算法被训练来提取格里森得分,阳性/总核,PI-RADS得分,PSA密度,前列腺体积和尺寸.
- 算法性能在一组单独的250个活检和250个MRI报告上得到验证.
主要成果:
- NLP算法表现出高性能,所有提取的数据元素的F1得分超过88%.
- 具体的F1评分包括格里森 (96.9),PI-RADS (93.7),PSA密度 (99.5),前列腺体积 (95.7),前列腺体尺寸 (93.2).
- 错误主要归因于报告中的复杂或模两可的语言.
结论:
- 开发的NLP算法可靠地从临床报告中提取前列腺癌研究的基本数据.
- 使用该算法进行自动数据提取可以显著支持PCa的下游研究和临床应用.
- 该工具提供了一个可扩展的解决方案,用于从大量医疗记录中获取关键信息.


