德诺沃自然语言处理算法从病理学报告准确地识别了myxofibrosarcoma
Sarah E Lindsay1, Cecelia J Madison2, Duncan C Ramsey1
1Department of Orthopaedics and Rehabilitation, Oregon Health & Science University, Portland, OR, USA.
Clinical orthopaedics and related research
|October 3, 2024
概括
一个新的自然语言处理 (NLP) 算法准确地识别VA病理报告中的myxofibrosarcoma患者,改进了传统的ICD代码和词搜索,以获得更好的肉瘤研究数据库.
科学领域:
- 医疗信息学 医疗信息学
- 在瘤学瘤学.
- 自然语言处理自然语言处理.
背景情况:
- 国际疾病分类 (ICD) 代码低于软组织肉瘤诊断.
- 国家VA数据库提供了一个独特的资源,用于肉瘤研究,由于全面的临床数据.
- 自然语言处理 (NLP) 可以分析临床文件以识别软组织肉瘤,独立于ICD代码.
研究的目的:
- 确定VA数据库中ICD码遗漏的myxofibrosarcoma患者的比例.
- 从病理学报告中评估NLP算法的准确性,以识别myxofibrosarcoma.
主要方法:
- 从VA公司数据仓库 (2003-2022) 审查了1070万份病理报告.
- 通过手动审查包含"myxofibrosarcoma"的报告,开发了一个黄金标准队列.
- 代改进了一个NLP算法,评估它的灵敏度,特异性,PPV,NPV和准确性与黄金标准相比.
主要成果:
- 27%的myxofibrosarcoma患者被ICD代码遗漏了.
- 该NLP算法在识别myxofibrosarcoma方面达到92%的准确性,超过ICD代码 (73%) 和词搜索 (74%).
- 最终的NLP模型显示准确度在92%至100%之间.
结论:
- 一个新的NLP算法准确地从病理学报告中识别出myxofibrosarcoma.
- 这种NLP方法显著改进了基于ICD的简单单词搜索方法,用于队列创建.
- 该算法在GitHub上公开提供,以鼓励外部验证和进一步开发.


