基于实验室数据的文本分析框架,用于从实验室数据中识别非小细胞肺癌患者的突变
Amman Yusuf1, Devon J Boyne1,2, Dylan E O'Sullivan1,2
1Department of Oncology, University of Calgary, Calgary, AB, T2N 4N2, Canada.
BMC medical research methodology
|March 12, 2024
概括
这项研究开发了一个文本分析框架,从非结构化的生物标志物实验室数据中提取有价值的信息,特别是表皮生长因子受体 (EGFR) 测试结果,实现癌症研究的高精度.
科学领域:
- 生物医学信息学 生物医学信息学
- 计算生物学 计算生物学
- 癌症研究 癌症研究
背景情况:
- 生物标志物实验室数据对于癌症研究至关重要,但通常存在于非结构化,自由文本数据中,限制了其实用性.
- 从这些非结构化数据中提取信息对于推动癌症研究和改善患者治疗结果至关重要.
- 以前的信息提取方法包括自然语言处理 (NLP),机器学习 (ML) 和基于规则的信息提取 (IE).
研究的目的:
- 开发和评估一种新的文本分析框架,用于从非结构化生物标志物实验室数据中提取特定信息.
- 提高癌症研究临床数据的可访问性和可用性.
- 通过将自由文本数据转化为结构化,可操作的信息,实现更全面的分析.
主要方法:
- 开发了一个基于规则的信息提取 (IE) 框架,结合了词法和语法分析.
- 数据预处理包括清理,丰富文本格式转换,规范化和令牌化.
- 语境自由语法被用来生成确定性数据提取规则,特别是表皮生长因子受体 (EGFR) 测试结果.
主要成果:
- 该框架成功地从南阿尔伯塔数据集 (SAD) 提取了5129个EGFR测试结果,并从北阿尔伯塔数据集 (NAD) 提取了3388个结果.
- 该系统在抽取的EGFR测试结果的随机样本上实现了97.5%的高准确性.
- 提取的数据与阿尔伯塔癌症注册表联系在一起,以支持现实世界的癌症研究.
结论:
- 提出了一个强大的文本分析框架,用于从非结构化临床数据中提取特定信息.
- 该框架在从EGFR测试结果中提取相关信息方面取得了显著的成功.
- 这种方法提高了实验室数据对癌症研究和临床决策的价值.
关键词:
语境自由的语法语法 在文本之外欧洲农业基金会 (EGFR) 是一个基金.提取信息 提取信息实验室数据 实验室数据词汇分析 词汇分析在NSCLCLC中,我们可以看到.语法分析 语法分析文本分析 文本分析

