使用长型大语言模型对非结构化癌症病理报告进行细分
Damien Fung1, Gregory Arbour1, Krisha Malik2
1Department of Computer Science, University of British Columbia, Vancouver, Canada.
JCO clinical cancer informatics
|March 4, 2025
概括
这项研究对Longformer模型进行了微调,用于细分癌症病理报告,改善了诊断和临床史等关键部分的隔离,以便更好地进行NLP分析.
科学领域:
- 自然语言处理 (NLP) 是一种自然语言处理.
- 计算病理学计算病理学
- 机器学习用于医疗保健
背景情况:
- 文本预处理通过删除外部信息来提高NLP模型的性能.
- 文本细分隔离关键文档部分,有助于下游分析.
- 像BERT这样的变压器模型在NLP任务中表现出色,但对于冗长的文档有标志性的限制.
研究的目的:
- 开发和评估用于细分癌症病理学报告的Longformer模型.
- 解决标准变压器模型在处理长文件时的局限性.
- 为了提高病理学报告中隔离关键部分的准确性.
主要方法:
- 一个长期以来的问题-答案 (QA) 模型在504份注释病理学报告上进行了微调.
- 该模型被训练来识别包括诊断,附录和临床病史在内的部分.
- 性能与常规表达式和BERT QA等基线方法进行了比较,使用序列回忆,精度和F1评分.
主要成果:
- 精心调整的Longformer模型在304份测试报告中获得了F1序列的整体得分0.68.
- 具体的F1分数包括诊断 (0.77),附录 (0.48) 和临床病史 (0.89).
- 与基线方法相比,Longformer模型在细分病理报告部分方面表现出优异的性能.
结论:
- 一个微调的Longformer模型有效地细分了癌症病理学报告.
- 这种方法提高了隔离关键部分以进行进一步分析的准确性.
- 开发的模型为计算病理学和NLP应用提供了有价值的工具.


