从自由文本放射学报告中自动检测转移的目标生成数据增强
Maede Ashofteh Barabadi1, Xiaodan Zhu1, Wai Yip Chan1
1Ingenuity Labs Research Institute, Department of Electrical and Computer Engineering, Queen's University, Kingston, ON, Canada.
Frontiers in artificial intelligence
|February 21, 2025
概括
像Llama3这样的大型语言模型可以生成合成数据,以从放射学报告中改进自动化癌症转移检测. 这种方法提高了使用有限的标记数据和结构化或非结构化临床笔记的诊断准确性.
科学领域:
- 医疗信息学医学信息学
- 自然语言处理自然语言处理.
- 计算瘤学是一种计算瘤学.
背景情况:
- 准确识别癌症患者的转移部位对于治疗和诊断至关重要.
- 由于数据的复杂性,从电子健康记录 (EHR) 中自动检测转移具有挑战性.
- 专家注释数据的有限可用性阻碍了强大的自动化系统的开发.
研究的目的:
- 通过使用先进的自然语言处理 (NLP) 技术,从放射学报告中自动检测转移部位.
- 利用大型语言模型 (LLM) 来生成合成训练数据,以克服稀缺标记数据的局限性.
- 评估有针对性的数据增强策略的有效性,并比较不同报告结构的性能.
主要方法:
- 提示Llama3,一个指令调整的LLM,生成合成放射学报告数据用于培训.
- 调整BERT,一种预训练的语言模型,用于使用扩展数据集检测转移.
- 实施和比较三种针对性数据增强技术与标准方法.
- 分析转移识别准确度,使用机构标准化与非结构化报告,结合患者病史与LoRA调整.
主要成果:
- 使用Llama3生成的合成数据进行数据增强,肺部,肝脏和上腺转移的F1平均得分分别提高了2.3,3.5和3.9分.
- 有针对性的数据增强产生了与香草增强相当或优于香草增强的性能,同时在计算上更高效.
- 将患者病史与定制模型架构相结合,将标准化和非结构化报告之间的绩效差距从7.3到4.5F1分减少.
结论:
- 在没有特定任务微调的情况下,LLM可以生成高质量的合成临床数据,用于自动检测转移.
- 目标数据增强和LLM生成的数据为癌症进展分析提供了广泛适用和计算效率高的解决方案.
- 开发的方法允许大规模,低成本的癌症进展模式的时空提取,可在不同的机构数据结构中进行适应.


