一个以变压器为基础的管道,用于德国临床文档去识别.
Kamyar Arzideh1,2, Giulia Baldini2,3, Philipp Winnekens1,2
1Central IT Department, Data Integration Center, University Hospital Essen, Essen, Germany.
Applied clinical informatics
|January 8, 2025
概括
变压器模型可以自动检测临床文档中的敏感信息,优于人类注释器. 这种自动化方法增强了现实世界患者数据的数据保护,解决了一般大语言模型的局限性.
科学领域:
- 自然语言处理自然语言处理.
- 临床信息学 临床信息学
- 机器学习 机器学习
背景情况:
- 商业上可用的大型语言模型 (LLM),如ChatGPT,由于隐私问题,不适合用于真实患者数据.
- 手动去识别非结构化临床数据是劳动密集型和耗时的.
- 变压器模型为分析大型数据集提供了高效的文本处理功能.
研究的目的:
- 调查大型培训数据集对用于消除临床文本识别的变压器模型性能的影响.
- 开发和评估基于变压器的模型,用于检测德国临床文档中的敏感信息.
主要方法:
- 使用了来自德国医院的10,240份来自1,130名患者的培训数据集.
- 微调和训练了一个由两个基于变压器的语言模型组成的组合.
- 制定了注释指南,用于培训注释员,并确保数据的一致性.
主要成果:
- 精心调整的德国ELECTRA (gELECTRA) 模型在100个文档的测试组中获得了F1宏观平均得分0.95分.
- 吉莱克特拉模型超过了人类注释者,他们获得了0.93.3的F1得分.
- 该研究证明了变压器模型在病理学报告和进度说明中识别敏感数据的有效性.
结论:
- 变压器模型可以有效地训练,以检测现实世界的德国临床报告中的敏感信息.
- 根据特定的医院数据和全面的指导方针量身定制的注释方案提高了模型的性能.
- 与经验丰富的人类注释者相比,表现最好的变压器模型在识别临床文本方面表现出更高的准确性.
更多相关视频
09:03Radiotracer Administration for High Temporal Resolution Positron Emission Tomography of the Human Brain: Application to FDG-fPET
Published on: October 22, 2019
9.9K
09:49A Whole Body Dosimetry Protocol for Peptide-Receptor Radionuclide Therapy PRRT: 2D Planar Image and Hybrid 2D+3D SPECT/CT Image Methods
Published on: April 24, 2020
9.8K
