放射学报告的自动匿名化:公开可用的自然语言处理和大型语言模型的比较
Marcel C Langenbach1,2, Borek Foldyna3, Ibrahim Hadzic3,4
1Cardiovascular Imaging Research Center, Massachusetts General Hospital, Harvard Medical School, Boston, MA, USA. mlangenbach@mgh.harvard.edu.
European radiology
|October 31, 2024
概括
预训练的自然语言处理 (NLP) 模型有效地将放射学报告中的受保护健康信息 (PHI) 匿名化. 大型语言模型 (LLM) 的可靠性较低,有可能丢失关键的临床数据.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理自然语言处理.
- 放射学 放射学是一门学科.
背景情况:
- 医疗报告包含受HIPAA限制的受保护健康信息 (PHI).
- 二次数据的使用对于研究和AI开发至关重要.
- 需要自动化匿名化才能实现合规的数据共享.
研究的目的:
- 在自由文本放射学报告中自动匿名PHI.
- 为了比较NLP和LLM方法在PHI匿名化方面的有效性.
- 评估在匿名化过程中临床信息的保存情况.
主要方法:
- 两个基于规则的NLP模型 (精度优化和速度优化) 和一个离线的LLM (LLaMa-2) 的比较.
- 对100个随机选择的胸部CT报告进行测试.
- 两个研究人员对匿名化准确性 (精度,回忆,F1分数) 和临床信息保存的评估.
主要成果:
- NLP模型实现了日期,MRN和高F1分数的ACC的完美匿名化.
- 该LLM模型表现出完美的精度,但日期和ACC的回忆能力较低.
- NLP模型保留了所有临床信息,而LLM模型在10%的病例中删除了一些医疗数据.
结论:
- 预先训练的NLP模型为放射学报告提供有效和可靠的PHI匿名化.
- 基于LLM的匿名化带来了意外删除临床信息的更高风险.
- 自动匿名化对于放射学中符合HIPAA的二次数据使用至关重要.
更多相关视频
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
15.9K
09:20Cloud-Based Phrase Mining and Analysis of User-Defined Phrase-Category Association in Biomedical Publications
Published on: February 23, 2019
8.7K
