DIRI:用大型语言模型重新识别敌对患者,用于评估临床文本匿名化
John X Morris1, Thomas R Campion1, Sri Laasya Nutheti1
1Cornell Tech, New York, NY.
概括
目前的非识别方法未能充分保护患者的隐私. 一种对抗性的大型语言模型 (LLM) 方法成功地重新识别了9%的笔记,揭示了现有工具的弱点.
科学领域:
- 生物医学信息学 生物医学信息学
- 自然语言处理自然语言处理.
- 数据 隐私 数据 隐私 数据
背景情况:
- 分享受保护的健康信息 (PHI) 对生物医学研究至关重要.
- 在数据分发之前,去识别对于从临床文本中删除PHI至关重要.
- 目前的去识别方法通常在有限的数据集上进行评估,可能会高估现实世界的性能.
研究的目的:
- 开发和评估一种使用大型语言模型 (LLM) 的新型对抗方法,以从被删除的临床笔记中重新识别患者.
- 评估最先进的解除身份工具对重新识别攻击的有效性.
- 突出当前去识别技术的局限性,并为代改进提供一个工具.
主要方法:
- 开发了一种使用大型语言模型 (LLM) 进行重新识别的对抗方法.
- 引入了去识别/重新识别 (DIRI) 方法来评估去识别工具的性能.
- 在使用Philter,BiLSTM-CRF和ClinicalBERT匿名化Weill Cornell Medicine的临床数据上测试了该方法.
主要成果:
- 基于LLM的重新识别工具成功地重新识别了9%的临床笔记,即使是那些由最有效的非识别工具 (ClinicalBERT) 处理的笔记.
- 这表明当前的非识别技术存在重大缺陷.
- DIRI方法为消除身份工具提供了一个强大的评估框架.
结论:
- 现有的非识别技术存在重大漏洞.
- 开发的基于LLM的重新识别方法可以有效地挑战和暴露这些弱点.
- 持续改进和新的方法是必要的,以确保生物医学研究中强大的患者隐私.


