在不良事件报告中使用基于变压器的神经网络自动编辑名称
Eva-Lisa Meldau1, Shachi Bista2, Carlos Melgarejo-González2
1Uppsala Monitoring Centre, Uppsala, Sweden. eva-lisa.meldau@who-umc.org.
BMC medical informatics and decision making
|December 24, 2024
概括
在不良事件报告中自动删除名称有效地保护了患者的隐私. 这种方法实现了高回忆率,同时保留了临床信息,确保数据共享是安全和有用的.
科学领域:
- 药物监督 药物监督 药物监督
- 自然语言处理自然语言处理.
- 数据 隐私 数据 隐私 数据
背景情况:
- 对隐私保护和数据共享而言,个人数据的自动化去识别是至关重要的.
- 药物监督依赖于叙事数据,这些数据通常包含敏感的个人标识符.
- 英国的黄卡计划收集不良事件报告,需要强有力的非识别方法.
研究的目的:
- 开发和评估一种自动化方法,用于编辑英语叙事不良事件报告中的个人名字.
- 评估该方法在英国黄卡计划数据上的有效性.
- 确定编辑是否会损害叙述的临床实用性.
主要方法:
- 微调基于BERT的神经网络,用于在叙事文本中的名称识别.
- 利用新注释的黄卡数据和i2b2 2014挑战数据的组合进行培训.
- 由于黄卡数据中的名称有限,采用预测模型来选择培训的相关叙述.
- 在单独一组注释的黄色卡片叙述中评估表现.
- 进行深入的审查,以评估重新识别的风险和对临床实用性的影响.
主要成果:
- 在黄卡数据上实现了87%的回忆率和55%的名称编辑精度.
- 记忆力 (94%) 和精度 (58%) 在超过三个字符的代币中更高.
- 错误阳性率为0.05%,97%的叙述没有受到影响.
- 深入审查表明,重新识别的风险很低 (直接在1个叙述中,间接在2).
- 在不到1%的叙述中,临床相关信息被编辑.
结论:
- 在不良事件报告中,自动化名称编辑是有效的,即使在简短的标识符 (如首字母) 中,也能实现足够的回忆.
- 开发的方法表明,损害患者保密的风险很低.
- 可接受的精度和假阳性率确保几乎保留了所有临床相关信息.


