ASQ-PHI:一种对抗性的合成数据基准,用于临床去识别和搜索实用性
James Weatherhead1, George Golovko2, Peter McCaffrey3
1Graduate School of Biomedical Sciences, University of Texas Medical Branch (UTMB), 301 University Boulevard, Galveston, TX 77555, USA.
Data in brief
|February 25, 2026
概括
一个新的合成数据集,ASQ-PHI,为非识别临床查询提供了至关重要的资源. 这一基准有助于安全地将受保护的健康信息 (PHI) 从符合HIPAA的大型语言模型 (LLM) 转移到外部工具.
科学领域:
- 医疗信息学 医疗信息学
- 自然语言处理 (Natural Language Processing) 是一种自然语言处理.
- 数据科学数据科学数据科学
背景情况:
- 医院在临床任务中使用符合HIPAA的大型语言模型 (LLM),允许输入受保护的健康信息 (PHI).
- LLM需要外部数据来获得最新的临床证据,因此在此过渡期间需要安全的方法来处理PHI.
- 现有的取消身份识别数据集没有针对基于聊天的临床LLM接口中使用的简短的查询式提示进行优化.
研究的目的:
- 引入ASQ-PHI,一个新的,完全合成的基准数据集,用于在LLM安全交付的背景下去识别临床查询.
- 为评估简短的临床医生类型搜索查询的非识别提供资源.
- 促进开发可靠的系统,将包含PHI的查询转换为外部,非BAA覆盖的工具.
主要方法:
- 生成了1051个合成的,单回合的临床搜索查询,模仿临床医生提示的HIPAA合规的LLMs.
- 使用PHI元素及其相应的HIPAA安全港类别的注释查询,使用机器解析分界符和JSON.
- 采用了与Azure OpenAI GPT-4o的对抗性少数射击提示管道用于查询生成,包括PHI阳性和硬负面示例.
主要成果:
- ASQ-PHI数据集包含1051个查询,其中79.2%是PHI阳性,20.8%是硬负面.
- 2973个PHI元素被标记在13种HIPAA安全港标识符类型中,适用于测量PHI删除和过度删除.
- 商业PHI检测服务的基线指标在数据集的存储库中提供.
结论:
- ASQ-PHI解决了适合数据集的稀缺性,用于在LLM安全交付场景中去识别临床查询.
- 该数据集允许对基于查询的简短提示进行评估,这与传统的EHR叙述基准不同.
- ASQ-PHI是在麻省理工学院许可证下发布的,旨在促进安全的临床AI应用的进一步研究和开发.
更多相关视频
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
16.6K
06:55Inverse Probability of Treatment Weighting Propensity Score using the Military Health System Data Repository and National Death Index
Published on: January 8, 2020
15.4K
