Video Experimental Relacionado
Updated: Feb 26, 2026

A Data Integration Workflow to Identify Drug Combinations Targeting Synthetic Lethal Interactions
Published on: May 27, 2021
ASQ-PHI: Un conjunto de datos sintético adversarial para la desidentificación clínica y la utilidad de búsqueda
James Weatherhead1, George Golovko2, Peter McCaffrey3
1Graduate School of Biomedical Sciences, University of Texas Medical Branch (UTMB), 301 University Boulevard, Galveston, TX 77555, USA.
Un nuevo conjunto de datos sintético, ASQ-PHI, ofrece recursos cruciales para desidentificar consultas clínicas. Este benchmark ayuda en la transición segura de Información de Salud Protegida (PHI) de modelos de lenguaje grandes (LLM) compatibles con HIPAA a herramientas externas.
Área de la Ciencia:
- Informática Médica
- Procesamiento del Lenguaje Natural
- Ciencia de Datos
Sus antecedentes:
- Los hospitales utilizan modelos de lenguaje grandes (LLM) compatibles con HIPAA para tareas clínicas, lo que permite la entrada de Información de Salud Protegida (PHI).
- Los LLM requieren datos externos para obtener evidencia clínica actualizada, lo que requiere un método seguro para manejar la PHI durante esta transición.
- Los conjuntos de datos de desidentificación existentes no están optimizados para los indicadores de consulta cortos, de estilo de consulta utilizados en las interfaces de LLM clínicas basadas en chat.
Objetivo del estudio:
- Presentar ASQ-PHI, un conjunto de datos de referencia novedoso y totalmente sintético para desidentificar consultas clínicas en el contexto de las transferencias seguras de LLM.
- Proporcionar un recurso para evaluar la desidentificación de consultas de búsqueda cortas, de estilo clínico.
- Facilitar el desarrollo de sistemas robustos para la transición de consultas que contienen PHI a herramientas externas que no cubren BAA.
Principales métodos:
- Se generaron 1051 consultas de búsqueda clínica sintéticas de un solo turno que imitan los indicadores de los médicos para LLM compatibles con HIPAA.
- Se anotaron las consultas con elementos de PHI y sus categorías correspondientes de HIPAA Safe Harbor utilizando delimitadores y JSON analizables por máquina.
- Se empleó un pipeline de generación de consultas adversarias de pocos disparos con Azure OpenAI GPT-4o, incluyendo ejemplos positivos de PHI y negativos difíciles.
Principales resultados:
- El conjunto de datos ASQ-PHI contiene 1051 consultas, con un 79,2% de positividad a PHI y un 20,8% de negativos difíciles.
- Se etiquetan 2973 elementos de PHI en 13 tipos de identificadores de HIPAA Safe Harbor, adecuados para medir la eliminación de PHI y la sobrerredacción.
- Las métricas de referencia para un servicio comercial de detección de PHI se proporcionan dentro del repositorio del conjunto de datos.
Conclusiones:
- ASQ-PHI aborda la escasez de conjuntos de datos adecuados para desidentificar consultas clínicas en escenarios de transferencia segura de LLM.
- El conjunto de datos permite la evaluación del rendimiento de la desidentificación en indicadores cortos basados en consultas, distintos de los puntos de referencia narrativos tradicionales de EHR.
- ASQ-PHI se publica bajo una licencia MIT, lo que promueve la investigación y el desarrollo futuros en aplicaciones clínicas seguras de IA.
Más Videos Relacionados
07:50A Metadata Extraction Approach for Clinical Case Reports to Enable Advanced Understanding of Biomedical Concepts
Published on: September 20, 2018
06:55Inverse Probability of Treatment Weighting Propensity Score using the Military Health System Data Repository and National Death Index
Published on: January 8, 2020