Video Experimental Relacionado
Updated: Feb 28, 2026

03:14
Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
1.3K
Barreras de Recuperación Aumentada para Mensajes de Pacientes Redactados por IA: Construcción de Taxonomía de Errores
Wenyuan Chen1, Fateme Nateghi Haredasht2, Kameron C Black3
1Stanford Center for Biomedical Informatics Research, Stanford, CA, USA, wenyuanc@stanford.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|February 27, 2026
Resumen
La evaluación de las respuestas de los modelos de lenguaje grandes (LLM) para los mensajes de los pacientes es crucial. Un nuevo pipeline de Verificación de Errores Aumentada por Recuperación (RAEC) mejora la precisión y el acuerdo en la detección de errores clínicos.
Área de la Ciencia:
- Informática de la Salud
- Inteligencia Artificial en Medicina
- Procesamiento del Lenguaje Natural Clínico
Sus antecedentes:
- La mensajería asíncrona entre pacientes y clínicos a través de portales de Registros Electrónicos de Salud (EHR) aumenta la carga de trabajo de los clínicos.
- Los Modelos de Lenguaje Grandes (LLM) muestran promesa para ayudar con las respuestas a los mensajes, pero requieren una evaluación sólida debido a posibles imprecisiones.
- Los métodos de evaluación existentes pueden no capturar adecuadamente los matices de la comunicación clínica.
Objetivo del estudio:
- Introducir una ontología de errores basada clínicamente para evaluar las respuestas de mensajes generadas por LLM.
- Desarrollar un pipeline de Verificación de Errores Aumentada por Recuperación (RAEC) para mejorar la calidad de las evaluaciones de respuestas de LLM.
- Implementar un sistema de detección de errores escalable e interpretable utilizando una arquitectura de prompting de dos etapas.
Principales métodos:
- Desarrolló una ontología de errores de 5 dominios y 59 códigos a través de codificación inductiva y adjudicación experta.
- Creó un pipeline RAEC que utiliza pares de mensajes-respuestas históricas semánticamente similares para mejorar el juicio.
- Empleó una arquitectura de prompting de dos etapas con DSPy para la detección jerárquica de errores en más de 1500 mensajes de pacientes.
Principales resultados:
- El pipeline RAEC demostró una mejora en la identificación de errores, particularmente en la completitud clínica y la idoneidad del flujo de trabajo.
- Las evaluaciones mejoradas por contexto mostraron una concordancia superior (concordancia = 50% frente a 33%) en comparación con las evaluaciones de referencia.
- Las métricas de rendimiento (puntuación F1) fueron significativamente más altas para las etiquetas mejoradas por contexto (0,500 frente a 0,256) en la validación humana.
Conclusiones:
- La ontología de errores propuesta basada clínicamente y el pipeline RAEC proporcionan barreras de IA efectivas para la mensajería de pacientes.
- La recuperación aumentada mejora significativamente la precisión y la fiabilidad de las evaluaciones de respuestas de LLM.
- Este enfoque apoya la implementación segura y escalable de LLM en los flujos de trabajo de comunicación clínica.
Palabras clave:
Modelos de Lenguaje GrandesMensajería de PacientesGuardarraíles de IAEvaluación de IAProcesamiento del Lenguaje Natural ClínicoInformática de la SaludRegistros Electrónicos de SaludComunicación Médico-PacienteInteligencia Artificial en MedicinaSeguridad del Paciente
