Video Experimental Relacionado
Updated: Feb 10, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Mejorar la identificación de drogas en la vigilancia de muertes por sobredosis mediante el uso de modelos clínicos de
Arthur J Funnell1, Panayiotis Petousis1, Fabrice Harel-Canada2
1Medical & Imaging Informatics Group, Department of Radiological Sciences, David Geffen School of Medicine, University of California, Los Angeles, Los Angeles, California, USA.
La vigilancia precisa de las muertes relacionadas con las drogas es crucial. Los modelos de procesamiento del lenguaje natural (PNL), especialmente BioClinicalBERT, pueden clasificar rápidamente los datos de sobredosis de los informes forenses, mejorando el monitoreo de la salud pública.
Área de la Ciencia:
- Salud Pública La salud pública.
- La lingüística computacional es la lingüística computacional.
- Ciencias Forenses Ciencias Forenses.
Sus antecedentes:
- Las muertes relacionadas con las drogas, particularmente las inducidas por el fentanilo, están aumentando en los Estados Unidos, lo que requiere una vigilancia eficiente.
- Los métodos actuales se basan en la codificación manual de los informes del forense en la CIE-10, causando retrasos y pérdidas de datos.
- Las aplicaciones existentes de procesamiento del lenguaje natural (PNL) para la vigilancia de sobredosis han mostrado limitaciones.
Objetivo del estudio:
- Evaluar y comparar varios modelos de PNL para clasificar la participación de drogas en muertes por sobredosis a partir de texto no estructurado.
- Evaluar el rendimiento del aprendizaje automático tradicional, los modelos basados en BERT y los grandes modelos de lenguaje (LLM).
- Determinar el enfoque de PNL más preciso y escalable para mejorar la vigilancia de sobredosis.
Principales métodos:
- Utilizó un conjunto de datos de 35.433 registros de muertes estadounidenses desde 2020 para capacitación y pruebas internas.
- Se realizó una validación externa en un conjunto de datos separado de 3335 registros de 2023-2024.
- Comparó clasificadores tradicionales, representaciones de codificadores bidireccionales afinadas de transformadores (BERT) y BioClinicalBERT, y LLM sólo con decodificador (Qwen 3, Llama 3).
- Evalúa el rendimiento utilizando puntuaciones F1 promediadas por macros y intervalos de confianza del 95%.
Principales resultados:
- Los modelos BioClinicalBERT afinados lograron un rendimiento casi perfecto (macro F1 ≥0.998) en los datos internos.
- La validación externa demostró la robustez de BioClinicalBERT (macro F1 = 0.966), superando el rendimiento de otros modelos.
- Los modelos de PNL superaron significativamente el rendimiento del aprendizaje automático convencional y el BERT de dominio general.
Conclusiones:
- Los modelos clínicos de PNL afinados, como BioClinicalBERT, proporcionan una solución altamente precisa y escalable para clasificar las muertes por sobredosis a partir de informes de texto libre.
- Estos métodos de PNL pueden acelerar sustancialmente la vigilancia, superando las limitaciones de la codificación manual.
- El estudio apoya la detección casi en tiempo real de las tendencias emergentes de uso de sustancias a través de técnicas avanzadas de PNL.
Videos de Conceptos Relacionados
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
Nature and Nurture
Principles of Disease Surveillance
What is Natural Selection?
Components of Language
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...

