Video Experimental Relacionado
Updated: May 6, 2026

Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
Una comparación de la idoneidad de los elementos generados por 4 grandes modelos de lenguaje para la certificación
Gary W Procop1, Anthony Schlinsog1, Colette Earnest1
1The American Board of Pathology, Tampa, FL, United States.
Se evaluaron cuatro modelos de lenguaje grande (LLM) de inteligencia artificial para la creación de artículos de certificación de la Junta Americana de Patología (ABPath). Claude y ChatGPT demostraron un rendimiento superior en comparación con Llama y Titan, destacando la necesidad de una selección cuidadosa de LLM.
Área de la Ciencia:
- La informática médica es la informática médica.
- Inteligencia Artificial en la Educación
- Patología Certificación Continuada de Patología.
Sus antecedentes:
- La certificación continua requiere elementos de evaluación de alta calidad.
- Los modelos de lenguaje grande (LLM) de inteligencia artificial ofrecen potencial para la generación de elementos.
- Es crucial evaluar el rendimiento del LLM en comparación con los estándares establecidos.
Objetivo del estudio:
- Evaluar la capacidad de cuatro LLM para generar elementos de evaluación que cumplan con los estándares de la Junta Americana de Patología (ABPath).
- Para comparar el rendimiento de diferentes LLMs en la creación de artículos de exámenes escritos y prácticos.
Principales métodos:
- Una aplicación informática utilizaba instrucciones basadas en los estándares de escritura de elementos de ABPath.
- Expertos en la materia (PYMES) evaluaron los elementos generados por LLM (escrito y práctico) para la estructura, precisión, relevancia y dificultad.
- Las pymes estaban ciegas a la fuente de LLM de cada elemento.
Principales resultados:
- Claude obtuvo las puntuaciones más altas tanto en los temas escritos (86,1%) como en los prácticos (92,9%).
- ChatGPT siguió, con una puntuación del 79,7% para artículos escritos y del 81,2% para artículos prácticos.
- Llama (65,8% escrito, 65,8% práctico) y Titan (60,9% escrito, 56,8% práctico) obtuvieron puntuaciones significativamente más bajas.
Conclusiones:
- Existen variaciones significativas en el rendimiento de LLM para generar elementos de evaluación compatibles con ABPath.
- Los usuarios deben evaluar LLMs específicos para asegurarse de que cumplen con los requisitos de la tarea.
- Asumir la equivalencia de LLM no es aconsejable para la generación de artículos especializados.
Videos de Conceptos Relacionados
Classification of Illness
An illness is a response to a disease in which the person's level of functioning is changed compared with a previous level. The general classification of illness includes acute and chronic.
Acute illness is severe...
Introduction to Language of Pathophysiology l
Introduction to Language of Pathophysiology ll

