Video Experimental Relacionado
Updated: Jan 7, 2026

Objectification of Tongue Diagnosis in Traditional Medicine, Data Analysis, and Study Application
Published on: April 14, 2023
Impacto del Ruido de Etiquetas de las Anotaciones Generadas por Modelos de Lenguaje Grandes en la Evaluación del
Mohammadreza Chavoshi1, Hari Trivedi1, Aawez Mansuri1
1Department of Radiology and Imaging Sciences, Emory University School of Medicine, 1364 Clifton Rd NE, Atlanta, GA 30322.
Los modelos de lenguaje grandes (LLM) pueden introducir un sesgo significativo al etiquetar datos para la evaluación de modelos de inteligencia artificial (IA). Asegurar una alta especificidad de LLM es crucial, especialmente en escenarios de baja prevalencia, para evitar subestimar el rendimiento de la IA.
Área de la Ciencia:
- Inteligencia Artificial
- Evaluación de Aprendizaje Automático
- Informática Médica
Sus antecedentes:
- La evaluación de modelos de clasificación binaria de inteligencia artificial (IA) se basa en el etiquetado preciso de datos.
- Los modelos de lenguaje grandes (LLM) se utilizan cada vez más para la anotación de datos, pero su potencial para introducir ruido en las etiquetas es una preocupación.
Objetivo del estudio:
- Investigar sistemáticamente el impacto del ruido de etiquetas generado por LLM en la evaluación del rendimiento en el mundo real de los modelos de clasificación binaria de IA.
- Cuantificar cómo los errores de etiquetas de LLM, modulados por la prevalencia de la enfermedad, afectan la precisión de la estimación del rendimiento del modelo de IA.
Principales métodos:
- Se desarrolló un marco de simulación utilizando un conjunto de datos sintético (10 000 casos) en diversas condiciones de prevalencia (del 10% al 90%).
- Se variaron independientemente la sensibilidad y especificidad de los LLM, y se simularon modelos de IA con rendimiento conocido.
- El rendimiento aparente del modelo se calculó utilizando etiquetas generadas por LLM, y se utilizaron métodos analíticos y de Monte Carlo para determinar los límites y la incertidumbre del rendimiento.
Principales resultados:
- La calidad de las etiquetas de LLM impactó significativamente el rendimiento aparente del modelo de IA, con un sesgo fuertemente dependiente de la prevalencia de la enfermedad.
- En entornos de baja prevalencia (10%), la reducción de la especificidad de los LLM condujo a una subestimación sustancial de la sensibilidad del modelo de IA (por ejemplo, una especificidad de LLM del 90% resultó en una sensibilidad aparente de ~53% para un modelo perfecto).
- En entornos de alta prevalencia (90%), la reducción de la sensibilidad de los LLM causó una subestimación de la especificidad del modelo de IA (por ejemplo, una sensibilidad de LLM del 90% arrojó una especificidad aparente de ~53% para un modelo perfecto).
Conclusiones:
- Las etiquetas generadas por LLM pueden introducir un sesgo sistemático y dependiente de la prevalencia en la evaluación del modelo de IA.
- La alta especificidad de los LLM es fundamental para una estimación precisa del rendimiento en tareas de baja prevalencia para evitar que los falsos positivos sesguen desproporcionadamente la sensibilidad.
- La consideración cuidadosa de la calidad de las etiquetas de LLM y la prevalencia es esencial para una evaluación confiable del modelo de IA.
Videos de Conceptos Relacionados
Survival Tree
Building a Survival Tree
Constructing a...
Detection of Gross Error: The Q Test
Documentation of Nursing Diagnosis
In some settings, data-driven computerized decision support systems are in place, allowing for more accurate nursing diagnoses. The database within one of these systems includes diagnostic labels defining characteristics, activities, and indicators for nursing. A nurse enters...
Labeling DNA Probes
Radioisotopes, fluorophores, or small molecule binding partners like biotin or digoxigenin, are the most widely used reporter tags for labeling DNA probes. These labels can be attached to the probe DNA molecule via...
Formulating and Validating Nursing Diagnosis I
There are thirteen domains...
Sensitivity, Specificity, and Predicted Value
Sensitivity is the...
