Video Experimental Relacionado
Updated: Feb 13, 2026

Enema of Traditional Chinese Medicine for Patients with Severe Acute Pancreatitis
Published on: January 27, 2023
Evaluación de modelos de lenguaje grande a gran escala y ligero para preguntas de examen de medicina tradicional
Yizhen Li1, Shaohan Huang2, Jiaxing Qi2
1The First Affiliated Hospital of Henan University of Chinese Medicine, Zhengzhou, China.
Los modelos de lenguaje grande (LLM) son prometedores en la Medicina Tradicional China (MTC), pero luchan con las preguntas de opción múltiple. Los LLM ligeros optimizados, como Qwen3-1.7B, ofrecen una alternativa viable para entornos de atención médica con recursos limitados.
Área de la Ciencia:
- La inteligencia artificial es inteligencia artificial.
- Procesamiento del lenguaje natural.
- La Medicina Tradicional China es una medicina tradicional china.
Sus antecedentes:
- La Medicina Tradicional China (MTC) presenta desafíos únicos para los modelos de lenguaje grande (LLM) debido a su naturaleza intensiva en conocimiento.
- Si bien existen puntos de referencia específicos para la MTC, el rendimiento de los LLM ligeros en este dominio está insuficientemente explorado.
- Este estudio evalúa y compara sistemáticamente los LLM a gran escala y los LLM ligeros para aplicaciones de TCM, teniendo en cuenta las compensaciones de implementación.
Objetivo del estudio:
- Evaluar y comparar sistemáticamente el rendimiento de varios LLM a gran escala y ligeros en tareas de preguntas y respuestas relacionadas con la MTC.
- Evaluar las capacidades y las compensaciones de despliegue de diferentes tamaños de LLM en el contexto de TCM.
- Identificar los factores que influyen en el rendimiento del LLM, como las estrategias y el lenguaje de alerta.
Principales métodos:
- Se desarrolló un conjunto de datos de 801 preguntas relacionadas con la MTC a partir de libros de texto.
- Se evaluaron once LLMs utilizando el impulso de tiro cero y pocos disparos tanto en inglés como en chino.
- El rendimiento se midió principalmente por la precisión, con un enfoque en diferentes tipos de preguntas y categorías de razonamiento.
Principales resultados:
- Los LLM a gran escala sobresalieron en las preguntas de opción única y verdadero/falso, pero tuvieron un rendimiento inferior en las preguntas de opción múltiple.
- Los LLM ligeros generalmente se quedaron atrás de los modelos más grandes, con Qwen3-1.7B mostrando un rendimiento competitivo, incluso superando al especializado TCMChat-7B.
- Las indicaciones de pocos disparos y las indicaciones chinas generalmente mejoraron el rendimiento de LLM, mientras que el diagnóstico sintomático demostró ser la tarea de razonamiento más desafiante.
Conclusiones:
- Los LLM a gran escala demuestran un fuerte recuerdo del conocimiento en la MTC, pero sus limitaciones en tareas de opción múltiple y altos costos computacionales pueden dificultar la aplicación clínica.
- Los LLM ligeros optimizados, ejemplificados por Qwen3-1.7B, sugieren que la optimización del modelo y la capacitación específica del dominio son más ventajosas que simplemente aumentar el tamaño del modelo.
- Los hallazgos ofrecen ideas para implementar LLMs optimizados en entornos de atención médica con recursos limitados, aunque se justifica una mayor evaluación en la toma de decisiones clínicas en el mundo real.
Videos de Conceptos Relacionados
Language
Corballis and Suddendorf (2007) and Tomasello and Rakoczy (2003) highlight the role of language in...
pH Scale
Components of Language
Language Development
The critical period for language acquisition suggests that the ability to acquire language is at its peak early in life. As people age, this proficiency decreases. Language development begins very...
Language and Cognition
Self-Evaluation Maintenance Model

