Performance Gaps and Optimization Strategies in Chinese Medical Large Language Models Based on MedBench: Evaluation

Luyi Jiang1, Jiayuan Chen2, Lu Lu2

  • 1Shanghai Health Development Research Center (Shanghai Medical Information Center), Shanghai Institute of Infectious Disease and Biosecurity, Fudan University, Shanghai, China.

JMIR AI
|July 15, 2026
PubMed
Summary

A new error taxonomy reveals significant weaknesses in medical large language models (LLMs), particularly in critical reasoning tasks. This study provides a roadmap to improve LLM accuracy, safety, and trustworthiness in healthcare.