在中风中传统中医学的大语言模型评估:定量基准研究研究
Hulin Long1, Yang Deng2, Yaoguang Guo1
1Hospital of Chengdu University of Traditional Chinese Medicine, Chengdu, Sichuan Province, China.
JMIR formative research
|December 11, 2025
概括
以中文为中心的大型语言模型 (LLM) 在传统中医 (TCM) 知识回忆方面表现出色,而通用LLM在复杂的推理任务中表现更好. 本研究使用TCM-SED基准评估了LLM.
科学领域:
- 医疗信息学 医疗信息学
- 人工智能在医学中的应用
- 传统中医研究 传统中医研究
背景情况:
- 大型语言模型 (LLM) 越来越多地应用于医学,但在传统中医 (TCM) 等专业领域评估它们的有效性,由于TCM独特的理论框架,提出了挑战.
- 在TCM中评估LLM绩效需要特定领域的基准,以捕捉其独特的知识和推理要求.
研究的目的:
- 在中国传统医学 (TCM) 专业领域内实证评估不同类型的大型语言模型 (LLM) 的能力.
- 建立一个基准数据集来评估在TCM的LLM表现.
主要方法:
- 开发了传统中医中风评估数据集 (TCM-SED),这是一个涵盖诊断,治疗,草药配方,针,古典文本解释和患者沟通的203个问题基准.
- 包括简短答案,多项选择和散文问题格式,以评估各种认知水平.
- 评估了两个代表性的LLM:GPT-4o (通用) 和DeepSeek-R1 (以中国为中心),使用专家验证的黄金标准答案.
主要成果:
- 在客观知识回忆任务中,DeepSeek-R1显著超过了GPT-4o,在多选题中获得了超过17%的更高准确度.
- GPT-4o在需要知识整合和复杂推理的任务中表现出卓越的表现,例如解释经典的TCM文本,得分为90.5%,而DeepSeek-R1的73.5%.
结论:
- 以中国为中心的LLM在TCM内的静态知识任务中表现出优势,而通用LLM在动态推理和内容生成方面表现出色.
- TCM-SED是评估和选择TCM应用程序的LLM的有效定量工具,为未来的模型开发和优化提供了基础.


