评估大型语言模型是否符合中医临床实践指南:内容分析
Weilong Zhao1, Honghao Lai1, Bei Pan2
1Department of Health Policy and Management, School of Public Health, Lanzhou University, Lanzhou, China.
Frontiers in pharmacology
|August 11, 2025
概括
大型语言模型 (LLM) 显示了传统中医 (TCM) 知识获取的潜力,其中DeepSeek-v3和DeepSeek-r1表现最好. 需要进一步优化,以提高LLM在传播TCM信息方面的有效性.
科学领域:
- 人工智能的人工智能
- 医疗信息学 医疗信息学
- 传统中国医药 传统中国医药
背景情况:
- 大型语言模型 (LLM) 在促进传统中医 (TCM) 知识获取方面的有效性在很大程度上仍未被探索.
- 评估LLM对临床实践指南 (CPG) 的遵守对于其在TCM中的可靠应用至关重要.
研究的目的:
- 评估各种LLM对传统中医药 (TCM) 中确立的临床实践指南 (CPG) 的遵守情况.
- 为了比较不同LLM在理解和响应TCM相关查询方面的表现.
主要方法:
- 一项涉及十个随机选择的TCM CPGs的横截面研究.
- 在三个类别中制定了150个问题:基于差异诊断 (MDD) 的药物治疗,特定处方咨询 (SPC) 和TCM理论分析 (CTA).
- 通过英语和中文查询评估了8个LLM,其中准确性,可读性和安全性免责声明作为关键指标.
主要成果:
- 在英语和中文查询中,DeepSeek-v3和DeepSeek-r1表现出卓越的性能,优于其他模型.
- 所有的LLM都显示,与英语查询相比,中文查询的准确性明显更高 (p < 0.05).
- MDD和SPC问题比CTA问题更具挑战性;英语答案的可读性较低,Moonshot-v1提供了最高的安全性免责声明率.
结论:
- 在TCM知识获取方面,LLM具有可变的潜力,DeepSeek-v3和DeepSeek-r1表现出令人满意的表现.
- 优化LLM对于其发展成为传播TCM信息的有效工具至关重要.
- 进一步的研究应该集中在提高LLM准确性和安全性,在专业的医疗领域,如TCM.
更多相关视频
05:19Author Spotlight: An Effective Traditional Chinese Medicinal Treatment for Chronic Obstructive Pulmonary Disease with Abdominal Distension
Published on: September 1, 2023
1.6K
03:14Augmenting Large Language Models via Vector Embeddings to Improve Domain-Specific Responsiveness
Published on: December 6, 2024
681
