评估用于中风护理的生成性大语言模型的性能
John Tayu Lee1,2, Vincent Cheng-Sheng Li3, Jia-Jyun Wu3,4
1Department of Global Health and Population, Harvard T.H. Chan School of Public Health, Harvard University, Boston, Massachusetts, USA. johntayulee@ntu.edu.tw.
NPJ digital medicine
|July 29, 2025
概括
生成型的大型语言模型 (LLM) 在预防,诊断,治疗和康复方面在中风护理方面表现不一致. 像说出你的想法 (TOT) 和思维链 (COT) 这样的快速工程技术提供了特定的好处,但并不总是符合临床标准.
科学领域:
- 人工智能在医学中的应用
- 神经学 神经学
- 医疗保健技术 技术 医疗保健 技术
背景情况:
- 脑卒中是一个重大的全球健康挑战,特别影响社会经济地位较低的人口.
- 生成型大语言模型 (LLM) 越来越多地被用于医疗保健应用.
- 评估LLM在重症监护途径 (如中风管理) 的表现是必不可少的.
研究的目的:
- 评估三个领先的生成型LLM (GPT,Claude,Gemini) 在管理中风护理方面的能力.
- 为了比较不同的提示工程技术 (零射击学习,思维链,说出你的想法) 在中风场景中的LLM应用的有效性.
- 通过对整个中风护理连续的临床能力标准进行LLM绩效的比较.
主要方法:
- 在现实中风场景中测试了LLM,包括预防,诊断,治疗和康复.
- 系统地应用了三个快速工程技术 (ZSL,COT,TOT).
- 临床专家根据准确性,幻觉,特异性,同理心和可操作性评估了LLM输出.
主要成果:
- 总体而言,LLM的表现不足以达到最佳水平,在各个评估领域都有显著的变化.
- 说出你的想法 (TOT) 技术在同情和可操作性方面表现出色.
- 思想链 (COT) 在诊断推理方面表现出强大,而零射击学习 (ZSL) 提供了简洁,准确的反应,幻觉较少,特别是在治疗中.
- 没有任何一种即时工程方法在所有中风治疗阶段始终达到高临床标准.
结论:
- 目前的生成性LLM在为中风护理提供始终可靠和临床合理的支持方面存在局限性.
- 快速工程策略可以增强特定的LLM能力,但不能完全克服绩效差距.
- 在LLM在中风管理中的广泛临床采用之前,需要进一步开发和严格验证.
更多相关视频
05:47Evidence-based Knowledge Synthesis and Hypothesis Validation: Navigating Biomedical Knowledge Bases via Explainable AI and Agentic Systems
Published on: June 13, 2025
584
10:15Utilizing Repetitive Transcranial Magnetic Stimulation to Improve Language Function in Stroke Patients with Chronic Non-fluent Aphasia
Published on: July 2, 2013
18.0K
