大型语言模型在倡导脑膜炎管理方面的表现:一个比较的定性研究
Urs Fisch1, Paulina Kliem2, Pascale Grzonka2
1Department of Neurology, University Hospital Basel, Basel, Switzerland urs.fisch@usb.ch.
BMJ health & care informatics
|February 2, 2024
概括
大型语言模型 (LLM) 显示对细菌脑膜炎指南的遵守程度各不相同,GPT-4表现最好. 用户应谨慎对待人工智能产生的医疗建议中的潜在不准确性.
科学领域:
- 医疗信息学 医疗信息学
- 医疗保健中的人工智能
- 临床决策支持 临床决策支持
背景情况:
- 大型语言模型 (LLM) 越来越多地被用于医疗保健应用.
- 评估LLM遵守既定医疗指南对于安全实施至关重要.
研究的目的:
- 评估各种LLM在与细菌性脑膜炎病例相遇时的准确性和准则遵守程度.
- 确定LLM在支持传染病医疗决策方面的实用性和局限性.
主要方法:
- 对七名LLM (Bard,Bing,Claude-2,GPT-3.5,GPT-4,Llama,PaLM) 进行了细菌性脑膜炎的假设临床情景.
- 针对良好的临床实践和国际脑膜炎指南进行了评估.
主要成果:
- 在90%的病例中,LLM正确识别了中枢神经系统感染,并推成像 (100%) 和腰部穿刺 (81%).
- 经验性抗生素治疗仅在38%的会议中是正确的,其他治疗建议 (例如抗病毒药物,德甲) 有显著的变化.
- 在52%的会议中产生了误导性陈述;GPT-4显示了最高的性能.
结论:
- LLM为诊断提供了有价值的见解,但在细菌性脑膜炎的治疗建议中表现出显著的变化和不准确性.
- LLM的性能依赖于算法,而不是输出长度,用户必须意识到他们在医疗决策支持方面的局限性.


