大型语言模型的前性比较,用于早期预测败血症
Supreeth P Shashikumar1, Shamim Nemati2
1Division of Biomedical Informatics, University of California San Diego La Jolla, California, USA, spshashikumar@health.ucsd.edu.
Pacific Symposium on Biocomputing. Pacific Symposium on Biocomputing
|December 13, 2024
概括
像Llama-3 8B这样的较小语言模型可以有效地使用临床笔记预测败血症,匹配较大的模型的性能. 这表明了资源有限的医疗保健机构在早期毒症检测方面的效率.
科学领域:
- 人工智能在医学中的应用
- 临床信息学 临床信息学
- 计算生物学 计算生物学
背景情况:
- 败血症预测的准确性对于患者的治疗结果至关重要.
- 大型语言模型 (LLM) 在分析早期疾病检测的临床笔记方面表现有前途.
- 通过使用LLM功能来增强现有的败血症预测模型,可以提高性能.
研究的目的:
- 为了比较Llama-3 8B和Mixtral 8x7B在早期败血症预测方面的性能.
- 评估一个较小的LLM能否达到与较大的LLM在败血症预测中的可比准确度.
- 评估COMPOSER-LLM系统在从非结构化的笔记中提取临床信息的有效性.
主要方法:
- 开发了COMPOSER-LLM,一种使用LLM来解释非结构化临床笔记的增强性败血症预测系统.
- 在2074名患者的接触中比较了Llama-3 8B (COMPOSER-LLMLlama) 和Mixtral 8x7B (COMPOSER-LLMmixtral).
- 使用灵敏度,正预测值 (PPV),F-1分数和每患者小时 (FAPH) 的错误报警来评估模型性能.
主要成果:
- 在回顾性和前性评估中,Llama-3 8B的性能与Mixtral 8x7B的性能相当.
- COMPOSER-LLMLlama显示了70.3%的灵敏度和44.4%的F-1得分,而COMPOSER-LLMmixtral的72.1%的灵敏度和44.2%的F-1得分.
- 展望评估显示了类似的结果,Llama-3 8B获得了68.7%的灵敏度和47.7%的F-1分数.
结论:
- 较小的LLM,如Llama-3 8B,在提取临床数据以预测败血症方面,与较大的模型一样有效.
- 拉玛-3 8B模型为在资源有限的医疗机构中早期检测败血症提供了更有效的解决方案.
- 将LLM整合到临床工作流程中可以提高预测准确性,特别是在复杂的诊断场景中.


